策略

2025年初企业AI支出趋势分析

2025 年上半年,是企业 AI 支出从研究预算转变为资本配置问题的半年。在大型组织中呈现出的模式高度一致:钱没有流向更多试点,而是流向了让既有试点能在生产环境中活下来的基础设施、数据地基与治理。这是一个健康的信号,因为它意味着实验阶段已经产出了足以支撑建设阶段的证据——但它也制造了一个新问题:基础设施支出容易获批,却很难归属到收入上。

本文说明钱流向了哪里、结构为何改变、哪些行业领先、推理经济学如何改变了计算方式,以及财务负责人在年内后续阶段应当关注什么。它是为那些必须在预算评审中捍卫这个数字的人写的,而不是为提出这个数字的人写的。

2025 年上半年企业 AI 资金流向了哪里?

综合来自分析机构、云厂商与企业调研的公开信息,五个方向吸收了绝大部分支出,而这个排序本身就是结论。

1. 数据地基与集成。最大也最不耀眼的一项。在一个模型能可靠回答一个问题之前,底层数据必须可访问、有定义、且是当前的。组织在 2024 年以惨痛的方式明白了这一点——那些建立在数据抽取之上的试点,在生产规模上全线失败。这里的支出覆盖连接器、语义层、数据目录,以及让它们协同工作所需的工程。它同时也是最容易被低估的一项,因为它看起来像管道工程。

2. 算力——尤其是推理。2023 与 2024 年,训练占据了头条;2025 年,推理占据了预算。一旦系统投入生产,你就要为每一个被回答的问题永远付费,而这个成本随使用量增长的方式,会让那些按"训练跑批"来做预算的团队大吃一惊。

3. 人才与赋能。两个经济性截然不同的部分:一小批昂贵的专家,以及数量庞大、需要改变工作方式的现有员工。后者规模更大,而且在大多数组织中,相对于它对采纳度的影响而言,投入不足。

4. 治理、安全与合规。由监管驱动,而非热情驱动。模型风险管理、评估框架、审计轨迹与数据保护控制,都成了有具名负责人的预算科目。

5. 应用支出。买而非建,尤其是在客服、销售、文档处理与内部知识这类横向场景上——在这类场景,自建还是采购的算术已经决定性地倒向采购。

值得注意的缺席者是试点。组织并没有停止试验;它们停止的是把试验当作一个独立类别来资助,而是把它们并入产品预算,与其他一切在同一起跑线上竞争。这是数字中最重要的一项结构性变化。

为什么支出从实验转向了基础设施?

因为失效模式变了。2023 与 2024 年,AI 项目失败是因为技术做不到那件事;到 2025 年初,项目失败的原因变成了组织性的,而恰恰是钱能解决的:数据不可访问、定义有争议、生产环境里没有人拥有这个模型,或者单笔交易成本让单位经济学不成立。

三个机制推动了这次重新配置。

试点炼狱变得可见。高管们能够数出有多少个概念验证走到了生产,而这个数字低到触发了治理反应。典型的补救措施是:在既有组合被分诊之前,停止资助新项目——这就把预算从实验重定向到了那些实验所依赖的地基上。

单位经济学逼出了这个问题。一个试点几乎可以吸收任何单次查询成本;一个生产系统不行。一旦财务问起单笔交易成本,团队就会发现真正的约束不是模型质量,而是数据检索与编排效率。

监管截止日期到来了。有固定日期的合规义务不会等待热情。治理支出是由截止日期驱动的,这也正是它出现在预算里的速度快于出现在路线图里的原因。

哪些行业投入最多,为什么?

这个排序跟随的是"决策变快"的价值,而不是该行业 IT 预算的规模。

  • 金融服务领先,因为风险与欺诈决策频次高、价值高,而且已经被充分埋点。覆盖银行卡、支付与账户接管向量的实时欺诈评分,回报清晰且可度量:误报率每降低一个基点,既是成本节约,也是客户体验收益。
  • 零售与消费品紧随其后,集中在需求预测、库存分配与个性化上。它带来的回报是营运资金与毛利,而非人效,这让它对 CFO 很有吸引力。
  • 制造业投向质检与预测性维护——在这些领域,资产基数让停机变得昂贵,而传感数据本来就已存在。
  • 医疗与生命科学投入更慢,但每个项目的治理开销更高,这既反映了监管环境,也反映了"出错的代价"。
  • 专业服务投向文档密集型工作流——合同分析、尽职调查、监管报送——其价值单位是一小时的专家时间。

共同点是:决策频次高、已有埋点、且"慢"的代价可度量的行业,投入最早也最多。决策周期长、数据稀疏的行业选择等待是正确的——而「愿意等」这种纪律本身,就是相对于前一年的进步。

是什么在驱动推理成本曲线?

三股力量朝相反方向拉扯,而净结果决定了你的单位经济学是否成立。

单位成本所对应的模型能力大幅提升。更小的模型在窄任务上变得明显更好,蒸馏与量化也让服务成本更低。2024 年需要前沿模型才能做的任务,到 2025 年初往往可以用便宜一个数量级的模型完成,而且在定义清晰的工作上质量相当。

使用量的增长快于效率的提升。这就是杰文斯悖论在推理上的版本:单次查询成本下降,查询量的增长却快于节省额。那些按"查询量稳定"来做预算的团队无一例外都错了,因为一项 AI 能力一旦变得有用,使用量就会向相邻工作流扩张。

上下文长度成为成本驱动因素。检索增强系统把 token 花在上下文上,而不是花在生成上。切分不当或检索过宽,其成本可能超过答案本身。这已成为生产系统中最大的可控成本之一,而且它是一个工程决策,不是一个采购决策。

务实的应对是路由:把每个请求发给能满足质量门槛的最便宜模型;激进地做缓存;把检索收窄;并度量"每个成功结果的成本",而不是"每个 token 的成本"。做到这些的组织,通常能在不出现质量退化的前提下把推理支出砍掉一半。

为什么智能体 AI 的预算出现得如此突然?

因为技术前置条件到齐了。智能体是一个能够跨步骤规划、调用工具、观察结果并从错误中恢复的系统。它需要可靠的函数调用、一组受治理的工具,以及足以让人信任这个循环的评估基础设施。这些能力在 2024 年下半年成熟,因此预算在 2025 年初跟上。

智能体项目内部的支出结构很有启发:大部分花在工具与集成上,而不是花在模型上。这再次印证了数据地基那一桶所教出的同一课——模型很少是约束。限制一个智能体的,是它能否以正确的权限触达正确的系统,并拿回一个可信的答案。

风险在于可预测性。一个会循环的智能体,成本高于单次调用;而一个循环失控的智能体,可能在失败之前花掉大量钱。请为硬迭代上限、单次运行的成本天花板,以及高价值动作上的人工审批编列预算。这些都是低成本的控制手段,也正是"一次受控实验"与"一张令人不适的账单"之间的差别。

企业如何为 AI 支出筹资?

四种模式,而选择哪一种,本身就暴露了承诺的认真程度。

中央创新预算。早期阶段常见。它加速探索,但制造了交接问题:没有任何东西被资助去「运维」,于是成功的试点无处可去。2025 年仍把它作为主要机制的组织,正是生产转化率最低的那些。

业务单元出资。业务线负责人付钱,因此也拥有结果。这能产生最好的商业论证,也产生最碎片化的架构,因此需要一个中央平台团队来防止重复建设。

平台出资 + 内部结算。中央团队建设数据与工具地基,业务单元按使用量付费。这在成熟组织中日益成为默认模式,因为它资助了那个"没有别人愿意付钱"的共享层,同时把问责留在消费方。

从既有科目中重新分配。静默的大多数。AI 支出常常表现为别处的缩减——外包的分析服务、人工处理成本,或许可证整合。这是健康的,也正是头条上的 AI 预算数字低估真实投资规模的原因。

究竟存在哪些可信的投资回报证据?

这里要谨慎,因为厂商主张与实测结果之间的鸿沟很宽。可以站得住脚的是:

  • 周期时间缩短是度量得最可靠的一项收益。在基线为人工的文档审查、代码审查与报表任务上,时间缩短幅度大且可重复。
  • 风险与欺诈场景中的误报下降可以直接折算成钱。每一笔被误拒的合法交易、每一次不必要的人工复核,都有已知成本。
  • 营运资金与库存效应是真实的,但更慢。预测改善以季度而非周为单位显现,而且很容易与需求变化混淆。
  • 个性化的收入效应是真实的,但难以归因。麦肯锡的个性化研究发现,个性化做得好的公司比同行平均多产生约 40% 的收入,但这一溢价反映的是多项投资,AI 只是其中之一。
  • 人效削减是最不可靠的一项主张。大多数组织是重新配置人力而非裁减,收益表现为成本增长的避免,而不是成本的下降。

把可信的项目与乐观的项目区分开的,是反事实设计。请在与建设同步的时间点资助度量工作——基线、对照组,以及一个对数字具名的负责人;否则在下一个预算周期,你将无法为这笔投资辩护。

钱最常浪费在哪些地方?

该用检索时却做了微调。微调适用于行为与风格,不适合用来注入事实。为了教会模型"它本可以检索到的东西"而微调的团队要付两次钱——一次在训练时,一次在事实变化时。

自建了本可以买到的东西。文档抽取、客服摘要、内部搜索这类横向能力已经是商品。自建意味着选择永远拥有维护责任,而这很少能被「差异化」所正当化。

上下文供给过量。明明三段话就够,却把整份文档发出去,这是最常见的一项可避免的推理成本。

地基重复建设。三个业务单元各自采购自己的向量库、数据目录与评估框架,是一个常见且昂贵的模式,也正是设立平台团队最强的理由。

把治理做成文档。没有人在代码里执行的政策并不降低风险,它只是留下了一条「你早已知情」的纸面轨迹。请把钱花在自动化执行上。

靠热情续期的、无法度量的试点。一个说不出自身反事实的试点应当被停止,而不是被延长。停止是一个正当的结果,而且通常是为更好的东西筹资最快的方式。

财务负责人在下半年应该盯住什么?

六项指标,按优先级排序:

  • 生产转化率。已获资助的 AI 项目中,带有具名运维负责人、真正在生产环境运行的比例。如果这个数字不上升,追加预算也无济于事。
  • 每个成功结果的成本。不是每个 token 的成本。这才是决定一个用例能否在规模化后活下来的数字。
  • 推理支出对比预算。要预期由使用量增长带来的超支;真正的问题是这些超支是否产出了价值。
  • 共享地基支出占比。太低意味着碎片化,太高意味着一个没有消费方的平台。两者都是失败。
  • 已度量收益的覆盖率。凡是重要的用例中,具备基线与反事实设计的比例。目标应当接近 100%。
  • 目标用户中的采纳率。不是发放了多少许可证,而是周活跃用户占目标人群的比例及其趋势。

领导者现在应该如何重新配置?

三个动作,按顺序。第一,在下一次建设之前先资助反事实度量:基线与对照组相对于它们所保护的预算来说很便宜。第二,把推理支出从"更大的模型"转向"更好的检索与路由"——更窄的上下文既更便宜,也更准确。第三,把重复建设的地基整合进一个带内部结算的平台,让共享层有人付钱,同时让业务单元继续对结果负责。

在数据层成为瓶颈的地方——而在大多数组织中情形正是如此——通往可辩护回报最快的路径,是让既有数据回答更多问题,而不是获取更多能力。蜂启咨询(Beehive Strategy)的平台正是基于这一前提构建的:它通过 MCP 连接器与语义层接入既有系统,使查询能够针对实时的、受治理的数据解析,并通过团队日常使用的即时通讯工具交付答案。以托管服务方式约两周即可部署,它能在不做数仓项目的前提下,把基础设施支出转化为可度量的决策速度——这恰恰是 2025 年上半年的支出数据所表明的钱应该去做的事。

常见问题

五个方向吸收了绝大部分:数据地基与集成,是最大也最不耀眼的一项;算力,其中推理已取代训练成为主导成本;人才与赋能,其中主体是培训现有员工而非聘请专家;治理、安全与合规,由固定的监管截止日期驱动;以及用于买而非建的横向能力的应用支出。值得注意的缺席者是独立的试点预算——它们被并入产品线,与其他一切在同一起跑线上竞争。

主导性的失效模式变了。项目不再因为技术做不到而失败,而是因为可以用钱解决的组织性原因而失败:数据不可访问、业务定义有争议、生产环境无人拥有该模型、或单笔交易成本让单位经济学不成立。高管开始能看清「试点炼狱」,财务问起单笔交易成本时单位经济学问题被逼出水面,而有固定日期的监管义务又不等待热情。

金融服务领先,因为风险与欺诈决策频次高、价值高且已被充分埋点。零售与消费品紧随其后,集中在需求预测、库存分配与个性化上,回报体现为营运资金与毛利。制造业投向质检与预测性维护;医疗与生命科学投入更慢但治理开销更重;专业服务则投向文档密集型工作流,其价值单位是一小时的专家时间。

三股力量朝相反方向拉扯:随着更小的模型在窄任务上变得更好,单位成本所对应的能力大幅提升;使用量的增长快于效率的提升,因此单次查询成本的下降被查询量的上涨所淹没;以及上下文长度成为主要成本驱动因素,因为检索增强系统把 token 花在上下文而非生成上。务实的应对是路由到满足质量门槛的最便宜模型、激进缓存、收窄检索,并度量每个成功结果的成本。

共有四种模式在用。中央创新预算加速探索,但没有任何东西被资助去运维,因此生产转化率受损。业务单元出资能产生最好的商业论证,也产生最碎片化的架构。平台出资加内部结算正成为成熟组织的默认模式,因为它支付了那个没人愿意付钱的共享层,同时把问责留在消费方。最常见的是从既有科目静默重新分配,例如外包分析服务或人工处理成本。

在人工基线的文档审查、代码审查与报表任务上,周期时间缩短是度量得最可靠的一项。欺诈与风险场景中的误报下降可直接折算成钱,因为每次不必要的拒付或人工复核都有已知成本。营运资金与库存效应真实但缓慢,且容易与需求变化混淆。个性化收入效应真实但难以归因,因为优秀个性化者享有的溢价来自多项投资。人效削减最不可靠,因为多数组织是重新配置人力而非裁减。

反复出现的模式包括:为注入本可通过检索获得的事实而做微调;自建本可采购的横向能力;上下文供给过量——明明三段话就够却发送整份文档;地基重复建设,三个业务单元各自采购向量库与评估框架;把治理写成无人用代码执行的文档;以及靠热情而非明确的反事实设计来续期无法度量的试点。

预约个性化演示

准备好改变您的数据策略了吗?

了解蜂启咨询的对话式分析平台如何在整个运营中解锁实时洞察——从上游数据到下游决策。

预约演示 了解解决方案
3x
典型首年 ROI
78%
更快解决查询
92%
6 个月内采用率
50+
数据连接器