把收益和成本放在一起以后,AI 项目应该怎样算账?

Putting gains and costs together: how to do the math on an AI project

前两篇分别算了企业 AI 的两边账。

第一篇问:

AI 提高效率以后,企业到底得到了什么?

我们一路从 task improvement 追到 workflow、capacity 和最终 value capture。

第二篇问:

AI 的成本,应该算到哪里?

模型和 API 当然要算,但完整 workflow 里还有数据、集成、eval、人工审核、监控、失败处理和长期维护。

到这里,看起来好像终于可以把两个数字放进公式里:

(收益 − 成本)÷ 成本 = ROI

可 research 真正做到这里以后,我反而觉得:

最需要小心的,正是给“企业 AI”一个统一答案。

01|为什么很难得到一个「企业 AI 平均 ROI」?

因为“企业 AI”本身就不是一个足够具体的经济单位。

  • 客服助手和 coding assistant 不一样。
  • 给消费者提供售前 chatbot,和让财务团队使用知识助手不一样。
  • 一个每天发生百万次、结果容易检查的任务,和每月只发生几次、失败一次就很严重的任务,也不能用同一套数字去比较。
  • 甚至在同一个 coding 领域里,可信研究都可以得到看起来相反的结果。

一项覆盖三家公司、4,867 名开发者的随机实验发现,使用 AI coding assistant 后,完成任务数量平均增加约 26%。

METR 在另一项真实任务实验里,却发现一群熟悉成熟代码库的资深开发者,在当时工具条件下使用 AI 后耗时增加了约 19%。

两个研究并不一定谁对谁错。

人不同。任务不同。代码库不同。模型和工具不同。测量方式也不同。

所以 research 最后一个很重要的结论是:

AI 的经济效果高度依赖任务、baseline、使用者和工作流。

我们可以研究一个具体 use case。

却很难把它直接升级成:

“AI 平均可以带来多少 ROI?”

更现实的问题可能是:

一个具体 AI workflow,在什么条件下值得继续放大?

02|规模化以前,先看五件事

完整 research 里没有一个经过跨行业验证的万能 ROI 公式。

但不同证据反复出现了一些条件。

我会把它们整理成五个问题。

第一,有没有真实、持续的需求?

AI 很容易增加供给。

生成更多文案、更快写代码、一次回答更多问题。

但如果没有真实需求,更多产出本身没有经济价值。

第一篇提过的零售实验里,售前 chatbot 能够带来明显销售提升,一个重要原因就是原来确实存在大量没有被满足的消费者咨询。

AI 降低了提供服务的成本以后,这部分真实需求被接住了。

反过来,如果团队已经没有更多任务、客户也不需要更多产出:

即使 productivity 很漂亮,也未必值得为了“更多”继续扩张系统。

所以第一个问题很朴素:

如果 AI 帮我多做 30%,有人真的需要这 30% 吗?

第二,什么叫一个「合格结果」,能不能判断?

一个 AI demo 很容易看起来不错。

规模化以后,真正麻烦的是:

怎样知道它每次都做对了?

BCG 的实验曾经出现一个很有提醒意义的结果。

在适合当时模型能力的任务上,AI 能改善表现。

但在一个超出能力边界的复杂管理任务上,AI 组给出正确建议的概率反而平均低了约 19 个百分点。

这不是说“AI 不适合咨询”。

它说明:

流畅、完整、听起来有道理,不等于业务结果正确。

如果一个 workflow 连“什么叫成功”都没有办法定义,规模化以后就很难真正测:

  • 成功率是多少?
  • 人工需要检查多少?
  • 每个合格结果究竟多少钱?

这也是为什么我现在觉得:

验收标准不是 AI 项目上线后的 QA 工作,而是 business case 的一部分。

第三,失败能不能被发现和恢复?

任何系统都会失败。

经济上更重要的问题不是:

能不能做到 100% 自动?

而是:

失败发生时,我们能不能知道;知道以后,要花多大代价处理?

  • 一个错误商品描述可能改掉就好。
  • 一封发错的营销邮件可能影响品牌。
  • 一个错误的财务判断,成本可能完全不同。

所以同样是 95% accuracy:

剩下 5% 的经济含义可以差很多。

  • 有些任务可以让 AI 先做,失败后轻松转人工。
  • 有些任务的错误很难检测,一旦发生又非常昂贵。

这也是为什么平均成功率本身,经常不够。

失败成本和恢复路径,也要进入 economics。

第四,整个 workflow 能不能真正利用 AI 的改善?

第一篇已经讲过:

task 变快,不代表 business 结果自动变好。

这个问题到了规模化阶段会更重要。

如果 AI 让代码生成速度翻倍,但 review 和测试完全没有改变:

增加更多 coding-agent capacity,不一定继续增加产品交付。

如果客服助手已经让等待队列消失了:

再增加 20% 的处理能力,边际价值也可能大幅下降。

所以规模化不是单纯:

已经有效 → 多买一些。

而应该继续问:

瓶颈现在在哪里?

AI 解决了原来的瓶颈以后,很可能只是把新的瓶颈暴露出来。

第五,把完整成本算进去以后,单位经济性还成立吗?

这才接到上一篇。

假设一个 AI 系统:

  • 确实有需求;
  • 输出能够验收;
  • 错误能够恢复;
  • workflow 也能利用新增能力。

最后还是要回到一个很普通的商业问题:

完成一个真正合格的结果,比原来的方式更好吗?

这里的“更好”不一定只是更便宜。

可以是:

  • 同样成本,服务更多客户;
  • 多花一点钱,但明显增加收入;
  • 成本差不多,但错误更少;
  • 成本更高,却让企业第一次获得一种非常有价值的新能力。

如果一定要先看最硬的现金部分,research 里采用的是这种思路:

净现金收益 = AI 真正带来的现金好处 − AI 真正增加的现金代价

这里我很喜欢的一点是:

释放的员工时间,不要强行塞进去。

如果它真的变成避免招聘、减少加班或者更多收入,再进入现金收益。

如果只是释放出 capacity,就单独记录。

这样不会为了让 ROI 好看,把所有“理论工资时间”提前变成现金。

03|哪些场景现在的证据相对更清楚?

Research 最后没有做一个“AI ROI 行业排行榜”。

因为我们没有足够的统一数据。

但不同 use case 的证据成熟度,确实不一样。

高业务量、需求稳定、结果容易衡量的客服辅助

这里已经有比较强的工作流生产率证据。

也出现了 Klarna 这种真实企业披露的财务结果:

其 2025 财年 20-F 中,公司称 AI assistant 处理了约 80% 的客服聊天,并带来约 5,900 万美元成本节约。

这个数字仍然是公司自己的归因和估算,不等于独立因果审计。

而且公开材料不足以重新计算整个项目的净 ROI。

但相比“我们预计明年能节约多少”,它已经更接近真实运营。

这一类场景之所以相对容易验证,是因为:

  • 需求持续存在;
  • 业务量大;
  • 结果比较明确;
  • 转人工也可以设计清楚;
  • 最终可以观察队列、处理量和实际支出。

能直接连接真实购买行为的零售功能

第一篇提过,某个大型跨境平台的售前 chatbot 销售提升约 16.3%,AI 搜索优化约 2.9%,而营销推送没有检测到显著销售增长。

我觉得这一组结果很有价值。

因为它说明:

小幅、可重复、直接连接业务指标的改善,可能比一个非常惊艳的 demo 更容易建立 business case。

2.9% 听起来并不轰动。

但如果真实业务量足够大,它可能是很可观的收益。

当然,规模只能放大单位经济性。

如果每一单本来就是亏的,规模更大不会神奇地把它变成好生意。

软件辅助

这里已经有很好的 task-level evidence。

但由于不同人群和代码库的研究结果差异很大:

比较合理的方法仍然是:

在自己的真实开发流程里测试。

并且不要只测:

“代码生成速度快了多少?”

还要看:

review、testing、maintenance、release 和最终交付。

证据还比较弱的场景

例如开放式、跨系统、长链条 autonomous agents。

现在已经有真实部署调查,但还没有足够证据支持它们具有一个普遍的正净 ROI。

这不是说它们没有价值。

只是:

不能因为 agent 能完成越来越复杂的 demo,就把别人的能力展示直接借来当成自己的 business case。

04|自动化程度越高,不代表经济效益越好

这一轮 research 里还有一个我很喜欢的发现。

一项 2026 年的生产 agent 研究,在筛出的 86 个生产或试点系统中发现:

68% 会在自主执行不超过 10 个步骤后让人介入,47% 甚至不到 5 步。

这个样本有明显边界。

它来自愿意参与研究的生产和试点团队,不代表整个行业,也不能拿来计算 agent 成功率。

但它至少提醒了一件事:

现实里的 agent,并没有都沿着:

human → human-in-the-loop → fully autonomous

这条进度条往前走。

很多团队选择的就是:

  • AI 做一段;
  • 人在关键地方判断;
  • 失败可以接管;
  • 然后继续。

从经济角度看,这完全可能是合理选择。

因为:

减少人工介入会降低一部分劳动成本,但也可能增加错误和恢复成本。

所以“自动化程度更高”并不天然代表 ROI 更好。

更好的问题还是:

把 AI 和人工放在一起以后,整个系统是不是更有效?

05|这也让我重新理解了 Eval

过去讲 eval,我很容易先想到:

accuracy、hallucination、成功率、benchmark。

这些当然重要。

但如果把这三篇放在一起,我现在会觉得 enterprise AI 的 eval 还应该继续往后走一步。

它不只是在问:

AI 有没有答对?

还应该帮助回答:

整个系统能不能稳定完成一件真正有价值的工作?

这里面自然会包含:

  • 完整 task success;
  • 人工介入率;
  • 失败和恢复;
  • 完成时间;
  • 每个合格结果的完整成本;
  • 以及这个结果最后对应的 business outcome。

Eval 自己当然不能替企业完成 ROI。

但如果完全没有这一层:

产品很容易证明:

模型能力越来越好了。

却始终不知道:

这套系统作为一门生意,到底越来越好没有。

三篇研究做完以后,我最后留下的是一套很普通的问题

开始这轮 research 时,我其实很想知道:

企业到底应该怎样算 AI 的 ROI?

查到最后,没有得到一个漂亮的行业数字。

也没有找到:

“AI 平均回报 X 倍”

这种我愿意相信的答案。

反而变成了三个更具体的问题。

第一,企业真正得到了什么?

不是停在 productivity,而是一直追到价值有没有被 capture。

第二,为了得到这些结果,完整付出了什么?

不是只看 API,而是比较两个完整 workflow。

第三,这件事在自己的真实业务里,能不能持续成立?

  • 有需求吗?
  • 结果能验收吗?
  • 失败能恢复吗?
  • workflow 能利用新增能力吗?
  • 规模放大以后,单位经济性还成立吗?

如果要把三篇最后收成一句话,我现在会写:

AI 能做到一件事,和企业值得长期把这件事交给 AI,是两个不同的问题。

前者更多是 capability。

后者需要把:

真实需求、业务结果、可靠性、完整成本和规模

一起放进来。

所以以后看到一个 AI use case,我可能不会先问:

“它有多先进?”

而会先问三个更朴素的问题:

它真的让结果变好了吗?为了这个结果,我们完整付出了什么?这个收益和成本,在真实业务量下还能持续成立吗?

如果三件事都说得清楚,我觉得才真正开始接近一笔可以被相信的 AI 经济账。

关于这轮 research

这是「企业 AI 的真实经济账」研究系列的第三篇,也是最后一篇。

这轮 research 是一次结构化公开证据综述,不是统计元分析。

现有证据最大的限制之一,是公开研究对 productivity、工作流产出和部分业务指标的测量,明显多于对完整项目成本和长期净收益的披露。

因此,这个系列没有试图给出:

  • 企业 AI 的平均 ROI;
  • 各行业 AI ROI 排名;
  • 统一的试点失败率;
  • “自动化越高越赚钱”这样的规律;
  • 或一个适用于所有 AI 项目的规模化公式。

文中提出的“规模化前五个问题”,是综合现有实验、生产部署和成本研究得到的分析框架,而不是已经经过跨行业验证的因果定律。

当前相对更明确的判断是:

有真实需求和足够业务量、结果能够验收、失败能够处理、工作流能够利用改善的 use case,更容易建立可信的经济模型。

但最终仍然需要在具体业务里验证。

主要参考 · ReferencesBrynjolfsson、Li、Raymond, Generative AI at Work, QJE, 2025Cui 等, The Effects of Generative AI on High-Skilled Work, Management Science, 2026METR developer productivity experiments, 2025–2026Fang 等, Generative AI and Sales Productivity, 2026Pan 等, Measuring Agents in Production, ICML 2026Klarna, FY2025 Form 20-FMcKinsey, The State of AI in 2026FinOps Foundation, Cost Estimation of AI WorkloadsNIST, Generative Artificial Intelligence Profile