把收益和成本放在一起以后,AI 项目应该怎样算账?
Putting gains and costs together: how to do the math on an AI project前两篇分别算了企业 AI 的两边账。
第一篇问:
AI 提高效率以后,企业到底得到了什么?
我们一路从 task improvement 追到 workflow、capacity 和最终 value capture。
第二篇问:
AI 的成本,应该算到哪里?
模型和 API 当然要算,但完整 workflow 里还有数据、集成、eval、人工审核、监控、失败处理和长期维护。
到这里,看起来好像终于可以把两个数字放进公式里:
(收益 − 成本)÷ 成本 = ROI
可 research 真正做到这里以后,我反而觉得:
最需要小心的,正是给“企业 AI”一个统一答案。
01|为什么很难得到一个「企业 AI 平均 ROI」?
因为“企业 AI”本身就不是一个足够具体的经济单位。
- 客服助手和 coding assistant 不一样。
- 给消费者提供售前 chatbot,和让财务团队使用知识助手不一样。
- 一个每天发生百万次、结果容易检查的任务,和每月只发生几次、失败一次就很严重的任务,也不能用同一套数字去比较。
- 甚至在同一个 coding 领域里,可信研究都可以得到看起来相反的结果。
一项覆盖三家公司、4,867 名开发者的随机实验发现,使用 AI coding assistant 后,完成任务数量平均增加约 26%。
METR 在另一项真实任务实验里,却发现一群熟悉成熟代码库的资深开发者,在当时工具条件下使用 AI 后耗时增加了约 19%。
两个研究并不一定谁对谁错。
人不同。任务不同。代码库不同。模型和工具不同。测量方式也不同。
所以 research 最后一个很重要的结论是:
AI 的经济效果高度依赖任务、baseline、使用者和工作流。
我们可以研究一个具体 use case。
却很难把它直接升级成:
“AI 平均可以带来多少 ROI?”
更现实的问题可能是:
一个具体 AI workflow,在什么条件下值得继续放大?
02|规模化以前,先看五件事
完整 research 里没有一个经过跨行业验证的万能 ROI 公式。
但不同证据反复出现了一些条件。
我会把它们整理成五个问题。
第一,有没有真实、持续的需求?
AI 很容易增加供给。
生成更多文案、更快写代码、一次回答更多问题。
但如果没有真实需求,更多产出本身没有经济价值。
第一篇提过的零售实验里,售前 chatbot 能够带来明显销售提升,一个重要原因就是原来确实存在大量没有被满足的消费者咨询。
AI 降低了提供服务的成本以后,这部分真实需求被接住了。
反过来,如果团队已经没有更多任务、客户也不需要更多产出:
即使 productivity 很漂亮,也未必值得为了“更多”继续扩张系统。
所以第一个问题很朴素:
如果 AI 帮我多做 30%,有人真的需要这 30% 吗?
第二,什么叫一个「合格结果」,能不能判断?
一个 AI demo 很容易看起来不错。
规模化以后,真正麻烦的是:
怎样知道它每次都做对了?
BCG 的实验曾经出现一个很有提醒意义的结果。
在适合当时模型能力的任务上,AI 能改善表现。
但在一个超出能力边界的复杂管理任务上,AI 组给出正确建议的概率反而平均低了约 19 个百分点。
这不是说“AI 不适合咨询”。
它说明:
流畅、完整、听起来有道理,不等于业务结果正确。
如果一个 workflow 连“什么叫成功”都没有办法定义,规模化以后就很难真正测:
- 成功率是多少?
- 人工需要检查多少?
- 每个合格结果究竟多少钱?
这也是为什么我现在觉得:
验收标准不是 AI 项目上线后的 QA 工作,而是 business case 的一部分。
第三,失败能不能被发现和恢复?
任何系统都会失败。
经济上更重要的问题不是:
能不能做到 100% 自动?
而是:
失败发生时,我们能不能知道;知道以后,要花多大代价处理?
- 一个错误商品描述可能改掉就好。
- 一封发错的营销邮件可能影响品牌。
- 一个错误的财务判断,成本可能完全不同。
所以同样是 95% accuracy:
剩下 5% 的经济含义可以差很多。
- 有些任务可以让 AI 先做,失败后轻松转人工。
- 有些任务的错误很难检测,一旦发生又非常昂贵。
这也是为什么平均成功率本身,经常不够。
失败成本和恢复路径,也要进入 economics。
第四,整个 workflow 能不能真正利用 AI 的改善?
第一篇已经讲过:
task 变快,不代表 business 结果自动变好。
这个问题到了规模化阶段会更重要。
如果 AI 让代码生成速度翻倍,但 review 和测试完全没有改变:
增加更多 coding-agent capacity,不一定继续增加产品交付。
如果客服助手已经让等待队列消失了:
再增加 20% 的处理能力,边际价值也可能大幅下降。
所以规模化不是单纯:
已经有效 → 多买一些。
而应该继续问:
瓶颈现在在哪里?
AI 解决了原来的瓶颈以后,很可能只是把新的瓶颈暴露出来。
第五,把完整成本算进去以后,单位经济性还成立吗?
这才接到上一篇。
假设一个 AI 系统:
- 确实有需求;
- 输出能够验收;
- 错误能够恢复;
- workflow 也能利用新增能力。
最后还是要回到一个很普通的商业问题:
完成一个真正合格的结果,比原来的方式更好吗?
这里的“更好”不一定只是更便宜。
可以是:
- 同样成本,服务更多客户;
- 多花一点钱,但明显增加收入;
- 成本差不多,但错误更少;
- 成本更高,却让企业第一次获得一种非常有价值的新能力。
如果一定要先看最硬的现金部分,research 里采用的是这种思路:
净现金收益 = AI 真正带来的现金好处 − AI 真正增加的现金代价
这里我很喜欢的一点是:
释放的员工时间,不要强行塞进去。
如果它真的变成避免招聘、减少加班或者更多收入,再进入现金收益。
如果只是释放出 capacity,就单独记录。
这样不会为了让 ROI 好看,把所有“理论工资时间”提前变成现金。
03|哪些场景现在的证据相对更清楚?
Research 最后没有做一个“AI ROI 行业排行榜”。
因为我们没有足够的统一数据。
但不同 use case 的证据成熟度,确实不一样。
高业务量、需求稳定、结果容易衡量的客服辅助
这里已经有比较强的工作流生产率证据。
也出现了 Klarna 这种真实企业披露的财务结果:
其 2025 财年 20-F 中,公司称 AI assistant 处理了约 80% 的客服聊天,并带来约 5,900 万美元成本节约。
这个数字仍然是公司自己的归因和估算,不等于独立因果审计。
而且公开材料不足以重新计算整个项目的净 ROI。
但相比“我们预计明年能节约多少”,它已经更接近真实运营。
这一类场景之所以相对容易验证,是因为:
- 需求持续存在;
- 业务量大;
- 结果比较明确;
- 转人工也可以设计清楚;
- 最终可以观察队列、处理量和实际支出。
能直接连接真实购买行为的零售功能
第一篇提过,某个大型跨境平台的售前 chatbot 销售提升约 16.3%,AI 搜索优化约 2.9%,而营销推送没有检测到显著销售增长。
我觉得这一组结果很有价值。
因为它说明:
小幅、可重复、直接连接业务指标的改善,可能比一个非常惊艳的 demo 更容易建立 business case。
2.9% 听起来并不轰动。
但如果真实业务量足够大,它可能是很可观的收益。
当然,规模只能放大单位经济性。
如果每一单本来就是亏的,规模更大不会神奇地把它变成好生意。
软件辅助
这里已经有很好的 task-level evidence。
但由于不同人群和代码库的研究结果差异很大:
比较合理的方法仍然是:
在自己的真实开发流程里测试。
并且不要只测:
“代码生成速度快了多少?”
还要看:
review、testing、maintenance、release 和最终交付。
证据还比较弱的场景
例如开放式、跨系统、长链条 autonomous agents。
现在已经有真实部署调查,但还没有足够证据支持它们具有一个普遍的正净 ROI。
这不是说它们没有价值。
只是:
不能因为 agent 能完成越来越复杂的 demo,就把别人的能力展示直接借来当成自己的 business case。
04|自动化程度越高,不代表经济效益越好
这一轮 research 里还有一个我很喜欢的发现。
一项 2026 年的生产 agent 研究,在筛出的 86 个生产或试点系统中发现:
68% 会在自主执行不超过 10 个步骤后让人介入,47% 甚至不到 5 步。
这个样本有明显边界。
它来自愿意参与研究的生产和试点团队,不代表整个行业,也不能拿来计算 agent 成功率。
但它至少提醒了一件事:
现实里的 agent,并没有都沿着:
human → human-in-the-loop → fully autonomous
这条进度条往前走。
很多团队选择的就是:
- AI 做一段;
- 人在关键地方判断;
- 失败可以接管;
- 然后继续。
从经济角度看,这完全可能是合理选择。
因为:
减少人工介入会降低一部分劳动成本,但也可能增加错误和恢复成本。
所以“自动化程度更高”并不天然代表 ROI 更好。
更好的问题还是:
把 AI 和人工放在一起以后,整个系统是不是更有效?
05|这也让我重新理解了 Eval
过去讲 eval,我很容易先想到:
accuracy、hallucination、成功率、benchmark。
这些当然重要。
但如果把这三篇放在一起,我现在会觉得 enterprise AI 的 eval 还应该继续往后走一步。
它不只是在问:
AI 有没有答对?
还应该帮助回答:
整个系统能不能稳定完成一件真正有价值的工作?
这里面自然会包含:
- 完整 task success;
- 人工介入率;
- 失败和恢复;
- 完成时间;
- 每个合格结果的完整成本;
- 以及这个结果最后对应的 business outcome。
Eval 自己当然不能替企业完成 ROI。
但如果完全没有这一层:
产品很容易证明:
模型能力越来越好了。
却始终不知道:
这套系统作为一门生意,到底越来越好没有。
三篇研究做完以后,我最后留下的是一套很普通的问题
开始这轮 research 时,我其实很想知道:
企业到底应该怎样算 AI 的 ROI?
查到最后,没有得到一个漂亮的行业数字。
也没有找到:
“AI 平均回报 X 倍”
这种我愿意相信的答案。
反而变成了三个更具体的问题。
第一,企业真正得到了什么?
不是停在 productivity,而是一直追到价值有没有被 capture。
第二,为了得到这些结果,完整付出了什么?
不是只看 API,而是比较两个完整 workflow。
第三,这件事在自己的真实业务里,能不能持续成立?
- 有需求吗?
- 结果能验收吗?
- 失败能恢复吗?
- workflow 能利用新增能力吗?
- 规模放大以后,单位经济性还成立吗?
如果要把三篇最后收成一句话,我现在会写:
AI 能做到一件事,和企业值得长期把这件事交给 AI,是两个不同的问题。
前者更多是 capability。
后者需要把:
真实需求、业务结果、可靠性、完整成本和规模
一起放进来。
所以以后看到一个 AI use case,我可能不会先问:
“它有多先进?”
而会先问三个更朴素的问题:
它真的让结果变好了吗?为了这个结果,我们完整付出了什么?这个收益和成本,在真实业务量下还能持续成立吗?
如果三件事都说得清楚,我觉得才真正开始接近一笔可以被相信的 AI 经济账。
关于这轮 research
这是「企业 AI 的真实经济账」研究系列的第三篇,也是最后一篇。
这轮 research 是一次结构化公开证据综述,不是统计元分析。
现有证据最大的限制之一,是公开研究对 productivity、工作流产出和部分业务指标的测量,明显多于对完整项目成本和长期净收益的披露。
因此,这个系列没有试图给出:
- 企业 AI 的平均 ROI;
- 各行业 AI ROI 排名;
- 统一的试点失败率;
- “自动化越高越赚钱”这样的规律;
- 或一个适用于所有 AI 项目的规模化公式。
文中提出的“规模化前五个问题”,是综合现有实验、生产部署和成本研究得到的分析框架,而不是已经经过跨行业验证的因果定律。
当前相对更明确的判断是:
有真实需求和足够业务量、结果能够验收、失败能够处理、工作流能够利用改善的 use case,更容易建立可信的经济模型。
但最终仍然需要在具体业务里验证。