AI 提效之后,企业真正得到了什么?
After the productivity gain, what do companies actually get?自己开始做 AI 产品以后,我对“AI 到底创造了多少价值”这件事变得比以前敏感了一些。
一边是越来越多的提效数字:写代码更快、客服处理更多问题、知识工作者节省时间。
另一边,真正把一个 AI 功能做出来以后,会发现背后还有模型调用、搜索、数据、评估、人工复核、监控、失败处理,以及很多不那么容易出现在一张 API 账单里的成本。
所以这一轮 research,我真正想弄清楚的并不是:
企业做 AI,到底值不值?
这个问题太大了。
我更想知道的是:
AI 进入真实企业以后,我们到底得到了什么,又完整付出了什么?
以及,这些投入和产出里,哪些已经有相对可靠的证据,哪些还只是推测。
这轮研究的证据截至 2026 年 9 月 6 日。
我主要看了十几组核心资料,包括客服、软件开发、知识工作和零售场景里的随机实验或准实验,企业实际运营和财务披露,以及 McKinsey 等企业调查、FinOps 和 NIST 的成本与治理框架。
不同证据能回答的问题并不一样。
- 随机实验比较适合告诉我们:某一项任务到底有没有改善。
- 企业披露离真实经营更近,但公司说“AI 帮我们节约了多少钱”,不代表这个因果关系已经被独立验证。
- 调查可以告诉我们企业整体正在经历什么,却很难仅凭一组调查数字证明某个 AI 项目到底赚了多少钱。
最后我把这轮 research 拆成三篇:
第一篇:AI 提效之后,企业真正得到了什么?
先沿着 productivity 往后追,看看个人或任务层面的改善,怎样才会变成企业真正获得的价值。
第二篇:AI 的成本,应该算到哪里?
从最容易看到的 API / token 费用往外走,把数据、集成、评估、人工、运维和失败处理重新放回完整 workflow。
第三篇:把收益和成本放在一起以后,AI 项目应该怎样算账?
最后再讨论,面对一个具体 AI use case,我们目前到底有哪些比较可靠的方法判断它是否值得继续规模化。
这一篇,先算第一本账:
企业到底得到了什么?
一些 AI 提效,已经不只是“感觉更快了”
先说一个 research 以后我觉得需要承认的事实:
AI 在一些具体任务上的 productivity gain,已经有相当不错的真实环境证据了。
一项后来发表在 Quarterly Journal of Economics 的研究跟踪了 5172 名客服人员。
企业把生成式 AI 助手逐步提供给客服以后,研究估计每小时解决的问题数量提高了大约 15%。
这不是让 AI 独立替代客服,而是 AI 辅助真实员工处理真实客户问题。
软件开发也出现了类似证据。
2026 年发表在 Management Science 的一项随机实验覆盖三家公司、4867 名开发者。合并结果显示,使用 AI coding assistant 的开发者完成的任务数量提高了大约 26%,初级开发者的改善尤其明显。
所以今天再笼统地说:
“AI 所谓的效率提升都只是营销。”
也不太符合现有证据。
但 research 往下走以后,我发现另一个问题更值得看。
任务效率提高了以后,接下来发生了什么?
McKinsey 2026 年的一项企业调查刚好提供了一个很有意思的背景信号。
1719 名来自 97 个国家的受访者里:
80% 报告 AI 改善了个人生产率;
但只有 37% 报告 AI 已经对企业 EBIT 产生正向贡献。
这两个数字不能直接相减。
它们都是自报数据,“37%”也绝不意味着另外 63% 的企业做 AI 都亏钱。
但放在一起,确实提出了一个值得继续追的问题:
从“一个人做得更快”,到“企业真正得到经济价值”,中间到底发生了什么?
我现在大概会沿着四层继续看。
任务改善 → 工作流兑现 → 产能利用 → 价值捕获
第一层:任务本身真的改善了吗?
这里看起来最简单,其实已经很容易算错。
AI 生成一份报告只用了 30 秒,并不代表这项工作从两小时变成了 30 秒。
如果之后还需要花一个小时检查事实、重写关键部分、处理失败结果,那么真正应该比较的是:
加入核验、修改和异常处理以后,完整任务有没有更快、更好,或者更便宜?
而且“用了 AI 就会提效”本身也不能预设。
METR 在 2025 年做过一个很有意思的随机实验。
16 名熟悉成熟开源代码库的资深开发者完成 246 项真实任务。结果反而发现,在那个特定环境下,允许使用当时的 AI 工具以后,完成任务花的时间增加了大约 19%。
2026 年的后续实验已经开始出现加速方向的结果,但置信区间跨过零,同时有明显的参与者和任务选择偏差,所以研究团队自己也没有把它解释成一个新的通用提效比例。
这几个 coding 研究放在一起,对我最大的提醒反而很简单:
先测完整任务,不要先假定 AI 一定提高效率。
任务、人群、代码库、工具和验收标准不同,结果本来就可能完全不同。
所以第一层真正需要确认的是:
在我自己的真实业务里,这项任务真的变好了吗?
第二层:一个 task 变快,不代表整个 workflow 变快
假设第一层已经成立。
以前写一段代码要一天,现在半天完成。
企业是不是就多得到了半天?
还是不一定。
如果真正限制交付速度的是需求决策、code review、测试或者审批,那么更快地产生代码,可能只是让下一个环节排起更长的队。
AI 把一个局部环节变快了,但整个 workflow 的 throughput 没有发生同样幅度的变化。
一项覆盖 66 家企业、7137 名员工、持续六个月的随机实验很好地体现了这种区别。
真正使用生成式 AI 工具的员工,在实验后半程每周处理邮件的时间减少了大约 两小时,下班后的工作时间也下降了。
这些都是真实变化。
但研究没有检测到其他任务的数量或工作结构随之发生明显变化。
也就是说:
时间确实省下来了。
但研究并没有进一步证明:
这些时间自动变成了更多企业产出。
我觉得这个区别很重要。
因为我们平时看到“每名员工每周节省 X 小时”时,很容易下一步就把小时数乘以工资,再写成一笔“价值”。
现实没有那么直接。
员工少加班,本身当然可以是一种价值。
工作体验变好、精力消耗降低,也不能因为没有立刻出现在利润表里就被当成零。
但如果我们要声称:
“AI 给企业节约了这么多钱。”
中间还缺下一步证据。
第三层:省下来的时间,最后去了哪里?
这可能是整条链里最容易被跳过去的一层。
假设一个 100 人团队,因为 AI 每个人每周都稳定节约两小时。
理论上,一周出现了 200 个小时的新增 capacity。
接下来呢?
它可能变成:
- 同样的人处理更多客户;
- 原本积压的工作开始被完成;
- 产品迭代更快;
- 业务增长以后不用按照原计划继续扩招;
- 员工减少加班;
- 也可能只是每个人多了一些分散在不同地方、很难重新组织的零碎时间。
这些结果的价值并不一样。
其中一个让我在 research 里印象很深的地方,就是:
AI 可以释放 capacity,但组织还要决定怎样使用这部分 capacity。
技术没有办法替企业完成这一步。
- 如果需求本来就是有限的,多生产 30% 的内容未必有价值。
- 如果下游团队没有更多处理能力,上游快出来的产出可能只是堆在那里。
- 如果企业原本计划业务增长后再招 20 个人,现在用同一支团队就能支撑增长,那么 AI 的价值可能主要体现为 avoided future cost,而不是今天立刻裁掉 20 个人。
所以“节约了多少时间”和“企业得到了多少经济价值”,最好分开记录。
最后一层:企业真正得到的价值,其实不只有省人工
这也是我做完 research 后,觉得自己原来想得有点窄的地方。
讨论 AI ROI 时,我们很容易只问:
少用了多少人?
但现有研究里,一些最清楚的价值并不是来自裁员。
一项大型跨境零售平台的实验研究比较了七类生成式 AI 工作流。
其中,给消费者提供售前 chatbot,相比没有实时服务的基准组,销售额提高了大约 16.3%。
这里 AI 的价值路径就很不一样。
它没有简单替代一名原有员工。
原本大量消费者根本得不到即时的一对一售前服务。AI 让一种过去成本上可能不成立的服务,第一次可以覆盖到更大规模。
于是价值来自:
更多服务覆盖 → 减少购买过程的信息障碍 → 更多交易。
同一项研究里,AI 搜索优化带来的销售提升约为 2.9%;而 AI 营销推送并没有出现统计上显著的销售改善。
这也提醒我:
“用了生成式 AI”本身并不是价值来源。
具体 workflow 到底解决了什么问题,才是。
综合这轮看到的案例,我现在会把企业可能获得的价值大致分成几类:
实际现金节约
真的减少了外包、加班、软件或其他现金支出。
新增 capacity / 避免未来成本
同样的人可以支持更大业务量,或者增长时不用按照原计划继续增加投入。
新增收入或利润
例如更多转化、交易、留存,或者提供以前无法经济覆盖的服务。
质量、及时性和风险改善
更少返工、更快处理、更低错误损失、更稳定的服务。
新增能力
原来因为人力、成本或专业门槛根本不会做的事情,现在第一次可以完成。
它们都可以是真实价值。
但最好不要混在一起。
尤其不要把“理论上节约的员工时间”,直接写成“已经减少的现金成本”。
所以以后再看到「AI 提效 xx%」,我会继续问四步
这一篇 research 最后留给我的,并不是一句“AI 提效不等于 ROI”。
我觉得更有用的是下面这条链:
任务改善 → 工作流兑现 → 产能利用 → 价值捕获
看到一个 AI productivity 数字以后,可以继续问:
1. 任务
加入核验、修改和失败处理以后,完整任务真的更快、更好或更便宜了吗?
2. 工作流
这个改善穿过下游了吗?
还是只是把 bottleneck 从一个地方移到了另一个地方?
3. 产能
释放出来的时间和能力最后被怎么使用?
更多业务、减少积压、避免扩招、减少加班,还是没有被重新组织起来?
4. 价值
最后真正留下来的是什么?
现金节约、capacity、收入、质量、风险改善,还是一种以前无法提供的新能力?
我觉得“提效”本身是真实而重要的结果。
现在也已经有越来越多研究支持它。
但如果我们想进一步讨论 enterprise value,就需要沿着这条链继续往后走。
不能从“一个 task 快了 26%”,直接跳到:
“企业因此获得了 26% 的 ROI。”
到这里,其实只算完了企业 AI 经济账的一边:
我们可能得到了什么。
还有另外一边没有展开。
为了稳定得到这些结果,企业到底付出了什么?
模型和 API 是最容易看到的一张账单。
但数据整理、系统集成、eval、人工审核、监控、异常处理、治理,以及项目失败以后留下的投入,又应该怎样算?
这是下一篇想继续看的问题:
「企业 AI 的真实经济账」研究 2/3:AI 的成本,应该算到哪里?
关于这轮 research
这是「企业 AI 的真实经济账」研究系列的第一篇。
整轮研究想回答的不是“AI 有没有价值”,也不是寻找一个所谓的“企业 AI 平均 ROI”。
我更想把现实里的两边账尽量拆清楚:
企业真正获得了什么,以及为了得到这些结果完整付出了什么。
这一篇主要使用三类证据。
第一类是真实工作环境里的随机实验和准实验,包括客服、软件开发和知识工作。它们比较适合回答某一项任务有没有真正改善,但通常没有完整测量项目成本和企业利润。
第二类是直接连接业务指标的实验,例如零售场景中的销售变化。它们更接近企业价值,但结果依然只能解释对应的具体 workflow。
第三类是 McKinsey 等企业调查,用来观察个人 productivity 与企业层面经济结果之间的大背景。调查能够发现趋势,但属于自报和相关性证据,所以不会拿它来计算一个统一的“AI 成功率”。
这轮 research 一个很重要的处理原则是:
研究测到了什么,就只说到哪里。
任务提效不自动叫 ROI;企业自报的节约也不自动变成独立因果证据;没有测量到完整成本,也不会把收益改善写成净回报。