AI 提效之后,企业真正得到了什么?

After the productivity gain, what do companies actually get?

自己开始做 AI 产品以后,我对“AI 到底创造了多少价值”这件事变得比以前敏感了一些。

一边是越来越多的提效数字:写代码更快、客服处理更多问题、知识工作者节省时间。

另一边,真正把一个 AI 功能做出来以后,会发现背后还有模型调用、搜索、数据、评估、人工复核、监控、失败处理,以及很多不那么容易出现在一张 API 账单里的成本。

所以这一轮 research,我真正想弄清楚的并不是:

企业做 AI,到底值不值?

这个问题太大了。

我更想知道的是:

AI 进入真实企业以后,我们到底得到了什么,又完整付出了什么?

以及,这些投入和产出里,哪些已经有相对可靠的证据,哪些还只是推测。

这轮研究的证据截至 2026 年 9 月 6 日。

我主要看了十几组核心资料,包括客服、软件开发、知识工作和零售场景里的随机实验或准实验,企业实际运营和财务披露,以及 McKinsey 等企业调查、FinOps 和 NIST 的成本与治理框架。

不同证据能回答的问题并不一样。

  • 随机实验比较适合告诉我们:某一项任务到底有没有改善。
  • 企业披露离真实经营更近,但公司说“AI 帮我们节约了多少钱”,不代表这个因果关系已经被独立验证。
  • 调查可以告诉我们企业整体正在经历什么,却很难仅凭一组调查数字证明某个 AI 项目到底赚了多少钱。

最后我把这轮 research 拆成三篇:

第一篇:AI 提效之后,企业真正得到了什么?

先沿着 productivity 往后追,看看个人或任务层面的改善,怎样才会变成企业真正获得的价值。

第二篇:AI 的成本,应该算到哪里?

从最容易看到的 API / token 费用往外走,把数据、集成、评估、人工、运维和失败处理重新放回完整 workflow。

第三篇:把收益和成本放在一起以后,AI 项目应该怎样算账?

最后再讨论,面对一个具体 AI use case,我们目前到底有哪些比较可靠的方法判断它是否值得继续规模化。

这一篇,先算第一本账:

企业到底得到了什么?

一些 AI 提效,已经不只是“感觉更快了”

先说一个 research 以后我觉得需要承认的事实:

AI 在一些具体任务上的 productivity gain,已经有相当不错的真实环境证据了。

一项后来发表在 Quarterly Journal of Economics 的研究跟踪了 5172 名客服人员。

企业把生成式 AI 助手逐步提供给客服以后,研究估计每小时解决的问题数量提高了大约 15%。

这不是让 AI 独立替代客服,而是 AI 辅助真实员工处理真实客户问题。

软件开发也出现了类似证据。

2026 年发表在 Management Science 的一项随机实验覆盖三家公司、4867 名开发者。合并结果显示,使用 AI coding assistant 的开发者完成的任务数量提高了大约 26%,初级开发者的改善尤其明显。

所以今天再笼统地说:

“AI 所谓的效率提升都只是营销。”

也不太符合现有证据。

但 research 往下走以后,我发现另一个问题更值得看。

任务效率提高了以后,接下来发生了什么?

McKinsey 2026 年的一项企业调查刚好提供了一个很有意思的背景信号。

1719 名来自 97 个国家的受访者里:

80% 报告 AI 改善了个人生产率;

但只有 37% 报告 AI 已经对企业 EBIT 产生正向贡献。

这两个数字不能直接相减。

它们都是自报数据,“37%”也绝不意味着另外 63% 的企业做 AI 都亏钱。

但放在一起,确实提出了一个值得继续追的问题:

从“一个人做得更快”,到“企业真正得到经济价值”,中间到底发生了什么?

我现在大概会沿着四层继续看。

任务改善 → 工作流兑现 → 产能利用 → 价值捕获

第一层:任务本身真的改善了吗?

这里看起来最简单,其实已经很容易算错。

AI 生成一份报告只用了 30 秒,并不代表这项工作从两小时变成了 30 秒。

如果之后还需要花一个小时检查事实、重写关键部分、处理失败结果,那么真正应该比较的是:

加入核验、修改和异常处理以后,完整任务有没有更快、更好,或者更便宜?

而且“用了 AI 就会提效”本身也不能预设。

METR 在 2025 年做过一个很有意思的随机实验。

16 名熟悉成熟开源代码库的资深开发者完成 246 项真实任务。结果反而发现,在那个特定环境下,允许使用当时的 AI 工具以后,完成任务花的时间增加了大约 19%。

2026 年的后续实验已经开始出现加速方向的结果,但置信区间跨过零,同时有明显的参与者和任务选择偏差,所以研究团队自己也没有把它解释成一个新的通用提效比例。

这几个 coding 研究放在一起,对我最大的提醒反而很简单:

先测完整任务,不要先假定 AI 一定提高效率。

任务、人群、代码库、工具和验收标准不同,结果本来就可能完全不同。

所以第一层真正需要确认的是:

在我自己的真实业务里,这项任务真的变好了吗?

第二层:一个 task 变快,不代表整个 workflow 变快

假设第一层已经成立。

以前写一段代码要一天,现在半天完成。

企业是不是就多得到了半天?

还是不一定。

如果真正限制交付速度的是需求决策、code review、测试或者审批,那么更快地产生代码,可能只是让下一个环节排起更长的队。

AI 把一个局部环节变快了,但整个 workflow 的 throughput 没有发生同样幅度的变化。

一项覆盖 66 家企业、7137 名员工、持续六个月的随机实验很好地体现了这种区别。

真正使用生成式 AI 工具的员工,在实验后半程每周处理邮件的时间减少了大约 两小时,下班后的工作时间也下降了。

这些都是真实变化。

但研究没有检测到其他任务的数量或工作结构随之发生明显变化。

也就是说:

时间确实省下来了。

但研究并没有进一步证明:

这些时间自动变成了更多企业产出。

我觉得这个区别很重要。

因为我们平时看到“每名员工每周节省 X 小时”时,很容易下一步就把小时数乘以工资,再写成一笔“价值”。

现实没有那么直接。

员工少加班,本身当然可以是一种价值。

工作体验变好、精力消耗降低,也不能因为没有立刻出现在利润表里就被当成零。

但如果我们要声称:

“AI 给企业节约了这么多钱。”

中间还缺下一步证据。

第三层:省下来的时间,最后去了哪里?

这可能是整条链里最容易被跳过去的一层。

假设一个 100 人团队,因为 AI 每个人每周都稳定节约两小时。

理论上,一周出现了 200 个小时的新增 capacity。

接下来呢?

它可能变成:

  • 同样的人处理更多客户;
  • 原本积压的工作开始被完成;
  • 产品迭代更快;
  • 业务增长以后不用按照原计划继续扩招;
  • 员工减少加班;
  • 也可能只是每个人多了一些分散在不同地方、很难重新组织的零碎时间。

这些结果的价值并不一样。

其中一个让我在 research 里印象很深的地方,就是:

AI 可以释放 capacity,但组织还要决定怎样使用这部分 capacity。

技术没有办法替企业完成这一步。

  • 如果需求本来就是有限的,多生产 30% 的内容未必有价值。
  • 如果下游团队没有更多处理能力,上游快出来的产出可能只是堆在那里。
  • 如果企业原本计划业务增长后再招 20 个人,现在用同一支团队就能支撑增长,那么 AI 的价值可能主要体现为 avoided future cost,而不是今天立刻裁掉 20 个人。

所以“节约了多少时间”和“企业得到了多少经济价值”,最好分开记录。

最后一层:企业真正得到的价值,其实不只有省人工

这也是我做完 research 后,觉得自己原来想得有点窄的地方。

讨论 AI ROI 时,我们很容易只问:

少用了多少人?

但现有研究里,一些最清楚的价值并不是来自裁员。

一项大型跨境零售平台的实验研究比较了七类生成式 AI 工作流。

其中,给消费者提供售前 chatbot,相比没有实时服务的基准组,销售额提高了大约 16.3%。

这里 AI 的价值路径就很不一样。

它没有简单替代一名原有员工。

原本大量消费者根本得不到即时的一对一售前服务。AI 让一种过去成本上可能不成立的服务,第一次可以覆盖到更大规模。

于是价值来自:

更多服务覆盖 → 减少购买过程的信息障碍 → 更多交易。

同一项研究里,AI 搜索优化带来的销售提升约为 2.9%;而 AI 营销推送并没有出现统计上显著的销售改善。

这也提醒我:

“用了生成式 AI”本身并不是价值来源。

具体 workflow 到底解决了什么问题,才是。

综合这轮看到的案例,我现在会把企业可能获得的价值大致分成几类:

实际现金节约

真的减少了外包、加班、软件或其他现金支出。

新增 capacity / 避免未来成本

同样的人可以支持更大业务量,或者增长时不用按照原计划继续增加投入。

新增收入或利润

例如更多转化、交易、留存,或者提供以前无法经济覆盖的服务。

质量、及时性和风险改善

更少返工、更快处理、更低错误损失、更稳定的服务。

新增能力

原来因为人力、成本或专业门槛根本不会做的事情,现在第一次可以完成。

它们都可以是真实价值。

但最好不要混在一起。

尤其不要把“理论上节约的员工时间”,直接写成“已经减少的现金成本”。

所以以后再看到「AI 提效 xx%」,我会继续问四步

这一篇 research 最后留给我的,并不是一句“AI 提效不等于 ROI”。

我觉得更有用的是下面这条链:

任务改善 → 工作流兑现 → 产能利用 → 价值捕获

看到一个 AI productivity 数字以后,可以继续问:

1. 任务

加入核验、修改和失败处理以后,完整任务真的更快、更好或更便宜了吗?

2. 工作流

这个改善穿过下游了吗?

还是只是把 bottleneck 从一个地方移到了另一个地方?

3. 产能

释放出来的时间和能力最后被怎么使用?

更多业务、减少积压、避免扩招、减少加班,还是没有被重新组织起来?

4. 价值

最后真正留下来的是什么?

现金节约、capacity、收入、质量、风险改善,还是一种以前无法提供的新能力?

我觉得“提效”本身是真实而重要的结果。

现在也已经有越来越多研究支持它。

但如果我们想进一步讨论 enterprise value,就需要沿着这条链继续往后走。

不能从“一个 task 快了 26%”,直接跳到:

“企业因此获得了 26% 的 ROI。”

到这里,其实只算完了企业 AI 经济账的一边:

我们可能得到了什么。

还有另外一边没有展开。

为了稳定得到这些结果,企业到底付出了什么?

模型和 API 是最容易看到的一张账单。

但数据整理、系统集成、eval、人工审核、监控、异常处理、治理,以及项目失败以后留下的投入,又应该怎样算?

这是下一篇想继续看的问题:

「企业 AI 的真实经济账」研究 2/3:AI 的成本,应该算到哪里?

关于这轮 research

这是「企业 AI 的真实经济账」研究系列的第一篇。

整轮研究想回答的不是“AI 有没有价值”,也不是寻找一个所谓的“企业 AI 平均 ROI”。

我更想把现实里的两边账尽量拆清楚:

企业真正获得了什么,以及为了得到这些结果完整付出了什么。

这一篇主要使用三类证据。

第一类是真实工作环境里的随机实验和准实验,包括客服、软件开发和知识工作。它们比较适合回答某一项任务有没有真正改善,但通常没有完整测量项目成本和企业利润。

第二类是直接连接业务指标的实验,例如零售场景中的销售变化。它们更接近企业价值,但结果依然只能解释对应的具体 workflow。

第三类是 McKinsey 等企业调查,用来观察个人 productivity 与企业层面经济结果之间的大背景。调查能够发现趋势,但属于自报和相关性证据,所以不会拿它来计算一个统一的“AI 成功率”。

这轮 research 一个很重要的处理原则是:

研究测到了什么,就只说到哪里。

任务提效不自动叫 ROI;企业自报的节约也不自动变成独立因果证据;没有测量到完整成本,也不会把收益改善写成净回报。

主要参考 · ReferencesBrynjolfsson、Li、Raymond,Generative AI at Work,Quarterly Journal of Economics,2025Cui 等,The Effects of Generative AI on High-Skilled Work,Management Science,2026Dillon 等,Shifting Work Patterns with Generative AI,2025Fang 等,Generative AI and Sales Productivity,2026METR,Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity,2025;后续方法更新,2026McKinsey,The State of AI in 2026,2026