S2 Day 007人与 AI Human & AIAI 还做不太好的事 3/3研究约 15 分钟

AI 做,人来审,就真的可靠吗?

AI does, humans review — is that actually reliable?

前两篇讨论了两种不太一样的边界。

第一篇从练琴开始。AI 明明知道很多钢琴知识,但真正教一个人,还需要经过 Observe、Diagnose、Intervene、Verify:先看到真实发生了什么,再判断原因、选择合适的干预,最后根据新的结果继续调整。

第二篇继续问:AI 已经可以替我完成很多事情以后,我还需要自己会吗?

最后我把它分成了三种情况:

  • 有些事情只需要结果,可以直接交给 AI;
  • 有些执行可以交出去,但自己还要保留足够的判断能力;
  • 还有一些,能力本身就是目标,不能把真正需要训练的部分也一起外包。

顺着第二种情况继续往下,就会碰到一种现在非常常见的人机分工:

AI 先做,人来审核。

Human in the Loop。

我自己做 AI 产品时也一直很认同这个原则。AI 可以承担越来越多执行,但重要判断、风险比较高的操作,最后还是留一个人把关。

这听起来很合理。

但真正大量使用以后,我越来越觉得,还需要多问一句:

这个人到底能不能把好这个关?

第一次明显碰到这个问题,是 AI 帮我写 PRD

现在让我用 AI 从头整理一份 PRD,已经非常快了。

需求讨论完以后,背景、目标、流程、异常情况、验收标准都可以迅速长成一份结构完整的文档。后面产品有变化,也可以让 AI 继续修改。

生成已经不是瓶颈。

真正麻烦的是审核。

一份文档可以很快从 5 页变成 20 页,而且绝大部分内容都没有明显问题。

真正危险的,反而可能只是藏在某一段里的一句话。

例如 AI 在异常流程中补了一条:

生成失败以后自动 retry,并用新结果覆盖旧结果。

读起来很合理。

但它实际上已经决定了好几个产品问题:要不要产生第二次调用,旧结果是否保留,用户知不知道发生过 retry,连续失败以后怎么办。

如果我快速扫过去,很容易觉得:

异常情况考虑到了。

然后继续往下。

形式上当然有人审核。

但真正需要人确认的产品决定,可能已经悄悄通过了。

这让我后来很在意一个区别:

Human in the Loop,不等于 Human Judgment actually happened。

这次 research 里看到的人机协作研究,也让我意识到,这不只是我自己 review PRD 的问题。

一个反直觉的结果:人 + AI,不一定比人或 AI 单独处理更好

2024 年,Nature Human Behaviour 发表了一项关于 human-AI collaboration 的系统综述和 meta-analysis。

研究者整理了 106 个实验、370 个 effect sizes。每项实验都必须同时比较三种情况:

  • 人自己做;
  • AI 自己做;
  • 人和 AI 一起做。

这项研究区分了两个很容易混淆的概念。

第一个叫 human augmentation:

人 + AI,有没有比人自己做得更好?

答案平均是:有。

第二个叫 human-AI synergy:

人 + AI,有没有比“人和 AI 里面原本表现更好的那个”还要好?

答案平均是:没有。

可以用一个完全虚构的数字帮助理解。

假设某项任务:

人自己做是 60 分;

AI 自己做是 90 分;

人和 AI 一起做是 80 分。

AI 的确把人的表现从 60 提高到了 80,所以它帮助了人。

但如果目标是把这项任务做得最好,那 80 仍然不如直接让 AI 自己做的 90。

这就是这项研究里平均看到的现象:人机组合明显优于人单独工作,却平均没有超过人或 AI 中表现更好的那一方。

这也是为什么我觉得这个结果很反直觉。

我们很容易想象:

人有常识、经验和判断,AI 有速度、数据和计算能力,两边放在一起,应该自然取长补短。

现实里,组合本身并不会自动产生互补。

研究甚至发现,在需要从有限选项里作出判断的 decision tasks 中,人机组合平均出现了 performance loss;而开放式创作任务的结果相对更积极。

这里需要留一个边界:这批研究来自 2020 年到 2023 年中,当然不能直接代表今天最新一代模型。

但它至少提醒了一件事:

“有人参与”不能直接当作系统会更可靠的证据。

为什么人加入以后,反而可能把结果变差?

这项 meta-analysis 没有证明唯一的因果机制,所以这里不能说得太满。

但研究结果提供了一个挺值得注意的线索。

很多 decision task 的人机合作方式其实很简单:

  • AI 给一个完整判断;
  • 人也形成一个判断;
  • 最后由人决定接受还是修改 AI 的答案。

问题是,如果 AI 本来已经比人更擅长这项任务,那么把最终决定重新交给较弱的一方,不一定会提高结果。

人可能在 AI 错的时候过度相信它,也可能在 AI 对的时候不相信它,把正确答案改错。

研究者因此提出,比“双方都把整道题做一遍,最后让人选”更值得探索的方向,可能是把任务拆开:人和 AI 分别负责自己真正更擅长的部分。 但这类实验目前还很少,因此还不能把它当成已经验证成熟的答案。

这也让我重新理解 Human in the Loop。

真正的问题可能不是:

最后有没有一个人。

而是:

为什么这个环节应该交给人?这个人究竟比 AI 多知道什么、擅长什么?

另一个更具体的例子:AI 自己会做,不代表人用 AI 后也会做

2026 年,Nature Medicine 发表了一项 1,298 名英国成年人参与的随机预注册实验。

研究者设计了十个模拟医疗场景,让参与者判断可能是什么问题,以及接下来应该采取什么行动。

参与者被随机分配使用 GPT-4o、Llama 3、Command R+,或者像平时一样使用搜索引擎、NHS 网站等信息来源。

研究者另外还做了一组测试:直接把完整病例交给这些模型。

模型自己处理完整场景时,识别出相关疾病的平均准确率达到 94.9%。

但真正让普通人和这些模型对话以后,使用 LLM 的参与者正确识别相关疾病的比例都低于 34.5%,选择正确下一步行动的比例低于 44.2%,整体没有优于对照组。

这里不能简单理解成:

人把 AI 拖后腿了。

因为模型单独测试时,一开始就拿到了完整、整理好的病例;真实使用里,信息需要先由普通用户描述,再由 AI 追问和理解,最后用户还要决定自己相信什么、采取什么行动。

研究者最后指出的,正是 user interaction 这层问题:标准 benchmark 上表现很好,并不能保证真实用户借助同一个模型,也能获得同样好的结果。

我觉得这个例子对 AI 产品特别重要。

模型能力只是整个系统的一部分。

从:

AI 会做这道题

到:

一个真实的人借助 AI 把事情做好

中间还有一整段东西。

所以,“AI 做、人审核”到底什么时候才有用?

Research 看到这里,我现在不会得出:

Human in the Loop 没有用。

恰恰相反,很多高风险场景确实需要人。

但我会继续检查四件更具体的事。

1. 谁来审?他真的比 AI 多知道什么吗?

第一件事是 reviewer 本身。

不是随便放一个人进去,就叫 human oversight。

如果 AI 生成的是医学判断,真正审核的人需要有相应专业能力。

如果 Coding Agent 改了一个复杂系统,需要做最终技术审核的人,也要真的理解相关架构和风险。

这一点听起来很显然,但它背后其实有一个更重要的问题:

  • 人的角色到底是什么?
  • 是因为他具有 AI 没有的专业知识?
  • 掌握更多业务 context?
  • 负责价值和风险取舍?
  • 还是因为法律或组织上,最后必须由这个人承担决定?

如果说不清楚“为什么是这个人”,Human in the Loop 很容易只是一个流程位置。

而且只找对人还不够。

专家如果只看到 AI 最后的结论,没有原始信息和证据,也一样很难有效审核。

于是自然进入第二个问题。

2. 拿什么审?不能让 AI 自己证明自己

这一点是我现在使用 AI 时最在意的。

AI 给出一个结论。

我问:

你确定吗?

它再生成一段更完整、更有说服力的解释。

这不叫独立验证。

只是同一个系统又解释了一遍自己的答案。

如果一件事可以通过其他信号验证,更可靠的做法通常是回到那些信号。

  • 代码可以跑测试、看真实运行结果。
  • 数据问题可以查数据库。
  • 研究结论可以回到原始论文。
  • 产品行为可以真正走一遍流程。
  • 金额、权限、状态变化可以检查系统记录。

所以 Human in the Loop 真正有价值的前提之一,是:

这个人手里有独立于 AI 输出的证据。

如果审核唯一能做的只是判断:

“这段话听起来有没有道理?”

那么 AI 表达能力越来越强以后,review 反而可能越来越难。

3. 怎么审?“看过了”不等于“审核完成”

这一点和我自己的 PRD 使用最接近。

以前我容易把 human review 想成:

AI 生成以后,我认真看一遍。

但“看完”其实是个很低的标准。

真正有效的审核至少应该能够回答:

  • 哪些地方发生了变化?
  • 哪些地方出现了新的判断?
  • 高风险内容有没有被真正核验?
  • 哪里仍然只是一个假设?
  • 哪些内容我明确接受,为什么?

如果一份 20 页 PRD 里只有两处真正需要 PM 决定的地方,最好的 review workflow 不应该是:

让 PM 每次重新逐字读 20 页。

而应该尽量把:

本轮新增了什么、哪些是新决定、哪些来自 AI 自己补充、哪里风险最高、哪里需要人工确认

直接暴露出来。

这也是为什么我现在越来越觉得:

让 AI 的产出变得 reviewable,本身就是产品设计。

AI 的生成速度可以增加几十倍。

人的注意力并不会同时增加几十倍。

如果让人的审核工作量跟着生成量一起无限扩大,最后很容易出现一种假的 Human in the Loop:

流程上有人看;

实际上只是快速扫过。

4. 审完以后能做什么?人工监督发生在动作之前,还是之后?

这一点我前面其实想得有点笼统。

像我现在使用 Coding Agent,代码改完以后我可以 review,不满意就让它继续改,也可以拒绝 merge。

这种情况下,人确实拥有很明确的控制权。

问题更多出现在开始自动执行真实业务动作以后。

比如一个客服 Agent 可以退款。

有三种完全不同的人类参与方式。

第一种:

退款执行以前,超过某个条件必须先让人批准。

人可以真正阻止这个动作。

第二种:

Agent 正在运行,人可以在异常时暂停或接管。

这是 intervention。

第三种:

Agent 已经完成大量退款,第二天再给人看 audit report。

这时人类参与的是事后审计。

三者都可以被笼统叫作 human oversight,但作用完全不同。

第三种当然仍然有价值,可以发现长期问题、追责和调整规则。

但它已经不能阻止刚才那笔错误退款发生。

所以设计 Human in the Loop 时,还需要问:

这个人是在行动前批准,在执行中可以干预,还是只能事后发现问题?

发现问题以后,又能不能 rollback、escalate 或补救?

把这一层说清楚,比简单写一句“最终由人负责”具体很多。

而且,并不是所有 AI 问题都应该交给人来补

这一轮 research 做到这里,我觉得还有一个挺重要的修正。

Human in the Loop 很容易变成一种万能答案:

AI 可能出错?

没关系,加人工审核。

但不同 failure,本来就应该用不同的方法解决。

如果问题是信息缺失,就应该补信息。

AI 和人都不知道另一方真实想法,再增加一个 reviewer 也不会凭空创造事实。

如果结果可以客观验证,优先建立独立验证。

能跑测试,就不要完全依赖人肉读代码。

如果某些风险已经很明确,就应该建立权限和 guardrail。

例如退款超过某个金额必须人工批准,而不是给 Agent 无限权限,再希望 reviewer 每次都能发现错误。

如果真正遇到的是模糊、例外、价值取舍,再把它交给合适的人。

这样看以后,Human in the Loop 只是整个 reliability system 的一层。

一个更完整的系统可能同时需要:

  • 补充信息;
  • 测试和 evaluation;
  • 权限与 guardrail;
  • 人工审核;
  • 监控;
  • 出了错以后还能够恢复。

可靠性不能全部押在“最后有个人看一下”。

我现在会用四个问题检查 Human in the Loop

这是这轮 research 最后留下来的一个比较实用的框架。

以后看到一个“AI 做,人审核”的流程,我会继续问:

谁来审?

他有没有这项判断真正需要的知识、context 和责任?

拿什么审?

有没有独立于 AI 的数据、测试、来源或者真实结果可以核验?

怎么审?

重要变化和风险有没有被暴露出来?审核者有没有足够时间和注意力真正完成判断?

审完能做什么?

审核发生在行动之前、执行过程中还是事后?发现问题后能不能阻止、修改、升级处理或者恢复?

如果这四个问题回答不清楚,我不会因为流程图里多了一个 human box,就默认系统已经安全很多。

反过来,如果它们都成立,人类参与才真正开始发挥作用。

写完三篇以后,我对“AI 还做不太好的事”的理解

这轮 research 最初的问题其实非常简单:

AI 到底还有什么做不好?

很自然会想到一些领域:

艺术、感情、身体技能、主观判断。

最后得到的答案没有这么整齐。

第一篇练琴让我看到:

AI 有很多知识,不代表它已经观察到了真实情况、找到原因,并形成有效的反馈循环。

第二篇继续发现:

AI 可以把事情替我做得很好,但它的能力不会因为我使用过,就自动变成我的能力。

第三篇再往下一层:

即使执行交给 AI、判断留给人,人机组合也不会自动变得可靠。

三个问题表面上不太一样,底下却有一个共同点:

AI 某一项能力很强,不代表我们真正想要的结果已经发生。

  • 模型会答题,不等于学生学会了。
  • 模型会分析演奏,不等于真正教会了学习者。
  • 模型输出很强,人也参与了,不等于整个系统就一定比双方单独更可靠。

从“AI 会做”到“现实里真的做成”,中间还有很多东西:

  • 它拿到了什么信息;
  • 任务真正的目标是什么;
  • 人和 AI 怎样分工;
  • 结果如何验证;
  • 哪里应该用系统规则控制风险;
  • 又在哪里真的需要人的判断。

所以如果现在再问我:

AI 还有哪些事情做不好?

我可能不会先列一张领域清单。

我会先继续问:

这件事情从“模型有能力”,到“现实结果真的成立”,中间还缺哪一环?

  • 有些缺口会随着模型变强慢慢消失。
  • 有些需要更好的产品和系统设计。
  • 有些适合交给人。
  • 还有一些问题,人和 AI 都暂时没有足够信息回答。

AI 的能力边界还会一直移动。

但我觉得,知道应该去哪里找这条边界,比记住今天的一张“AI 能 / 不能”清单,更有用。

关于这轮 research

这是「AI 还做不太好的事」研究系列的第三篇,也是最后一篇。

整轮研究从我自己在练琴、学习、写作、关系和 AI 产品中的真实使用问题出发,再用不同领域的研究去验证、反驳和修正最开始的解释。

本篇主要关注 human-AI collaboration 和 Human in the Loop 到底在什么条件下真正有效。

第一组核心证据来自 Vaccaro、Almaatouq 和 Malone 发表在 Nature Human Behaviour 的系统综述和 meta-analysis。研究纳入 106 个实验、370 个 effect sizes,比较人单独、AI 单独以及人机组合的表现。平均来看,人机组合能够提高人的表现,但没有超过人和 AI 中表现更好的一方;decision tasks 中平均出现 performance loss,creation tasks 的结果则相对更积极。研究纳入的实验主要发表于 2020 年至 2023 年中,因此不能直接代表今天最新模型,但足以提醒我们:互补需要被验证,不能从“人 + AI”这个结构本身推出。

第二项研究发表于 Nature Medicine,是一项 1,298 人参加的随机预注册实验。研究发现,同一批 LLM 直接获得完整医疗场景时表现很好,但进入真实的人机对话以后,并没有帮助普通参与者获得优于传统信息来源的判断结果。研究者因此特别强调,模型 benchmark 不能替代真实用户测试。

两项研究放在一起,我觉得最值得留下来的不是:

“人机合作不可靠。”

而是:

真正应该评估的是整个人机系统。AI 做什么,人做什么,双方分别根据什么信息判断,错误怎样被发现,又怎样被阻止和恢复。

主要参考 · ReferencesWhen combinations of humans and AI are useful: A systematic review and meta-analysis,Nature Human Behaviour,2024Reliability of LLMs as medical assistants for the general public: a randomized preregistered study,Nature Medicine,2026