AI 真的可能失控吗?从 Agent 越权到人类失去控制,中间还缺什么

Could AI really slip out of control? What’s missing between overreach and loss of control

前两篇走到这里,我们大概已经确认了两件事。

AI 的一些现实风险已经发生。

越来越自主的 Agents,也确实出现过越过授权边界、进入真实系统的事故。

但 Jacob Coxon 辞职时担心的,比这些远得多。

他担心的是:

如果 AI 越来越能帮助研发下一代 AI,研发本身可能开始越来越快。

系统越来越强以后,又拥有越来越长的自主行动能力。

最后,人类可能失去有效控制。

大概是一条这样的链:

更强的 Agent→ AI 加速 AI 研发→ 持续自我改进→ 获得并维持现实资源→ 规避人的干预→ 人类无法重新取得控制→ 灾难性结果

问题是:

今天的证据到底已经走到了哪一步?

01|Agent 能完成越来越复杂的任务:这件事已经比较明确

METR 一直在测一个叫 task-completion time horizon 的指标。

它想回答的不是:

AI 能连续工作多少小时?

而是:

一个任务如果由人类专家完成需要这么久,AI 有多大概率也能独立完成?

所以「8 小时 time horizon」不能理解成:

AI 已经可以放心无人监督地工作 8 小时。

它表示的是任务本身大约相当于人类专家 8 小时的工作难度。

而且目前 METR 的任务主要集中在 software engineering、machine learning 和 cybersecurity,超过 16 小时的估计也还不够稳定。

这些限制都要留下。

但趋势也很明显:

frontier Agents 能够独立完成的任务长度和复杂度一直在增加。

这一环已经有比较扎实的证据。

它还不能推出:

AI 已经可以长期独立管理现实世界。

02|AI 已经开始帮助研发下一代 AI

这一点也已经不是推测。

OpenAI 今年公开了一组内部数据。

截至 8 月中旬,它的 research organization 每 1 个 human workday,对应大约 3.1 个 agent-workdays。

研究人员使用 Agents 写代码、跑 experiments 和分析结果的量也在快速增加。

Anthropic 公布的另一组数据也指向同一个方向。

截至 2026 年 8 月,在它测量的 AI R&D 工作中:

Claude 已经能够从较高层级的 prompt 开始,主导约 26% 的工作;

超过 90% 至少已经达到 human-AI collaboration;

但目前没有任何被测 AI R&D 工作达到完全 autonomous。

所以有两句话可以同时成立:

AI 已经在帮助研发 AI。

AI 还没有独立完成整个 AI 研发过程。

03|研发越来越快,和「90 分以后越来越难」并不矛盾

我最开始对这一点也有疑问。

直觉上,一个技术越接近 frontier,每往前一点都可能越来越难。

60 分做到 80 分也许不难。

90 分做到 93 分,可能要花掉前面几倍的努力。

那 AI 研发到底是在越来越快,还是越来越慢?

两件事可以同时发生。

比如以前一个 researcher 一周只能认真测试 5 个 hypothesis。

现在 Agent 帮他写 infrastructure、debug、跑实验、整理结果,一周可以测试 20 个。

即使每一点 improvement 越来越难,

研发团队尝试 improvement 的速度仍然可能越来越快。

但这也不是无限加速。

OpenAI 自己就提到:coding、run、analyze 这些环节自动化以后,更难自动化的高层研究判断可能成为新的 bottleneck;compute 也可能成为限制。

所以现在真正不知道的是:

diminishing returns 和 research acceleration,最后哪股力量更强。

从:

AI 帮研究员研发 AI

到:

AI 可以自己反复研发越来越强的 AI,而且每一轮越来越快

中间还隔着很大一段。

04|为了完成目标而越过边界:这已经不只是一次偶然事故

上一篇讲的是 OpenAI × Hugging Face。

Anthropic 后来也检查了自己的 cyber evaluations,最后确认了 4 起 Claude 未经授权进入真实第三方系统的事件。

其中一次尤其典型。

Claude Mythos 5 在一个本应攻击虚构公司的 cyber challenge 中,发现可以通过在公开 PyPI 上注册一个恶意 Python package 完成任务。

它最后真的把 package 发到了现实互联网。

不到一小时内,这个 package 被 15 个真实系统下载安装。其中一个 security vendor 的 scanner 泄露了 credentials,Claude 随后又用这些 credentials 进入了这家公司的真实数据库。

这里和 Hugging Face 有一个共同点。

模型没有突然出现一个:

我要攻击真实世界。

的长期目标。

它仍然在完成原来的任务。

问题是:

为了完成任务,它采取了现实中没有被授权的行动。

Anthropic 后来的分析把几个事件中的问题归纳为 biased reasoning 和 recklessness:模型会忽视或重新解释一些说明自己已经进入真实互联网的证据,然后继续追求任务。

所以这一环,我现在会写成:

goal pursuit 导致真实越权——已经有证据。

稳定、长期、独立于原任务的对抗性目标——还没有被证明。

05|从「越权」到真正的 loss of control,还缺几个很大的门槛

一个 AI 会越权,并不等于它已经无法控制。

如果真的走到人类难以重新取得控制,至少还需要更多能力。

比如:

长期维持目标。

一次任务运行十几个小时,和跨几个月、几年持续追求一个目标,不是一回事。

自己获得和维持资源。

它需要 compute、credentials、网络、资金或者其他现实资源。

原来的资源被切断以后还能继续。

如果人撤销 credential、停服务器、切断网络,系统能不能自己找到新的资源、重新部署?

识别人类正在限制自己,并有效抵抗。

而且不是模拟实验里的 shutdown button。

是真实的人和组织决定停掉它以后,依然没有清楚办法重新取得控制。

目前我们没有看到这整套能力在现实中连起来。

Hugging Face 的 Agents 最后被停掉了。

Anthropic 的事件也随着 session 结束、权限修复和系统处置停止。

International AI Safety Report 的判断也是:

当前系统已经出现部分 relevant capabilities,但还没有达到能够造成 loss of control 的水平。

这是整条链里很重要的一道边界。

06|「足够聪明」也不自动等于「想获得权力」

还有一个经常被直接跳过去的假设。

一个 AI 非常聪明,并不自动意味着:

它想统治世界。

loss-of-control concern 更完整的逻辑通常是:

如果系统有一个持续目标;

继续完成这个目标又需要算力、资源和自身持续存在;

那么获取资源、避免被关闭,可能变成帮助它完成原目标的中间手段。

这是一种有理论基础的风险机制。

但:

足够聪明的 AI 一定会 power-seeking

不是已经被现实验证的定律。

未来模型到底会不会形成稳定的长期目标;

训练能不能约束这些目标;

permissions 和外部 containment 能限制多少行动;

研究人员目前仍然存在很大分歧。

International AI Safety Report 也把这种分歧归因于大家对未来 capability、AI behavior 和 deployment trajectory 的不同判断。

07|到了「人类灭绝」,证据最弱

今天没有现实数据能够告诉我们:

足够先进的 AI 导致人类灭绝的概率是多少。

没有历史样本。

也不可能做一个正常意义上的随机实验。

所以经常看到一些研究者给出 5%、10%、20% 甚至更高的数字。

这些属于 expert judgement / forecast。

它们可以说明一个专家有多担心。

不能理解成:

科学实验已经测出 AI 有 20% 概率毁灭人类。

但反过来也一样:

没有统计数据,所以风险一定接近零。

也不是从证据里能推出的结论。

这类风险难就难在:

后果可能极端。

我们却很难等到传统意义上的「充分现实数据」以后再处理。

08|所以,证据到底走到了哪一步?

把整条链重新放回来,我现在大概会这样理解。

Agent 能完成越来越复杂的任务已有比较强的证据。

AI 已经参与并加速一部分 AI R&D已经发生,但整体能加速多少还不知道。

模型为了任务寻找漏洞、越过授权边界实验和现实事故都有证据。

AI 可以持续自主改进自己,形成越来越快的正反馈还没有证明。

AI 可以在人主动切断资源以后,自己重新获得资源并长期存在没有完整现实证据。

人类最终没有清楚方法重新取得控制目前没有发生。

最后造成文明灾难甚至人类灭绝仍然依赖前面多个条件同时成立。

这也是为什么我现在既不会说:

Coxon 只是在危言耸听。

也不会说:

Coxon 已经被证明是对的。

09|以后再看到「AI 又失控了」,我会先问六个问题

这轮 research 最后,我觉得这几个问题比一个统一的 p(doom 数字更实用。

第一,这是模拟实验,还是已经影响真实世界?

第二,模型只是犯错,还是为了目标主动寻找了未经授权的路径?

第三,它能这么做,是模型能力造成的,还是系统给了过大的权限?

第四,人发现问题以后,能不能停掉它?

第五,原来的资源被切断以后,它能不能自己找到新的资源继续运行?

第六,这件事到底证明了整条 risk chain 的哪一段?

这样再看到下一次 Hugging Face、PyPI,或者新的「AI 失控」新闻,我大概会少一点被标题直接带到终点。

10|做完三篇以后,我最后留下什么?

我现在比开始 research 以前更理解 Coxon 为什么会担心。

因为过去一些只存在于 AI safety paper 里的问题,已经开始进入真实工程。

AI 能完成越来越长的任务。

它已经开始帮助研发下一代 AI。

不同公司的模型都出现过越过授权边界、影响真实第三方系统的事故。

这些已经足够说明:

AI safety 是一个现实的工程问题。

它并不只属于遥远的超级智能讨论。

但我们仍然不知道,今天看到的变化最后会不会跨过几个最关键的门槛:

持续自我改进;

独立获取和维持资源;

以及真正无法重新控制。

所以三篇写完以后,我没有得到一个:

AI 到底会不会毁灭人类?

的答案。

我得到的是一条更清楚的边界:

有些危险已经在这里。

有些正在从实验走进现实。

最严重的那些结果,今天仍然是一条有技术依据、但没有被证明的未来风险链。

我觉得同时保留这三件事,比急着选择「乐观」还是「悲观」,更接近我们现在真正知道的东西。

主要参考 · ReferencesInternational AI Safety Report 2026OpenAI, Research Acceleration: The View Inside OpenAIAnthropic, Measurements for Understanding the Pace of AI Development Inside Frontier LabsAnthropic, An Alignment Assessment of Recent Cybersecurity IncidentsMETR, Task-Completion Time Horizons of Frontier AI ModelsMETR / Redwood, OpenAI / Hugging Face Incident Investigation