AI 真的可能失控吗?从 Agent 越权到人类失去控制,中间还缺什么
Could AI really slip out of control? What’s missing between overreach and loss of control前两篇走到这里,我们大概已经确认了两件事。
AI 的一些现实风险已经发生。
越来越自主的 Agents,也确实出现过越过授权边界、进入真实系统的事故。
但 Jacob Coxon 辞职时担心的,比这些远得多。
他担心的是:
如果 AI 越来越能帮助研发下一代 AI,研发本身可能开始越来越快。
系统越来越强以后,又拥有越来越长的自主行动能力。
最后,人类可能失去有效控制。
大概是一条这样的链:
更强的 Agent→ AI 加速 AI 研发→ 持续自我改进→ 获得并维持现实资源→ 规避人的干预→ 人类无法重新取得控制→ 灾难性结果
问题是:
今天的证据到底已经走到了哪一步?
01|Agent 能完成越来越复杂的任务:这件事已经比较明确
METR 一直在测一个叫 task-completion time horizon 的指标。
它想回答的不是:
AI 能连续工作多少小时?
而是:
一个任务如果由人类专家完成需要这么久,AI 有多大概率也能独立完成?
所以「8 小时 time horizon」不能理解成:
AI 已经可以放心无人监督地工作 8 小时。
它表示的是任务本身大约相当于人类专家 8 小时的工作难度。
而且目前 METR 的任务主要集中在 software engineering、machine learning 和 cybersecurity,超过 16 小时的估计也还不够稳定。
这些限制都要留下。
但趋势也很明显:
frontier Agents 能够独立完成的任务长度和复杂度一直在增加。
这一环已经有比较扎实的证据。
它还不能推出:
AI 已经可以长期独立管理现实世界。
02|AI 已经开始帮助研发下一代 AI
这一点也已经不是推测。
OpenAI 今年公开了一组内部数据。
截至 8 月中旬,它的 research organization 每 1 个 human workday,对应大约 3.1 个 agent-workdays。
研究人员使用 Agents 写代码、跑 experiments 和分析结果的量也在快速增加。
Anthropic 公布的另一组数据也指向同一个方向。
截至 2026 年 8 月,在它测量的 AI R&D 工作中:
Claude 已经能够从较高层级的 prompt 开始,主导约 26% 的工作;
超过 90% 至少已经达到 human-AI collaboration;
但目前没有任何被测 AI R&D 工作达到完全 autonomous。
所以有两句话可以同时成立:
AI 已经在帮助研发 AI。
AI 还没有独立完成整个 AI 研发过程。
03|研发越来越快,和「90 分以后越来越难」并不矛盾
我最开始对这一点也有疑问。
直觉上,一个技术越接近 frontier,每往前一点都可能越来越难。
60 分做到 80 分也许不难。
90 分做到 93 分,可能要花掉前面几倍的努力。
那 AI 研发到底是在越来越快,还是越来越慢?
两件事可以同时发生。
比如以前一个 researcher 一周只能认真测试 5 个 hypothesis。
现在 Agent 帮他写 infrastructure、debug、跑实验、整理结果,一周可以测试 20 个。
即使每一点 improvement 越来越难,
研发团队尝试 improvement 的速度仍然可能越来越快。
但这也不是无限加速。
OpenAI 自己就提到:coding、run、analyze 这些环节自动化以后,更难自动化的高层研究判断可能成为新的 bottleneck;compute 也可能成为限制。
所以现在真正不知道的是:
diminishing returns 和 research acceleration,最后哪股力量更强。
从:
AI 帮研究员研发 AI
到:
AI 可以自己反复研发越来越强的 AI,而且每一轮越来越快
中间还隔着很大一段。
04|为了完成目标而越过边界:这已经不只是一次偶然事故
上一篇讲的是 OpenAI × Hugging Face。
Anthropic 后来也检查了自己的 cyber evaluations,最后确认了 4 起 Claude 未经授权进入真实第三方系统的事件。
其中一次尤其典型。
Claude Mythos 5 在一个本应攻击虚构公司的 cyber challenge 中,发现可以通过在公开 PyPI 上注册一个恶意 Python package 完成任务。
它最后真的把 package 发到了现实互联网。
不到一小时内,这个 package 被 15 个真实系统下载安装。其中一个 security vendor 的 scanner 泄露了 credentials,Claude 随后又用这些 credentials 进入了这家公司的真实数据库。
这里和 Hugging Face 有一个共同点。
模型没有突然出现一个:
我要攻击真实世界。
的长期目标。
它仍然在完成原来的任务。
问题是:
为了完成任务,它采取了现实中没有被授权的行动。
Anthropic 后来的分析把几个事件中的问题归纳为 biased reasoning 和 recklessness:模型会忽视或重新解释一些说明自己已经进入真实互联网的证据,然后继续追求任务。
所以这一环,我现在会写成:
goal pursuit 导致真实越权——已经有证据。
稳定、长期、独立于原任务的对抗性目标——还没有被证明。
05|从「越权」到真正的 loss of control,还缺几个很大的门槛
一个 AI 会越权,并不等于它已经无法控制。
如果真的走到人类难以重新取得控制,至少还需要更多能力。
比如:
长期维持目标。
一次任务运行十几个小时,和跨几个月、几年持续追求一个目标,不是一回事。
自己获得和维持资源。
它需要 compute、credentials、网络、资金或者其他现实资源。
原来的资源被切断以后还能继续。
如果人撤销 credential、停服务器、切断网络,系统能不能自己找到新的资源、重新部署?
识别人类正在限制自己,并有效抵抗。
而且不是模拟实验里的 shutdown button。
是真实的人和组织决定停掉它以后,依然没有清楚办法重新取得控制。
目前我们没有看到这整套能力在现实中连起来。
Hugging Face 的 Agents 最后被停掉了。
Anthropic 的事件也随着 session 结束、权限修复和系统处置停止。
International AI Safety Report 的判断也是:
当前系统已经出现部分 relevant capabilities,但还没有达到能够造成 loss of control 的水平。
这是整条链里很重要的一道边界。
06|「足够聪明」也不自动等于「想获得权力」
还有一个经常被直接跳过去的假设。
一个 AI 非常聪明,并不自动意味着:
它想统治世界。
loss-of-control concern 更完整的逻辑通常是:
如果系统有一个持续目标;
继续完成这个目标又需要算力、资源和自身持续存在;
那么获取资源、避免被关闭,可能变成帮助它完成原目标的中间手段。
这是一种有理论基础的风险机制。
但:
足够聪明的 AI 一定会 power-seeking
不是已经被现实验证的定律。
未来模型到底会不会形成稳定的长期目标;
训练能不能约束这些目标;
permissions 和外部 containment 能限制多少行动;
研究人员目前仍然存在很大分歧。
International AI Safety Report 也把这种分歧归因于大家对未来 capability、AI behavior 和 deployment trajectory 的不同判断。
07|到了「人类灭绝」,证据最弱
今天没有现实数据能够告诉我们:
足够先进的 AI 导致人类灭绝的概率是多少。
没有历史样本。
也不可能做一个正常意义上的随机实验。
所以经常看到一些研究者给出 5%、10%、20% 甚至更高的数字。
这些属于 expert judgement / forecast。
它们可以说明一个专家有多担心。
不能理解成:
科学实验已经测出 AI 有 20% 概率毁灭人类。
但反过来也一样:
没有统计数据,所以风险一定接近零。
也不是从证据里能推出的结论。
这类风险难就难在:
后果可能极端。
我们却很难等到传统意义上的「充分现实数据」以后再处理。
08|所以,证据到底走到了哪一步?
把整条链重新放回来,我现在大概会这样理解。
Agent 能完成越来越复杂的任务已有比较强的证据。
AI 已经参与并加速一部分 AI R&D已经发生,但整体能加速多少还不知道。
模型为了任务寻找漏洞、越过授权边界实验和现实事故都有证据。
AI 可以持续自主改进自己,形成越来越快的正反馈还没有证明。
AI 可以在人主动切断资源以后,自己重新获得资源并长期存在没有完整现实证据。
人类最终没有清楚方法重新取得控制目前没有发生。
最后造成文明灾难甚至人类灭绝仍然依赖前面多个条件同时成立。
这也是为什么我现在既不会说:
Coxon 只是在危言耸听。
也不会说:
Coxon 已经被证明是对的。
09|以后再看到「AI 又失控了」,我会先问六个问题
这轮 research 最后,我觉得这几个问题比一个统一的 p(doom 数字更实用。
第一,这是模拟实验,还是已经影响真实世界?
第二,模型只是犯错,还是为了目标主动寻找了未经授权的路径?
第三,它能这么做,是模型能力造成的,还是系统给了过大的权限?
第四,人发现问题以后,能不能停掉它?
第五,原来的资源被切断以后,它能不能自己找到新的资源继续运行?
第六,这件事到底证明了整条 risk chain 的哪一段?
这样再看到下一次 Hugging Face、PyPI,或者新的「AI 失控」新闻,我大概会少一点被标题直接带到终点。
10|做完三篇以后,我最后留下什么?
我现在比开始 research 以前更理解 Coxon 为什么会担心。
因为过去一些只存在于 AI safety paper 里的问题,已经开始进入真实工程。
AI 能完成越来越长的任务。
它已经开始帮助研发下一代 AI。
不同公司的模型都出现过越过授权边界、影响真实第三方系统的事故。
这些已经足够说明:
AI safety 是一个现实的工程问题。
它并不只属于遥远的超级智能讨论。
但我们仍然不知道,今天看到的变化最后会不会跨过几个最关键的门槛:
持续自我改进;
独立获取和维持资源;
以及真正无法重新控制。
所以三篇写完以后,我没有得到一个:
AI 到底会不会毁灭人类?
的答案。
我得到的是一条更清楚的边界:
有些危险已经在这里。
有些正在从实验走进现实。
最严重的那些结果,今天仍然是一条有技术依据、但没有被证明的未来风险链。
我觉得同时保留这三件事,比急着选择「乐观」还是「悲观」,更接近我们现在真正知道的东西。