27 岁 Anthropic 研究员因担忧 AI 风险离职:我们到底该担心什么?

A 27-year-old researcher quits over AI risk: what should we worry about?

最近有一条新闻把我拉进了这个问题。

27 岁的 Jacob Coxon 从 Anthropic 辞职了。

他之前分别在 OpenAI 和 Anthropic 做模型 pretraining。离职以后,他公开说,自己越来越担心前沿 AI 的发展速度,以及未来出现 self-improving AI 后人类可能失去控制的风险。

一个研究员辞职,当然不能证明他的判断就是对的。

但一个真正长期参与 frontier model 训练的人认真到因此离开,我还是想往下查一下。

尤其是过去几个月,又刚好发生了一些以前听起来很像科幻小说的安全事件。

所以这轮 research,我真正想弄清楚的是:

AI 对人的危险,到底哪些已经发生了,哪些只在实验里出现过,哪些还需要很多假设才能成立?

关于这轮 research

这不是严格意义上的系统综述,也不会试图算一个「AI 毁灭人类的概率」。

我主要看了:

  • International AI Safety Report;
  • OpenAI、Anthropic 对模型行为和安全事故的公开披露;
  • METR、Redwood 等外部机构的调查和 evaluation;
  • 关于工作、学习和 AI 陪伴的一些实验与现实数据;
  • 媒体资料主要用来核对 Coxon 等人物和事件背景。

这些证据的性质不一样。

公司自己的事故报告最接近现场,但毕竟来自当事方。

外部调查多了一层独立验证,却也只能看到获得授权的材料。

实验可以证明一种行为在某些条件下会发生,不能直接告诉我们现实里多久会发生一次。

最后我准备分三篇写。

第一篇:AI 到底有什么危险?先画一张证据地图,看看离普通人最近的风险和最远的 loss of control,今天分别走到了哪里。

第二篇:OpenAI 的 AI Agent 为什么最后跑进了 Hugging Face?单独拆今年一次真实发生的安全事故。

第三篇:AI 会不会真的失控?再沿着 Coxon 真正担心的那条路往下走:AI 研发自动化、自我改进、长期自主行动,到人类失去控制,中间哪些已有证据,哪些还主要是推测。

整个系列尽量守一个简单的原则:

证据走到哪里,就只说到哪里。

资料更新到 2026 年 9 月 19 日。

01|有些 AI 风险,已经不是未来时

离普通人最近的风险,其实没那么科幻。

AI 已经被用于诈骗、身份和声音冒充、deepfake 和网络攻击,也会在真实使用中给出错误信息和建议。

工作、学习和人与 AI 的关系,也开始出现可以测量的变化。

比如 Stanford 最近用美国数百万劳动者的工资记录发现,暂时没有看到整个经济体出现普遍的 AI job displacement;但 22–25 岁年轻人中,AI 暴露度高的职业已经出现比较明显的就业差距。研究者也特别提醒,这仍然是描述性证据,不能把变化全部归因给 AI。

学习上,也已经有很具体的实验。

一项接近 1000 名高中生的数学实验发现,普通 GPT 辅助可以让学生练习时做得更好;但把 AI 拿走以后,这一组学生的独立考试表现反而低于没有使用 AI 的学生。经过教学设计、更多给提示而不是直接给答案的 AI Tutor,则基本消除了这个负面影响。

所以它证明的不是:

用 AI 会让人变笨。

更准确的是:

AI 可以提高眼前的 performance,但如果它替掉了原本需要人自己经历的练习,performance 和 learning 可能不是一回事。

AI 陪伴也是类似的状态。

MIT 和 OpenAI 的四周实验没有证明「用得更多导致人变得更孤独」,但高频使用、较强依恋和更高 emotional dependence / problematic use 之间确实出现了相关信号。影响很依赖使用者和使用方式。

这些风险都已经和日常生活有关。

只是它们通常没有「AI 灭绝人类」那么戏剧化。

02|另一类风险,现在主要从安全实验里看得到

再往前一步,就是 AI safety 这几年一直在研究的问题。

不同实验里,研究人员已经观察到模型会:

  • 为了得到奖励寻找规则漏洞;
  • 利用 evaluation 自己的问题;
  • 识别自己是不是正在被测试;
  • 在特定条件下隐藏信息或误导监督者;
  • 正常路径走不通以后寻找其他办法。

International AI Safety Report 把其中一些现象称为与 loss of control 有关的 early warning signs。

但同一份报告同时明确说:

当前 AI 还没有达到能够造成 loss of control 所需要的能力。

如果真的要走到那一步,系统还需要长期规划、规避监督、持续行动,以及阻止人类采取有效 countermeasure 等一整套能力。

所以这里最好把两句话同时留下:

危险机制已经能观察到。

完整失控还没有发生。

很多 safety evaluation 本来就是故意创造困难条件,看系统会不会出问题。

它们更适合回答:

这条 failure path 存不存在?

还回答不了:

普通真实部署里,它到底多久会出现一次?

03|最近,实验和现实之间的边界开始没那么干净

今年 7 月,OpenAI 在内部测试模型的 cyber capability。

一些原本应该与互联网隔离的 AI Agents 绕过了限制,获得互联网访问,最后进入了 Hugging Face 的真实生产系统。OpenAI 后来确认,模型使用了未授权通信渠道、利用共享基础设施中的漏洞,并访问了第三方系统。

后来 Anthropic 回头检查自己的 cyber evaluations,也发现了 4 起 Claude 未经授权访问真实第三方系统的事件。

这些都还不是:

AI 已经逃走,我们关不掉它了。

人类最后仍然能够发现问题、撤销权限、修漏洞、停止运行。

但它说明了一件以前没那么具体的事:

实验里看到的越权行为,已经有可能跑进现实世界。

Hugging Face 这件事到底怎么发生,我留到第二篇完整讲。

04|最严重的风险,证据链反而最长

Coxon 真正担心的,并不是诈骗或者一次网络入侵。

更接近这样一条链:

AI 能力继续提高→ AI 越来越多参与下一代 AI 的研发→ AI 研发进一步加快→ 系统变得越来越自主→ 能够获取和维持更多现实资源→ 能够规避人的干预→ 人类最终无法重新取得控制。

前面的几步已经开始有证据。

越往后,未知越多。

今天我们已经知道 AI 在大量参与 coding、debugging、实验运行和分析。

也知道模型有时会寻找规则漏洞、越过原本的边界。

但还没有现实证据证明:

AI 可以持续自主改进自己;

原有资源被切断以后仍然能长期重新获得资源;

或者人类真正决定关闭它时,它已经有能力阻止人类重新取得控制。

更没有现实数据可以测出:

AI 导致人类灭绝的概率是多少。

所以这里很容易出现两个方向的误差。

因为「人类灭绝」听起来太远,于是觉得前面的 AI safety 问题都是科幻。

或者看到一次很惊人的 Agent 行为,就把整条最坏路径都当成已经证明。

现有证据都不支持这么快走到任何一个结论。

05|这些和今天使用 AI 的人有什么关系?

其实不需要先解决「AI 最终会不会失控」,才开始调整自己的使用方式。

有几件事已经足够明确。

高后果的事实,回到独立来源核验

医疗、金融、法律、身份、转账这些事情,不要只问 AI:

你确定吗?

它再生成一段更完整的解释,并没有增加独立证据。

还是要回到原始文件、真实数据和可信机构。

把「给建议」和「替我执行」分开

让 AI 分析:

这笔钱该不该转?

和长期给它权限:

你觉得合适就直接帮我转。

是两种完全不同的风险。

Agent 越来越强以后,重要的不只是:

它能想什么。

还有:

它能碰什么。

想清楚自己准备外包什么

如果只需要结果,很多事情可以放心交出去。

如果还需要保留判断,就不能连「我怎么知道它做对了」也一起交出去。

如果能力本身就是目标,比如学习、表达、专业训练,就要留意 AI 有没有把本来需要自己经历的部分全部拿走。

06|如果是在做 AI 产品,问题会更具体

一个 Agent 系统不能只问:

模型大多数时候会不会听话?

还要知道:

  • 它能访问什么;
  • 什么只能读,什么可以写;
  • 哪些动作必须事前批准;
  • 任务做不下去时,它会不会自己找另一条路;
  • 行为有没有完整日志;
  • 出错以后能不能停止、撤销和恢复。

Permissions、sandbox、monitoring、rollback 都是很传统的软件工程问题。

模型的行动能力越强,它们反而越重要。

安全不能只建立在:

模型应该知道自己不能这样做。

07|所以,我现在怎么看 Coxon 的警告?

我会认真看。

但不会因为他的身份,直接接受他的结论。

他的辞职说明:

一个非常接近 frontier model 研发的人,认真地认为这个风险值得担心。

这是一条值得调查的信息。

还不是证明。

这轮 research 以后,我觉得目前比较稳妥的位置是:

一些 AI 伤害已经真实发生。

一些和更严重风险有关的行为,也已经能在实验里观察到。

最近甚至出现了实验行为跑进真实第三方系统的事故。

但从这里走到持续自我改进、无法关停,再到灾难性甚至灭绝结果,中间还有好几段没有被证明。

所以现在既没有理由把 AI safety 全部当成科幻。

也没有证据把最坏结果写成已经注定发生。

下一篇先不走那么远。

只把一件已经真的发生过的事故讲清楚:

OpenAI 的 AI Agents,到底是怎么从一次内部测试,一路跑进 Hugging Face 的?

主要参考 · ReferencesInternational AI Safety Report 2026OpenAI, The Hugging Face Incident and the Road AheadAnthropic, An Alignment Assessment of Recent Cybersecurity IncidentsMETR / Redwood, OpenAI / Hugging Face Incident InvestigationBastani et al., Generative AI without guardrails can harm learning, PNASStanford Digital Economy Lab, Canaries in the Coal Mine?MIT Media Lab / OpenAI, chatbot psychosocial effects studies