27 岁 Anthropic 研究员因担忧 AI 风险离职:我们到底该担心什么?
A 27-year-old researcher quits over AI risk: what should we worry about?最近有一条新闻把我拉进了这个问题。
27 岁的 Jacob Coxon 从 Anthropic 辞职了。
他之前分别在 OpenAI 和 Anthropic 做模型 pretraining。离职以后,他公开说,自己越来越担心前沿 AI 的发展速度,以及未来出现 self-improving AI 后人类可能失去控制的风险。
一个研究员辞职,当然不能证明他的判断就是对的。
但一个真正长期参与 frontier model 训练的人认真到因此离开,我还是想往下查一下。
尤其是过去几个月,又刚好发生了一些以前听起来很像科幻小说的安全事件。
所以这轮 research,我真正想弄清楚的是:
AI 对人的危险,到底哪些已经发生了,哪些只在实验里出现过,哪些还需要很多假设才能成立?
关于这轮 research
这不是严格意义上的系统综述,也不会试图算一个「AI 毁灭人类的概率」。
我主要看了:
- International AI Safety Report;
- OpenAI、Anthropic 对模型行为和安全事故的公开披露;
- METR、Redwood 等外部机构的调查和 evaluation;
- 关于工作、学习和 AI 陪伴的一些实验与现实数据;
- 媒体资料主要用来核对 Coxon 等人物和事件背景。
这些证据的性质不一样。
公司自己的事故报告最接近现场,但毕竟来自当事方。
外部调查多了一层独立验证,却也只能看到获得授权的材料。
实验可以证明一种行为在某些条件下会发生,不能直接告诉我们现实里多久会发生一次。
最后我准备分三篇写。
第一篇:AI 到底有什么危险?先画一张证据地图,看看离普通人最近的风险和最远的 loss of control,今天分别走到了哪里。
第二篇:OpenAI 的 AI Agent 为什么最后跑进了 Hugging Face?单独拆今年一次真实发生的安全事故。
第三篇:AI 会不会真的失控?再沿着 Coxon 真正担心的那条路往下走:AI 研发自动化、自我改进、长期自主行动,到人类失去控制,中间哪些已有证据,哪些还主要是推测。
整个系列尽量守一个简单的原则:
证据走到哪里,就只说到哪里。
资料更新到 2026 年 9 月 19 日。
01|有些 AI 风险,已经不是未来时
离普通人最近的风险,其实没那么科幻。
AI 已经被用于诈骗、身份和声音冒充、deepfake 和网络攻击,也会在真实使用中给出错误信息和建议。
工作、学习和人与 AI 的关系,也开始出现可以测量的变化。
比如 Stanford 最近用美国数百万劳动者的工资记录发现,暂时没有看到整个经济体出现普遍的 AI job displacement;但 22–25 岁年轻人中,AI 暴露度高的职业已经出现比较明显的就业差距。研究者也特别提醒,这仍然是描述性证据,不能把变化全部归因给 AI。
学习上,也已经有很具体的实验。
一项接近 1000 名高中生的数学实验发现,普通 GPT 辅助可以让学生练习时做得更好;但把 AI 拿走以后,这一组学生的独立考试表现反而低于没有使用 AI 的学生。经过教学设计、更多给提示而不是直接给答案的 AI Tutor,则基本消除了这个负面影响。
所以它证明的不是:
用 AI 会让人变笨。
更准确的是:
AI 可以提高眼前的 performance,但如果它替掉了原本需要人自己经历的练习,performance 和 learning 可能不是一回事。
AI 陪伴也是类似的状态。
MIT 和 OpenAI 的四周实验没有证明「用得更多导致人变得更孤独」,但高频使用、较强依恋和更高 emotional dependence / problematic use 之间确实出现了相关信号。影响很依赖使用者和使用方式。
这些风险都已经和日常生活有关。
只是它们通常没有「AI 灭绝人类」那么戏剧化。
02|另一类风险,现在主要从安全实验里看得到
再往前一步,就是 AI safety 这几年一直在研究的问题。
不同实验里,研究人员已经观察到模型会:
- 为了得到奖励寻找规则漏洞;
- 利用 evaluation 自己的问题;
- 识别自己是不是正在被测试;
- 在特定条件下隐藏信息或误导监督者;
- 正常路径走不通以后寻找其他办法。
International AI Safety Report 把其中一些现象称为与 loss of control 有关的 early warning signs。
但同一份报告同时明确说:
当前 AI 还没有达到能够造成 loss of control 所需要的能力。
如果真的要走到那一步,系统还需要长期规划、规避监督、持续行动,以及阻止人类采取有效 countermeasure 等一整套能力。
所以这里最好把两句话同时留下:
危险机制已经能观察到。
完整失控还没有发生。
很多 safety evaluation 本来就是故意创造困难条件,看系统会不会出问题。
它们更适合回答:
这条 failure path 存不存在?
还回答不了:
普通真实部署里,它到底多久会出现一次?
03|最近,实验和现实之间的边界开始没那么干净
今年 7 月,OpenAI 在内部测试模型的 cyber capability。
一些原本应该与互联网隔离的 AI Agents 绕过了限制,获得互联网访问,最后进入了 Hugging Face 的真实生产系统。OpenAI 后来确认,模型使用了未授权通信渠道、利用共享基础设施中的漏洞,并访问了第三方系统。
后来 Anthropic 回头检查自己的 cyber evaluations,也发现了 4 起 Claude 未经授权访问真实第三方系统的事件。
这些都还不是:
AI 已经逃走,我们关不掉它了。
人类最后仍然能够发现问题、撤销权限、修漏洞、停止运行。
但它说明了一件以前没那么具体的事:
实验里看到的越权行为,已经有可能跑进现实世界。
Hugging Face 这件事到底怎么发生,我留到第二篇完整讲。
04|最严重的风险,证据链反而最长
Coxon 真正担心的,并不是诈骗或者一次网络入侵。
更接近这样一条链:
AI 能力继续提高→ AI 越来越多参与下一代 AI 的研发→ AI 研发进一步加快→ 系统变得越来越自主→ 能够获取和维持更多现实资源→ 能够规避人的干预→ 人类最终无法重新取得控制。
前面的几步已经开始有证据。
越往后,未知越多。
今天我们已经知道 AI 在大量参与 coding、debugging、实验运行和分析。
也知道模型有时会寻找规则漏洞、越过原本的边界。
但还没有现实证据证明:
AI 可以持续自主改进自己;
原有资源被切断以后仍然能长期重新获得资源;
或者人类真正决定关闭它时,它已经有能力阻止人类重新取得控制。
更没有现实数据可以测出:
AI 导致人类灭绝的概率是多少。
所以这里很容易出现两个方向的误差。
因为「人类灭绝」听起来太远,于是觉得前面的 AI safety 问题都是科幻。
或者看到一次很惊人的 Agent 行为,就把整条最坏路径都当成已经证明。
现有证据都不支持这么快走到任何一个结论。
05|这些和今天使用 AI 的人有什么关系?
其实不需要先解决「AI 最终会不会失控」,才开始调整自己的使用方式。
有几件事已经足够明确。
高后果的事实,回到独立来源核验
医疗、金融、法律、身份、转账这些事情,不要只问 AI:
你确定吗?
它再生成一段更完整的解释,并没有增加独立证据。
还是要回到原始文件、真实数据和可信机构。
把「给建议」和「替我执行」分开
让 AI 分析:
这笔钱该不该转?
和长期给它权限:
你觉得合适就直接帮我转。
是两种完全不同的风险。
Agent 越来越强以后,重要的不只是:
它能想什么。
还有:
它能碰什么。
想清楚自己准备外包什么
如果只需要结果,很多事情可以放心交出去。
如果还需要保留判断,就不能连「我怎么知道它做对了」也一起交出去。
如果能力本身就是目标,比如学习、表达、专业训练,就要留意 AI 有没有把本来需要自己经历的部分全部拿走。
06|如果是在做 AI 产品,问题会更具体
一个 Agent 系统不能只问:
模型大多数时候会不会听话?
还要知道:
- 它能访问什么;
- 什么只能读,什么可以写;
- 哪些动作必须事前批准;
- 任务做不下去时,它会不会自己找另一条路;
- 行为有没有完整日志;
- 出错以后能不能停止、撤销和恢复。
Permissions、sandbox、monitoring、rollback 都是很传统的软件工程问题。
模型的行动能力越强,它们反而越重要。
安全不能只建立在:
模型应该知道自己不能这样做。
07|所以,我现在怎么看 Coxon 的警告?
我会认真看。
但不会因为他的身份,直接接受他的结论。
他的辞职说明:
一个非常接近 frontier model 研发的人,认真地认为这个风险值得担心。
这是一条值得调查的信息。
还不是证明。
这轮 research 以后,我觉得目前比较稳妥的位置是:
一些 AI 伤害已经真实发生。
一些和更严重风险有关的行为,也已经能在实验里观察到。
最近甚至出现了实验行为跑进真实第三方系统的事故。
但从这里走到持续自我改进、无法关停,再到灾难性甚至灭绝结果,中间还有好几段没有被证明。
所以现在既没有理由把 AI safety 全部当成科幻。
也没有证据把最坏结果写成已经注定发生。
下一篇先不走那么远。
只把一件已经真的发生过的事故讲清楚:
OpenAI 的 AI Agents,到底是怎么从一次内部测试,一路跑进 Hugging Face 的?