---
id: "mb-20260914-5347e4"
kind: "deep"
title: "Anthropic 天才研究员出逃背后：防御性军备竞赛如何把安全公司变成加速引擎"
topic: "Anthropic 天才研究员出逃背后：防御性军备竞赛如何把安全公司变成加速引擎"
source_type: "generated"
status: "published"
generated_at: "2026-09-14 17:48:03"
frame_type: ["安全实验室的防御性军备竞赛（Defensive", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# Anthropic 天才研究员出逃背后：防御性军备竞赛如何把安全公司变成加速引擎

还有两个月，公司分给他的大额期权就能兑现了。
但这个 27 岁的剑桥数学天才，突然把工牌一摔，直接走人。
走的时候，他在网上发了一句话：
这两家全世界最顶尖的 AI 公司，正在拿我们所有人的命当筹码赌博。

这个年轻人叫 Jacob Coxon。
2016 年拿过国际数学奥林匹克银牌，剑桥大学毕业。
过去三年，他一直在硅谷最核心的两个技术团队做预训练：
先在 OpenAI 参与开发 GPT-4o，后来跳槽去了 Anthropic。
在大模型行业里，预训练工程师是离底座能力最近的一群人。
每天烧进去多少万张卡，模型推理能力在哪个节点突然跳跃，他们比任何人都清楚。

既然站在行业的最中心，为什么连快到手的期权都不要了，非要在这个时候出逃？
2026 年 9 月 14 日，纽约时报的播客 The Daily 专门找他做了一期专访。
他在节目里讲出来的东西，并不是代码出了什么技术故障。
他讲的是一整套让所有天才都动弹不得的死锁机制。

要看懂这场出逃，得先弄清楚 Anthropic 这家公司到底是怎么来的。
2021 年，OpenAI 的一批核心骨干之所以集体辞职创办 Anthropic，理由非常纯粹：
他们觉得 OpenAI 拿了微软的钱，商业化跑得太疯，根本不管安全。
为了不重蹈覆辙，Anthropic 从注册第一天起就是一家公益公司。
它推出了全行业最严格的负责任扩展政策，把“安全”两个字刻成了自己的金字招牌。
亚马逊和谷歌给它砸下几百亿美元，也是看中它能当那个冷静的刹车片。

既然把安全当立身之本，那为什么最顶尖的员工会愤怒出走？
Coxon 指出了一个让局外人震惊的内幕。
他说两家公司的文化确实不一样。
在 OpenAI，很多研发人员可能还没有真正把技术失控的风险当回事。
但在 Anthropic，大家对危险看得比谁都清楚。
很多核心工程师在私下里深信不疑：
到了 2030 年前后，AI 真的有可能把全人类给抹掉。

既然已经清醒到这个地步，为什么大家不把速度降下来？
这就是最荒谬的地方。
他们被困在了一套绝对理性的逻辑里：
“对面的对手太不计后果了。”
“如果让那些不顾死活的人先造出超级智能，人类不就彻底没救了吗？”
“所以，为了全人类的安全，我们这些懂克制、讲道德的人，必须抢在所有人前面把超级智能造出来。”

你看懂这台博弈机器的咬合方式了吗？
一旦你把“抢先做出超级智能”当成了唯一的安全手段，你的全部行为就会立刻退化成一场不计代价的军备竞赛。
对手加了两万张算力卡，你就必须加四万张。
对手把发布周期压到三个月，你就只能通宵加班把模型往前推。
两边都坚信对方是疯子，两边都坚信自己踩油门是为了拯救世界。
结果就是，当初为了安全而成立的公司，今天在算力赛道上跑得比谁都狂热。

如果这只是离职员工的一面之词，那事情还不至于在硅谷掀起海啸。
关键在于，公司的核心高层竟然公开认领了这份恐慌。
Coxon 辞职之后，Anthropic 的对齐科学负责人 Evan Hubinger 直接在社交平台上公开表态。
他承认自己和身边的许多科学家，确实认为人类在未来十年内被 AI 毁灭的概率大于 10%。
接着，这位负责给超级模型栓安全绳的科学家，讲了一句更让人绝望的话：
公司已经在拼命想办法，但客观讲，大家手里根本没有一套能确保超级智能对齐的有效方案。

负责安全的人，承认自己没有能力保证安全。
但实验室每天的研发任务，依然在拼命冲向能够自我改进的超级智能。
紧接着，Anthropic 的可扩展监督团队主管 Joe Benton 也放下工作宣布离职，公开确认 Coxon 对这场行业军备竞赛的描述非常准确。

既然所有人都知道前面是悬崖，为什么就是踩不下刹车？
走，去看看这台商业机器的底层齿轮。
几十亿上百亿美元的现金已经沉淀下去了。
几百亿美元的估值撑在那里，背后是庞大的基金、云厂商和供应链。
如果现在有一家实验室站出来宣布：为了人类安全，我们决定把研发工作暂停一年。
接下来会发生什么？
它的估值会在几周内暴跌，投资人会集体发难，最优秀的算法工程师会在一个月内被隔壁挖得干干净净。
在激烈的市场竞争里，单方面的美德没有任何自我保护的能力。
谁先踩刹车，谁就第一个在战场上出局。

这就是为什么一个 27 岁的数学家，宁可扔掉几百上千万的期权，也要撕破脸皮出逃。
当个体的良知撞上庞大的资本飞轮，他能做的最激烈的反抗，也不过是用自己失去的真金白银，向屋子外面的人吹一声哨子。

但吹完哨子之后呢？
机房里的冷却风扇依然在震耳欲聋地轰鸣。
各大巨头的新一轮融资依然在源源不断地签署。
人类历史上最聪明的一帮头脑，依然在办公室里推演着下一个大版本的上线日期。
当全天下最懂危险的人都在争分夺秒制造危险。
指望这台机器靠内部自律停下来，恐怕从一开始就是个巨大的幻觉。

_Rendered by mubei-terminal._
