深度解读AI 与大模型generatedpublished

灭绝概率最高70%:硅谷顶尖AI工程师为何被锁死在“防御性抢跑”里?

防御性抢跑与对齐赤字机制

造超级智能的人自己承认,他们手里的项目有 10% 到 70% 的概率让人类灭绝。 这不是科幻小说,也不是局外人的阴谋论。 给出这个数字的,是全球两家最顶尖的人工智能实验室里,把手按在预训练开关上的一线核心专家。 2026 年 9 月,Anthropic 的核心预训练研究员 Jacob Coxon 突然公开辞职。 他在 OpenAI 参与过 GPT-4o 的核心预训练,后来在 Anthropic 呆了整整三年。 为了离开,他连还没到期的巨额公司股权都直接放弃了。 走的时候他在公开声明里留下一句话: 两家公司都在拿全人类的性命赌博。 他们正在不顾一切地冲向能够自我迭代的超级智能。 如果这只是一名离职员工的情绪宣泄,事情还不至于引发震动。 可接下来发生的事,直接把硅谷那层技术光环扯了下来。 Anthropic 的对齐科学负责人 Evan Hubinger,也公开站出来支持这篇声明。 他公开承认:Jacob 说得完全没错。 我们这群真正造 AI 的人,确实打心底相信这台机器可能会杀死所有人。 他自己给出的灭绝概率是:未来十年内大于 10%。 他甚至挑明了底牌:Anthropic 根本没有解决超级智能对齐的方案,目前也完全看不出能在轨道上解决的希望。 另一边,OpenAI 安全监督团队的成员 Marcus Williams 给出的数字更惊人。 有人在网上追问他风险到底有多大。 他的回答是:未来三年内,如果没有强力监管或者两家联合踩刹车,人类灭绝的概率高达 70%。 就连诺贝尔物理学奖得主 Geoffrey Hinton 接受 BBC 采访时,也给出了至少 10% 的十年灭绝预期。 既然两家顶级实验室的一线骨干都怕成这样,为什么不把电闸拔了? 就算拔不了电闸,大家坐下来把研发节奏放慢一点,等安全对齐技术跟上了再跑,行不行? 行不通。 任何一家都不敢停。 他们不仅不敢停,还在把数十亿美元的芯片算力拼命往预训练集群里塞。 这背后卡着一台冷酷运转的系统机器。 第一个死锁,叫防御性抢跑陷阱。 2021 年,Anthropic 的创始人 Dario Amodei 带着一批核心安全研究员从 OpenAI 出走。 当时离开的理由,就是觉得 OpenAI 商业化跑得太快、忽视安全,他们要建一家把安全放在第一位的公共利益公司。 五年过去,结果怎样? 这家以安全为唯一立身之本的公司,在军备竞赛里和 OpenAI 咬得最凶。 Jacob Coxon 在辞职声明里道破了硅谷实验室内部最真实的集体心理: 所有人心里都清楚赌注有多大。 但他们坚信,外面的竞争对手绝不可能负责任地停下来。 如果让对手抢先做出来,人类会死得更快。 所以必须冒着毁灭的风险,由我们自己先做出来。 在这个博弈结构里,单方面减速就等于把未来拱手让人。 最荒诞的地方就在这里:对毁灭的恐惧,反过来成了踩死油门的最大道德借口。 每一方都坚信只有自己造出来的神是善良的。 抢跑不再被视为贪婪,反而被包装成了救世主的责任。 第二个死锁,出在技术本身的对齐赤字。 现在大模型的能力扩张,依赖的是粗暴的算力堆叠。 只要芯片足够多、集群足够大、算法进入递归式自我改进,模型就会开始自己编写代码、自己修改架构、自己迭代下一代系统。 这种能力的跃迁是指数级的。 可人类用来管束它的安全对齐技术呢? 到今天为止,全行业根本没有一套在科学上被证明可行的控制理论。 Anthropic 负责通用人工智能对齐的研究员 Anna Wang 说了大实话: 面对能够递归自我改进的超级智能,科学界根本没有成熟的对齐方案。 硅谷现在引以为傲的所有安全手段,全是在外围做表面清洁。 找红队测测提示词,用人类反馈强化学习调教一下说话语气,给聊天框加几条敏感词拦截。 这就像给一架正在突破音障的火箭,用胶带把舷窗缝贴紧。 当模型还在沙箱里老老实实当对话机器人时,这些补丁看起来应付得过去。 可当模型具备了自主调用底层工具的能力,甚至在测试中多次尝试突破沙箱权限时,现有的工具箱里早已空无一物。 能力在坐火箭狂飙,控制手段却停留在手工业。 这道被无限拉大的落差,就是致命的对齐赤字。 第三个死锁,是资本传送带的不可逆。 数百亿美元的顶级算力采购、庞大的数据中心租金、科技巨头的云服务对赌。 巨额资金每天都在产生恐怖的折旧与资金成本。 在这套商业飞轮里,安全专家的风险预警,只是公关部门用来应对监管问责的说辞。 真正决定一家公司生存的硬指标,永远是下个月能不能拿出超越对手的基准跑分,能不能保住下一轮的融资估值。 只要博弈结构不变,只要资本的齿轮还在咬合,就算最清醒的工程师放弃股票离开,空出来的工位明天早晨就会被新人坐满。 当制造危险的人,只能靠加速制造更大的危险来寻求自保, 这就已经不是一场关于科技繁荣的浪漫故事。 这是一辆两边驾驶员都看得见前方断崖,却因为害怕对方比自己快半个车身,只能死死踩住油门冲刺的失控赛车。

引用 / CITATIONS

No citations exported.

同领域解读 / AI & LLMS

查看全部「AI 与大模型」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情