DEEPgeneratedpublished

做 AI 安全研究,只有 2.7% 的成果真的需要最强的大模型

叙事捆绑与能力赋能安全假说(CESH)机制

做 AI 安全研究,只有 2.7% 的成果真的需要最强的大模型。 剩下的 97%,在小模型、开源模型或者纯理论上就做完了。 那过去几年,大模型巨头到底靠什么说服投资人和政府,给他们源源不断地批下几百亿算力预算? 靠一套被他们写进公司立足之本的假说:能力赋能安全。 Anthropic 在 2023 年的安全核心观点里白纸黑字写过: 公司存在的首要理由,就是相信必须在最前沿的 AI 系统上开展安全研究。 Sam Altman 同一年在谈及通用人工智能规划时也公开宣称: 把安全和能力分开是虚假的二分法,最好的安全成果全部来自最强的模型。 这套逻辑设计得极其精巧: AI 有毁灭性风险。 要解决风险,必须先研究最强模型。 要拥有最强模型,就必须先砸几百亿美元把算力和能力推到极限。 商业扩张和军备竞赛,瞬间拿到了一张无可反驳的道德许可证。 每一笔买显卡的巨额开支,都被包装成了拯救全人类的前提条件。 这套讲了三年的神话,终于有人拉出真实数据对了一遍账。 研究员 Stephen McAleese 统计了 2019 到 2025 年间的 521 篇 AI 安全核心文献。 对其中 477 篇有据可查的研究,逐一用量化标准打分。 标准只有一条:这项安全研究的核心突破,到底离不离得开最顶尖的前沿模型? 结果把大实验室的招牌砸得粉碎。 477 项安全成果里,核心结论真正必须依赖前沿模型的,只有 13 篇。 占比只有 2.7%。 高达 64.4% 的研究,要么不需要跑模型,要么在早就公开的小模型上就能彻底做完。 剩下 32.9% 的研究,虽然借用了前沿模型来跑数据或打分,但核心机制在非前沿模型上同样成立。 就算把筛选标准收紧,只看引用量排在前 25% 的高影响力顶尖论文,强依赖前沿模型的比例也仅仅从 2.7% 升到 7.3%。 超过九成的核心突破,根本不需要站在算力巅峰。 细分领域的分化更是极端。 理论与智能体基础领域,百分之百的研究完全独立于前沿模型。 可解释性研究的依赖度中位数也只有 2。 只有模型评测与基准测试,才需要顶尖模型来充当标靶。 更讽刺的是时间趋势。 随着各大实验室把算力规模推高了上百倍,安全研究对前沿模型的强依赖比例,反而从 2023 年的 6.5% 跌到了 2025 年的 1.9%。 真实的技术世界,根本没有发生所谓「不推前沿就做不了安全」。 在产业博弈里,这台机器叫叙事捆绑。 大实验室最害怕的,是安全研究与算力规模彻底解耦。 一旦学术界和公众看清楚,在几张普通显卡甚至黑板上就能把对齐、可解释性和防欺骗研究透,巨头就会失去一样最核心的资产: 对安全话语权的垄断。 他们就没法再理直气壮地要求监管机构设立极高的算力合规门槛,把开源社区和独立研究者挡在门外。 也没法再把商业扩张的野心,包装成防范末日风险的唯一通道。 更强的模型确实能让做实验更省力。 但把实验工具的便利,偷换成科学探索的前提,从来不是严谨的技术逻辑。 那是商业公司把垄断诉求包装成公共利益的经典套路。 当一家公司告诉你「为了解决危险,你必须先允许我造出更大的危险」,你该看清的不是危险本身,而是他手里的执照。 如果 97% 的安全解法根本不需要最强的模型,那张昂贵的前沿通行证,到底是在保护全人类,还是在保护他们自己的算力帝国?

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情