---
id: "mb-20260905-3118a5"
kind: "deep"
title: "做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型"
topic: "做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型"
source_type: "generated"
status: "published"
generated_at: "2026-09-05 07:31:33"
frame_type: ["叙事捆绑与能力赋能安全假说(CESH)", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型

做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型。
剩下的 97%，在小模型、开源模型或者纯理论上就做完了。
那过去几年，大模型巨头到底靠什么说服投资人和政府，给他们源源不断地批下几百亿算力预算？
靠一套被他们写进公司立足之本的假说：能力赋能安全。
Anthropic 在 2023 年的安全核心观点里白纸黑字写过：
公司存在的首要理由，就是相信必须在最前沿的 AI 系统上开展安全研究。
Sam Altman 同一年在谈及通用人工智能规划时也公开宣称：
把安全和能力分开是虚假的二分法，最好的安全成果全部来自最强的模型。
这套逻辑设计得极其精巧：
AI 有毁灭性风险。
要解决风险，必须先研究最强模型。
要拥有最强模型，就必须先砸几百亿美元把算力和能力推到极限。
商业扩张和军备竞赛，瞬间拿到了一张无可反驳的道德许可证。
每一笔买显卡的巨额开支，都被包装成了拯救全人类的前提条件。
这套讲了三年的神话，终于有人拉出真实数据对了一遍账。
研究员 Stephen McAleese 统计了 2019 到 2025 年间的 521 篇 AI 安全核心文献。
对其中 477 篇有据可查的研究，逐一用量化标准打分。
标准只有一条：这项安全研究的核心突破，到底离不离得开最顶尖的前沿模型？
结果把大实验室的招牌砸得粉碎。
477 项安全成果里，核心结论真正必须依赖前沿模型的，只有 13 篇。
占比只有 2.7%。
高达 64.4% 的研究，要么不需要跑模型，要么在早就公开的小模型上就能彻底做完。
剩下 32.9% 的研究，虽然借用了前沿模型来跑数据或打分，但核心机制在非前沿模型上同样成立。
就算把筛选标准收紧，只看引用量排在前 25% 的高影响力顶尖论文，强依赖前沿模型的比例也仅仅从 2.7% 升到 7.3%。
超过九成的核心突破，根本不需要站在算力巅峰。
细分领域的分化更是极端。
理论与智能体基础领域，百分之百的研究完全独立于前沿模型。
可解释性研究的依赖度中位数也只有 2。
只有模型评测与基准测试，才需要顶尖模型来充当标靶。
更讽刺的是时间趋势。
随着各大实验室把算力规模推高了上百倍，安全研究对前沿模型的强依赖比例，反而从 2023 年的 6.5% 跌到了 2025 年的 1.9%。
真实的技术世界，根本没有发生所谓「不推前沿就做不了安全」。
在产业博弈里，这台机器叫叙事捆绑。
大实验室最害怕的，是安全研究与算力规模彻底解耦。
一旦学术界和公众看清楚，在几张普通显卡甚至黑板上就能把对齐、可解释性和防欺骗研究透，巨头就会失去一样最核心的资产：
对安全话语权的垄断。
他们就没法再理直气壮地要求监管机构设立极高的算力合规门槛，把开源社区和独立研究者挡在门外。
也没法再把商业扩张的野心，包装成防范末日风险的唯一通道。
更强的模型确实能让做实验更省力。
但把实验工具的便利，偷换成科学探索的前提，从来不是严谨的技术逻辑。
那是商业公司把垄断诉求包装成公共利益的经典套路。
当一家公司告诉你「为了解决危险，你必须先允许我造出更大的危险」，你该看清的不是危险本身，而是他手里的执照。
如果 97% 的安全解法根本不需要最强的模型，那张昂贵的前沿通行证，到底是在保护全人类，还是在保护他们自己的算力帝国？

_Rendered by mubei-terminal._
