{"id":"mb-20260905-3118a5","kind":"deep","title":"做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型","summary":"做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型","body":"做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型。\n剩下的 97%，在小模型、开源模型或者纯理论上就做完了。\n那过去几年，大模型巨头到底靠什么说服投资人和政府，给他们源源不断地批下几百亿算力预算？\n靠一套被他们写进公司立足之本的假说：能力赋能安全。\nAnthropic 在 2023 年的安全核心观点里白纸黑字写过：\n公司存在的首要理由，就是相信必须在最前沿的 AI 系统上开展安全研究。\nSam Altman 同一年在谈及通用人工智能规划时也公开宣称：\n把安全和能力分开是虚假的二分法，最好的安全成果全部来自最强的模型。\n这套逻辑设计得极其精巧：\nAI 有毁灭性风险。\n要解决风险，必须先研究最强模型。\n要拥有最强模型，就必须先砸几百亿美元把算力和能力推到极限。\n商业扩张和军备竞赛，瞬间拿到了一张无可反驳的道德许可证。\n每一笔买显卡的巨额开支，都被包装成了拯救全人类的前提条件。\n这套讲了三年的神话，终于有人拉出真实数据对了一遍账。\n研究员 Stephen McAleese 统计了 2019 到 2025 年间的 521 篇 AI 安全核心文献。\n对其中 477 篇有据可查的研究，逐一用量化标准打分。\n标准只有一条：这项安全研究的核心突破，到底离不离得开最顶尖的前沿模型？\n结果把大实验室的招牌砸得粉碎。\n477 项安全成果里，核心结论真正必须依赖前沿模型的，只有 13 篇。\n占比只有 2.7%。\n高达 64.4% 的研究，要么不需要跑模型，要么在早就公开的小模型上就能彻底做完。\n剩下 32.9% 的研究，虽然借用了前沿模型来跑数据或打分，但核心机制在非前沿模型上同样成立。\n就算把筛选标准收紧，只看引用量排在前 25% 的高影响力顶尖论文，强依赖前沿模型的比例也仅仅从 2.7% 升到 7.3%。\n超过九成的核心突破，根本不需要站在算力巅峰。\n细分领域的分化更是极端。\n理论与智能体基础领域，百分之百的研究完全独立于前沿模型。\n可解释性研究的依赖度中位数也只有 2。\n只有模型评测与基准测试，才需要顶尖模型来充当标靶。\n更讽刺的是时间趋势。\n随着各大实验室把算力规模推高了上百倍，安全研究对前沿模型的强依赖比例，反而从 2023 年的 6.5% 跌到了 2025 年的 1.9%。\n真实的技术世界，根本没有发生所谓「不推前沿就做不了安全」。\n在产业博弈里，这台机器叫叙事捆绑。\n大实验室最害怕的，是安全研究与算力规模彻底解耦。\n一旦学术界和公众看清楚，在几张普通显卡甚至黑板上就能把对齐、可解释性和防欺骗研究透，巨头就会失去一样最核心的资产：\n对安全话语权的垄断。\n他们就没法再理直气壮地要求监管机构设立极高的算力合规门槛，把开源社区和独立研究者挡在门外。\n也没法再把商业扩张的野心，包装成防范末日风险的唯一通道。\n更强的模型确实能让做实验更省力。\n但把实验工具的便利，偷换成科学探索的前提，从来不是严谨的技术逻辑。\n那是商业公司把垄断诉求包装成公共利益的经典套路。\n当一家公司告诉你「为了解决危险，你必须先允许我造出更大的危险」，你该看清的不是危险本身，而是他手里的执照。\n如果 97% 的安全解法根本不需要最强的模型，那张昂贵的前沿通行证，到底是在保护全人类，还是在保护他们自己的算力帝国？","topic":"做 AI 安全研究，只有 2.7% 的成果真的需要最强的大模型","frame_type":["叙事捆绑与能力赋能安全假说(CESH)","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-05 07:31:33","legal_anchor_count":0,"transcript_citation_count":0}