每一个大模型发布会最显眼的位置,永远摆着一张基准测试排行榜
每一个大模型发布会最显眼的位置,永远摆着一张基准测试排行榜。 跑分比对手高出 0.5% 或者 1%,就能在技术报告里宣布全面超越。 整个行业都在为这零点几个百分点抢夺行业第一。 但最新发表在 arXiv 上的一篇论文,把大模型排行榜的底牌掀了个底朝天。 学者 Raghu Parupudi 做了一场严密的对照实验(arXiv:2608.21382)。 题目完全一样,模型权重完全一样,贪心解码完全锁死。 仅仅换了换测试时的提示词模板和打分方式。 同一款开源大模型 gemma4-31b,得分直接从 31% 一路狂飙到了 89%。 整整 58 个百分点的断崖落差。 模型自身没有发生任何变化。 两个模型在排行榜上差的那两三个百分点,到底代表了什么? 是真实的能力代差,还是某种测量仪器的随机戏法? 拆开评测系统的黑箱,底下藏着一台真正左右排名的冰冷机器。 它的名字叫「评测支架」与「配置脆弱题」。 很多人以为只要固定了考题和标准答案,评测结果就是绝对客观的。 但测试大模型还有一个看不见的外壳,叫做评测支架(Harness)。 选项按什么顺序排,提示词用什么句式引导,答案是从生成的文本里抓取,还是直接计算每个选项的似然度概率。 这些全由评测支架说了算。 为了测出这个外壳的破坏力,研究者搭了一套「脆弱性网格」。 选出 4 个主流家族的 12 款开源指令微调大模型。 跑 MMLU、ARC、HellaSwag、TruthfulQA 4 个权威题库,总共 3679 道题。 在 26 种完全合规的评测支架配置下,逐题记录对错。 跑出来的硬数据,彻底颠覆了行业常识。 一个模型的跑分,根本不是一个确定的「点」,是一整个宽阔的「分数带」。 谁当冠军,甚至不是由模型自身的能力决定的。 12 款模型里,有 4 款都能在某一种合规配置下登顶第一。 换一套测试外壳,冠军就换一个人。 真正把两个相邻模型拉开差距的,又是什么? 论文给出了一个极为惊人的统计: 在那些模型能够稳定回答的题目上,相邻两个模型其实完全打成平手。 榜单上拉开分差的全部重量,平均有 95.7% 压在「配置脆弱题」上。 所谓的分差,绝大部分来自那些换个提示词格式就忽对忽错的摇摆题。 甚至连行业通用的题库精简算法,都在制造逆向淘汰。 算法专门挑选区分度高的题目来压缩题库。 但题目区分度与脆弱性的相关性高达 0.28。 越想筛选出高区分度的题,越把这批脆弱的摇摆题当成宝贝留了下来。 真正决定分数的承重轴,也不是大家惯常关注的选项顺序,是文本生成与概率计算之间的打分逻辑分歧。 过去几年,整个行业围绕着零点几个百分点的榜单优势,完成了巨额融资与技术公关。 那些被大肆宣传的微弱优势,往往不是技术架构的深沟高垒。 它只是一套评测支架在摇摆题上掷出来的随机点数。 当一套评价体系把 95% 的分差建立在随风摇摆的脆弱题上,它给出的究竟是真实的能力标尺,还是测量工具制造出来的集体幻觉?
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。