{"id":"mb-20260825-353d41","account":"mubei","brand":"","title":"每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜","summary":"每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜","body":"每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜。\n跑分比对手高出 0.5% 或者 1%，就能在技术报告里宣布全面超越。\n整个行业都在为这零点几个百分点抢夺行业第一。\n但最新发表在 arXiv 上的一篇论文，把大模型排行榜的底牌掀了个底朝天。\n学者 Raghu Parupudi 做了一场严密的对照实验（arXiv:2608.21382）。\n题目完全一样，模型权重完全一样，贪心解码完全锁死。\n仅仅换了换测试时的提示词模板和打分方式。\n同一款开源大模型 gemma4-31b，得分直接从 31% 一路狂飙到了 89%。\n整整 58 个百分点的断崖落差。\n模型自身没有发生任何变化。\n两个模型在排行榜上差的那两三个百分点，到底代表了什么？\n是真实的能力代差，还是某种测量仪器的随机戏法？\n拆开评测系统的黑箱，底下藏着一台真正左右排名的冰冷机器。\n它的名字叫「评测支架」与「配置脆弱题」。\n很多人以为只要固定了考题和标准答案，评测结果就是绝对客观的。\n但测试大模型还有一个看不见的外壳，叫做评测支架（Harness）。\n选项按什么顺序排，提示词用什么句式引导，答案是从生成的文本里抓取，还是直接计算每个选项的似然度概率。\n这些全由评测支架说了算。\n为了测出这个外壳的破坏力，研究者搭了一套「脆弱性网格」。\n选出 4 个主流家族的 12 款开源指令微调大模型。\n跑 MMLU、ARC、HellaSwag、TruthfulQA 4 个权威题库，总共 3679 道题。\n在 26 种完全合规的评测支架配置下，逐题记录对错。\n跑出来的硬数据，彻底颠覆了行业常识。\n一个模型的跑分，根本不是一个确定的「点」，是一整个宽阔的「分数带」。\n谁当冠军，甚至不是由模型自身的能力决定的。\n12 款模型里，有 4 款都能在某一种合规配置下登顶第一。\n换一套测试外壳，冠军就换一个人。\n真正把两个相邻模型拉开差距的，又是什么？\n论文给出了一个极为惊人的统计：\n在那些模型能够稳定回答的题目上，相邻两个模型其实完全打成平手。\n榜单上拉开分差的全部重量，平均有 95.7% 压在「配置脆弱题」上。\n所谓的分差，绝大部分来自那些换个提示词格式就忽对忽错的摇摆题。\n甚至连行业通用的题库精简算法，都在制造逆向淘汰。\n算法专门挑选区分度高的题目来压缩题库。\n但题目区分度与脆弱性的相关性高达 0.28。\n越想筛选出高区分度的题，越把这批脆弱的摇摆题当成宝贝留了下来。\n真正决定分数的承重轴，也不是大家惯常关注的选项顺序，是文本生成与概率计算之间的打分逻辑分歧。\n过去几年，整个行业围绕着零点几个百分点的榜单优势，完成了巨额融资与技术公关。\n那些被大肆宣传的微弱优势，往往不是技术架构的深沟高垒。\n它只是一套评测支架在摇摆题上掷出来的随机点数。\n当一套评价体系把 95% 的分差建立在随风摇摆的脆弱题上，它给出的究竟是真实的能力标尺，还是测量工具制造出来的集体幻觉？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:38","created_at":"2026-08-25 12:04:38"}