---
id: "mb-20260825-353d41"
title: "每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-25 12:04:38"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260825-353d41"
markdown_url: "https://mubeitech.com/p/mb-20260825-353d41/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260825-353d41"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜

每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜。
跑分比对手高出 0.5% 或者 1%，就能在技术报告里宣布全面超越。
整个行业都在为这零点几个百分点抢夺行业第一。
但最新发表在 arXiv 上的一篇论文，把大模型排行榜的底牌掀了个底朝天。
学者 Raghu Parupudi 做了一场严密的对照实验（arXiv:2608.21382）。
题目完全一样，模型权重完全一样，贪心解码完全锁死。
仅仅换了换测试时的提示词模板和打分方式。
同一款开源大模型 gemma4-31b，得分直接从 31% 一路狂飙到了 89%。
整整 58 个百分点的断崖落差。
模型自身没有发生任何变化。
两个模型在排行榜上差的那两三个百分点，到底代表了什么？
是真实的能力代差，还是某种测量仪器的随机戏法？
拆开评测系统的黑箱，底下藏着一台真正左右排名的冰冷机器。
它的名字叫「评测支架」与「配置脆弱题」。
很多人以为只要固定了考题和标准答案，评测结果就是绝对客观的。
但测试大模型还有一个看不见的外壳，叫做评测支架（Harness）。
选项按什么顺序排，提示词用什么句式引导，答案是从生成的文本里抓取，还是直接计算每个选项的似然度概率。
这些全由评测支架说了算。
为了测出这个外壳的破坏力，研究者搭了一套「脆弱性网格」。
选出 4 个主流家族的 12 款开源指令微调大模型。
跑 MMLU、ARC、HellaSwag、TruthfulQA 4 个权威题库，总共 3679 道题。
在 26 种完全合规的评测支架配置下，逐题记录对错。
跑出来的硬数据，彻底颠覆了行业常识。
一个模型的跑分，根本不是一个确定的「点」，是一整个宽阔的「分数带」。
谁当冠军，甚至不是由模型自身的能力决定的。
12 款模型里，有 4 款都能在某一种合规配置下登顶第一。
换一套测试外壳，冠军就换一个人。
真正把两个相邻模型拉开差距的，又是什么？
论文给出了一个极为惊人的统计：
在那些模型能够稳定回答的题目上，相邻两个模型其实完全打成平手。
榜单上拉开分差的全部重量，平均有 95.7% 压在「配置脆弱题」上。
所谓的分差，绝大部分来自那些换个提示词格式就忽对忽错的摇摆题。
甚至连行业通用的题库精简算法，都在制造逆向淘汰。
算法专门挑选区分度高的题目来压缩题库。
但题目区分度与脆弱性的相关性高达 0.28。
越想筛选出高区分度的题，越把这批脆弱的摇摆题当成宝贝留了下来。
真正决定分数的承重轴，也不是大家惯常关注的选项顺序，是文本生成与概率计算之间的打分逻辑分歧。
过去几年，整个行业围绕着零点几个百分点的榜单优势，完成了巨额融资与技术公关。
那些被大肆宣传的微弱优势，往往不是技术架构的深沟高垒。
它只是一套评测支架在摇摆题上掷出来的随机点数。
当一套评价体系把 95% 的分差建立在随风摇摆的脆弱题上，它给出的究竟是真实的能力标尺，还是测量工具制造出来的集体幻觉？

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260825-353d41>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-25 12:04:38_
