---
id: "mb-20260825-353d41"
kind: "deep"
title: "每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜"
topic: "每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜"
source_type: "generated"
status: "published"
generated_at: "2026-08-25 12:04:38"
frame_type: ["评测支架效应与配置脆弱题", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜

> 本框架为第三方 AI 对公开观点的解读，非郭文贵本人发声。

每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜。
跑分比对手高出 0.5% 或者 1%，就能在技术报告里宣布全面超越。
整个行业都在为这零点几个百分点抢夺行业第一。
但最新发表在 arXiv 上的一篇论文，把大模型排行榜的底牌掀了个底朝天。
学者 Raghu Parupudi 做了一场严密的对照实验（arXiv:2608.21382）。
题目完全一样，模型权重完全一样，贪心解码完全锁死。
仅仅换了换测试时的提示词模板和打分方式。
同一款开源大模型 gemma4-31b，得分直接从 31% 一路狂飙到了 89%。
整整 58 个百分点的断崖落差。
模型自身没有发生任何变化。
两个模型在排行榜上差的那两三个百分点，到底代表了什么？
是真实的能力代差，还是某种测量仪器的随机戏法？
拆开评测系统的黑箱，底下藏着一台真正左右排名的冰冷机器。
它的名字叫「评测支架」与「配置脆弱题」。
很多人以为只要固定了考题和标准答案，评测结果就是绝对客观的。
但测试大模型还有一个看不见的外壳，叫做评测支架（Harness）。
选项按什么顺序排，提示词用什么句式引导，答案是从生成的文本里抓取，还是直接计算每个选项的似然度概率。
这些全由评测支架说了算。
为了测出这个外壳的破坏力，研究者搭了一套「脆弱性网格」。
选出 4 个主流家族的 12 款开源指令微调大模型。
跑 MMLU、ARC、HellaSwag、TruthfulQA 4 个权威题库，总共 3679 道题。
在 26 种完全合规的评测支架配置下，逐题记录对错。
跑出来的硬数据，彻底颠覆了行业常识。
一个模型的跑分，根本不是一个确定的「点」，是一整个宽阔的「分数带」。
谁当冠军，甚至不是由模型自身的能力决定的。
12 款模型里，有 4 款都能在某一种合规配置下登顶第一。
换一套测试外壳，冠军就换一个人。
真正把两个相邻模型拉开差距的，又是什么？
论文给出了一个极为惊人的统计：
在那些模型能够稳定回答的题目上，相邻两个模型其实完全打成平手。
榜单上拉开分差的全部重量，平均有 95.7% 压在「配置脆弱题」上。
所谓的分差，绝大部分来自那些换个提示词格式就忽对忽错的摇摆题。
甚至连行业通用的题库精简算法，都在制造逆向淘汰。
算法专门挑选区分度高的题目来压缩题库。
但题目区分度与脆弱性的相关性高达 0.28。
越想筛选出高区分度的题，越把这批脆弱的摇摆题当成宝贝留了下来。
真正决定分数的承重轴，也不是大家惯常关注的选项顺序，是文本生成与概率计算之间的打分逻辑分歧。
过去几年，整个行业围绕着零点几个百分点的榜单优势，完成了巨额融资与技术公关。
那些被大肆宣传的微弱优势，往往不是技术架构的深沟高垒。
它只是一套评测支架在摇摆题上掷出来的随机点数。
当一套评价体系把 95% 的分差建立在随风摇摆的脆弱题上，它给出的究竟是真实的能力标尺，还是测量工具制造出来的集体幻觉？

_Rendered by mubei-terminal._
