---
id: "mb-20260901-c5f90f"
title: "企业和监管机构每天盯着各种 AI 跑分榜单"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-09-01 14:49:02"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260901-c5f90f"
markdown_url: "https://mubeitech.com/p/mb-20260901-c5f90f/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260901-c5f90f"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 企业和监管机构每天盯着各种 AI 跑分榜单

企业和监管机构每天盯着各种 AI 跑分榜单。
科技巨头在发布会上宣布，自家的最新模型在金融、代码或专业工作流上击败了对手。
企业采购部门愿意为这些看似专属的细分能力，支付几十倍的订阅溢价。
所有人都在假设一件事：大模型正在像人类社会一样，演化出精细的职业分工。
这些模型是真的学会了复杂的行业专业技能？
还是所有人都在把同一个行业大趋势，误读成了五花八门的垂直专精？
把 421 个大模型的测试数据拆到底，会看到一台支配着整个评测体系的隐藏机器。
构念效度错觉与日历效应。
2026 年 8 月，牛津大学学者 Louis Yiven Zhu 在预印本平台 arXiv 上发表了一项评测研究，编号 2608.29420。
他锁定了一份包含 421 个模型配置的排行榜快照，横跨 12 个主流测试基准。
其中包含 4 个专门测试软件工程、银行业务和专业工作流的经济基准。
这项研究借用了心理测量学的方法：把每个基准当成考题，把模型当成考生，放进潜在变量模型里做因子分解。
如果模型真的具备相互独立的金融特长或编程专精，统计学上必然会析出多个正交的专业能力因子。
分析结果却呈现出一种极端的单向坍塌。
单一潜在因子直接解释了 74.5% 的共性方差。
这个唯一的超级因子，与模型的发布日期高度重合，决定系数 R² 达到了 0.505。
过去的研究喜欢把能力归功于算力规模。
但只要把发布时间从模型中剥离，额外堆叠的算力几乎无法提供新的解释力。
剔除时间趋势的影响后，单一因子解释的方差份额立刻下跌 14.9 个百分点，在基座模型上更是下降 24.1 个百分点。
在预先冻结的统计学规则下，那些被寄予厚望的经济基准，根本没有形成任何独立的潜在能力维度。
心理测量学在 1904 年就遇到过几乎一模一样的现象。
查尔斯·斯皮尔曼当时发现，不管是数学、拉丁文还是音乐，学生的各项成绩背后都受同一个通用智力 g 因子支配。
今天的大模型评测，不过是把这套旧规律搬上了数字舞台。
所谓金融专精、法律逻辑、代码推理，本质上只是整个行业技术基线随时间向前滚动的副产物。
行业的技术水位在涨，所有的浮标都在跟着一起抬高。
交叉验证显示，即便多因子模型能提供一点点边缘预测修正，也无法证明存在独立存在的专业经济能力。
这个发现撕开了企业采购和 AI 治理中最大的认知黑箱。
当两个模型在同一个月份发布，榜单上那微弱的分数差距，多半只是测试随机误差带来的噪声。
当两个模型发布时间相隔几个月，哪怕它们在专业基准上拉开差距，起决定性作用的也只是日历本身。
大模型并没有建立起真正的行业分工。
整张排行榜记录的，不过是一台顺着时间轴不断向前滚动的日历机器。
当采购经理和监管者花费巨资去寻找某种专属的专业智能。
真正买下的，究竟是一张精密的职业能力地图，还是一张被印在跑分表上的发布日历？

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260901-c5f90f>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-09-01 14:49:02_
