企业和监管机构每天盯着各种 AI 跑分榜单
企业和监管机构每天盯着各种 AI 跑分榜单。 科技巨头在发布会上宣布,自家的最新模型在金融、代码或专业工作流上击败了对手。 企业采购部门愿意为这些看似专属的细分能力,支付几十倍的订阅溢价。 所有人都在假设一件事:大模型正在像人类社会一样,演化出精细的职业分工。 这些模型是真的学会了复杂的行业专业技能? 还是所有人都在把同一个行业大趋势,误读成了五花八门的垂直专精? 把 421 个大模型的测试数据拆到底,会看到一台支配着整个评测体系的隐藏机器。 构念效度错觉与日历效应。 2026 年 8 月,牛津大学学者 Louis Yiven Zhu 在预印本平台 arXiv 上发表了一项评测研究,编号 2608.29420。 他锁定了一份包含 421 个模型配置的排行榜快照,横跨 12 个主流测试基准。 其中包含 4 个专门测试软件工程、银行业务和专业工作流的经济基准。 这项研究借用了心理测量学的方法:把每个基准当成考题,把模型当成考生,放进潜在变量模型里做因子分解。 如果模型真的具备相互独立的金融特长或编程专精,统计学上必然会析出多个正交的专业能力因子。 分析结果却呈现出一种极端的单向坍塌。 单一潜在因子直接解释了 74.5% 的共性方差。 这个唯一的超级因子,与模型的发布日期高度重合,决定系数 R² 达到了 0.505。 过去的研究喜欢把能力归功于算力规模。 但只要把发布时间从模型中剥离,额外堆叠的算力几乎无法提供新的解释力。 剔除时间趋势的影响后,单一因子解释的方差份额立刻下跌 14.9 个百分点,在基座模型上更是下降 24.1 个百分点。 在预先冻结的统计学规则下,那些被寄予厚望的经济基准,根本没有形成任何独立的潜在能力维度。 心理测量学在 1904 年就遇到过几乎一模一样的现象。 查尔斯·斯皮尔曼当时发现,不管是数学、拉丁文还是音乐,学生的各项成绩背后都受同一个通用智力 g 因子支配。 今天的大模型评测,不过是把这套旧规律搬上了数字舞台。 所谓金融专精、法律逻辑、代码推理,本质上只是整个行业技术基线随时间向前滚动的副产物。 行业的技术水位在涨,所有的浮标都在跟着一起抬高。 交叉验证显示,即便多因子模型能提供一点点边缘预测修正,也无法证明存在独立存在的专业经济能力。 这个发现撕开了企业采购和 AI 治理中最大的认知黑箱。 当两个模型在同一个月份发布,榜单上那微弱的分数差距,多半只是测试随机误差带来的噪声。 当两个模型发布时间相隔几个月,哪怕它们在专业基准上拉开差距,起决定性作用的也只是日历本身。 大模型并没有建立起真正的行业分工。 整张排行榜记录的,不过是一台顺着时间轴不断向前滚动的日历机器。 当采购经理和监管者花费巨资去寻找某种专属的专业智能。 真正买下的,究竟是一张精密的职业能力地图,还是一张被印在跑分表上的发布日历?
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。