{"id":"mb-20260901-c5f90f","account":"mubei","brand":"","title":"企业和监管机构每天盯着各种 AI 跑分榜单","summary":"企业和监管机构每天盯着各种 AI 跑分榜单","body":"企业和监管机构每天盯着各种 AI 跑分榜单。\n科技巨头在发布会上宣布，自家的最新模型在金融、代码或专业工作流上击败了对手。\n企业采购部门愿意为这些看似专属的细分能力，支付几十倍的订阅溢价。\n所有人都在假设一件事：大模型正在像人类社会一样，演化出精细的职业分工。\n这些模型是真的学会了复杂的行业专业技能？\n还是所有人都在把同一个行业大趋势，误读成了五花八门的垂直专精？\n把 421 个大模型的测试数据拆到底，会看到一台支配着整个评测体系的隐藏机器。\n构念效度错觉与日历效应。\n2026 年 8 月，牛津大学学者 Louis Yiven Zhu 在预印本平台 arXiv 上发表了一项评测研究，编号 2608.29420。\n他锁定了一份包含 421 个模型配置的排行榜快照，横跨 12 个主流测试基准。\n其中包含 4 个专门测试软件工程、银行业务和专业工作流的经济基准。\n这项研究借用了心理测量学的方法：把每个基准当成考题，把模型当成考生，放进潜在变量模型里做因子分解。\n如果模型真的具备相互独立的金融特长或编程专精，统计学上必然会析出多个正交的专业能力因子。\n分析结果却呈现出一种极端的单向坍塌。\n单一潜在因子直接解释了 74.5% 的共性方差。\n这个唯一的超级因子，与模型的发布日期高度重合，决定系数 R² 达到了 0.505。\n过去的研究喜欢把能力归功于算力规模。\n但只要把发布时间从模型中剥离，额外堆叠的算力几乎无法提供新的解释力。\n剔除时间趋势的影响后，单一因子解释的方差份额立刻下跌 14.9 个百分点，在基座模型上更是下降 24.1 个百分点。\n在预先冻结的统计学规则下，那些被寄予厚望的经济基准，根本没有形成任何独立的潜在能力维度。\n心理测量学在 1904 年就遇到过几乎一模一样的现象。\n查尔斯·斯皮尔曼当时发现，不管是数学、拉丁文还是音乐，学生的各项成绩背后都受同一个通用智力 g 因子支配。\n今天的大模型评测，不过是把这套旧规律搬上了数字舞台。\n所谓金融专精、法律逻辑、代码推理，本质上只是整个行业技术基线随时间向前滚动的副产物。\n行业的技术水位在涨，所有的浮标都在跟着一起抬高。\n交叉验证显示，即便多因子模型能提供一点点边缘预测修正，也无法证明存在独立存在的专业经济能力。\n这个发现撕开了企业采购和 AI 治理中最大的认知黑箱。\n当两个模型在同一个月份发布，榜单上那微弱的分数差距，多半只是测试随机误差带来的噪声。\n当两个模型发布时间相隔几个月，哪怕它们在专业基准上拉开差距，起决定性作用的也只是日历本身。\n大模型并没有建立起真正的行业分工。\n整张排行榜记录的，不过是一台顺着时间轴不断向前滚动的日历机器。\n当采购经理和监管者花费巨资去寻找某种专属的专业智能。\n真正买下的，究竟是一张精密的职业能力地图，还是一张被印在跑分表上的发布日历？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-09-01 14:49:02","created_at":"2026-09-01 14:49:02"}