顶级 AI 实验室折腾了 6 年模型架构,省下的算力还不到数据清洗的三分之一
顶级 AI 实验室折腾了 6 年模型架构,省下的算力还不到数据清洗的三分之一。 算力效率提升了 12 倍靠洗数据,只有 3.7 倍靠改模型。 算力收益上,数据直接甩开架构 3.24 倍。 年薪百万的算法科学家,真被数据清洗工降维打击了? 并没有。
2026 年 9 月,普林斯顿的 Jerry Han 和科技访谈人 Dwarkesh Patel 做了一个跨越 6 年的严格对照实验。 他们把 2019 到 2025 年之间、每一年的开源模型配方和公开数据集做了全矩阵交叉训练。 从 2019 年的初代 GPT-2,一路测到 2025 年的 OLMo-2。 从 2019 年只有 90 亿词元的 OpenWebText,一路换到抓遍全网的 UltraFineWeb。 在 1e19 次浮点运算的算力预算下,用统一的分词器在 10 个测试集上跑最终能力评测。 数据分析结果干净利落: 88% 的模型能力变化,可以用数据和架构的线性相加直接解释。 两者各自独立演进,互不挑食,几乎没有协同交互。 把 2025 年的架构配上 2019 年的数据,算力效率提升 3.7 倍。 把 2025 年的数据塞给 2019 年的模型,算力效率暴涨 12 倍。
单看这组数字,很容易得出一个粗暴的推论: 顶尖学者辛辛苦苦推导的数学公式,在抓网页、写清洗分类器的工程师面前全是不顶用的花架子。 但这个理解,把模型架构研究的战场彻底看歪了。 这项实验测的指标叫算力效率,也就是花相同的浮点运算量,到底能在小考卷上多拿几分。 在 1e19 这种小规模沙盒里,模型架构确实只抠出了不到 4 倍的效率。 前沿实验室投入巨资搞架构创新,根本不是为了在这张小考卷上抠分。 它的硬仗,是消除扩展约束。
把大语言模型想象成水面上的船。 2019 年的 GPT-2,就是一艘单人木帆船。 如果当时把 10 万张顶级芯片联机、数万亿词元的浩瀚数据直接灌给 GPT-2,会发生什么? 这艘帆船会在一秒钟之内解体。 梯度爆炸,数值溢出,显存带宽跑死,集群通信死锁,几千步训练就会砸出无法恢复的数值尖峰。 过去 6 年算法科学家到底在干什么? 把绝对位置编码换成旋转位置编码 RoPE,解决序列变长时的注意力位置坍塌。 把层归一化换成 RMSNorm,给前馈网络装上 SwiGLU 门控,让激活值在百层深网里顺畅流动。 发明预归一化 Pre-LN,加上 QK-Norm 锁死点积注意力的方差爆炸。 再在底层写入 FlashAttention 和混合专家架构 MoE,绕开显存带宽墙。 如果只拿这些精巧部件在浅水区跑单项测速,它确实只快了 3.7 倍。 但这些改进的真正威力,是把一艘单薄的木帆船,焊成了一艘 20 万吨级的防暴集装箱巨轮。 巨轮在浅水区测不出速度优势。 它能抗得住十几万张卡跨机集群的滔天巨浪,能让千亿参数在几个月的漫长训练里稳定吞吐,不炸模,不翻船。
数据清洗的角色,恰恰是在巨轮造好之后发生了位移。 在木帆船时代,船体承载力只有巴掌大。 模型容量太小,只要混进一点垃圾网页,参数空间立刻被污染。 所以工程师必须像淘金一样,只挑 Reddit 上被人类高赞投票过的页面,数据洗得越干净,收益越明显。 可一旦你拥有了一艘 20 万吨巨轮,情况完全反了过来。 上千亿参数的网络配合随机梯度下降算法,本身就是一台超大功率的工业离心机。 只要总吞吐量足够大,海量参数自己在风浪中就能把信号与噪音剥离。 这时候如果还搞过度清洗,导致数据总量不足,反而得把同一个数据集反复跑几十遍,模型的实际泛化能力反而大幅倒退。 为了压低部署后的在线推理成本,现在的顶尖团队宁可在全网数据上强行超额训练 100 倍,远远超出 Chinchilla 最优配比。
数据工程决定了每一滴燃油能跑出多少公里。 架构创新决定了人类能不能造出一台烧掉上千吨燃油而不散架的巨型引擎。 没有洗好的优质燃料,巨轮跑得没那么经济; 可要是没有那艘扛住暴风雨的钢铁巨轮,手里洗得再干净的一小撮特种燃油,又能加进哪台玩具车里?
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。