DEEPgeneratedpublished

把一个千亿 MoE 大模型的推理算力砍掉一半,代码里只需要改一个整数

增益解耦归一化(Decoupled Renorm机制

把一个千亿 MoE 大模型的推理算力砍掉一半,代码里只需要改一个整数。 没有重训,没有微调,没有参数蒸馏。 在 Qwen3.6 上,激活专家从 8 个砍到 4 个,常规方法会让评测暴跌 4.65 分。 改了这个整数,丢分瞬间收窄到 0.35 分。 为什么过去大模型一砍专家就变笨? 真的是因为被砍掉的那 4 个专家懂得太多? 现代细粒度混合专家(MoE)模型,每个 token 只由一小部分专家来算。 模型训练时,路由网络挑出 8 个专家,把它们的概率加起来凑成 1。 这个凑成 1 的动作,叫重新归一化。 它在训练时悄悄定死了一件事:专家分支冲进主干残差流的信号音量。 当工程师为了省算力,在推理时直接把专家从 8 个砍到 4 个,传统的代码会顺手做一次归一化。 把留下的 4 个专家的概率重新加起来,强行凑成 1。 这本是一段顺理成章的常规代码。 却制造了一场系统级灾难。 它不仅改变了谁在干活,还把活下来的 4 个专家的音量,人为放大了整整一倍。 专家的输出信号猛烈冲击残差连接,整个网络的数值平衡被瞬间冲垮。 留下的 4 个专家在主干道上大吼大叫,把主干信号彻底淹没。 模型变笨的根源,不在于知识的缺失,在于音量的失控。 陈星(Xing Chen)和姚恒帅(Hengshuai Yao)在 2026 年 9 月公开的这项研究,精准切中了这个被混淆了多年的死结。 他们把这台机器命名为:增益解耦归一化。 解法干净利落。 把「激活」与「归一化」拆成两个独立的数字。 激活专家数设为 4,硬件只跑 4 个网络,算力实打实砍掉一半。 归一化的参考分母设为 16,用前 16 个候选专家的概率总和来做除法。 算这 16 个数字的加法,耗时几乎为零。 但它把留下的专家输出增益,死死按回了训练时的安全音量。 在 11 倍体量的 Qwen3.5-397B 上,这套机制同样奏效。 激活专家从 10 个砍到 5 个,MMLU 评测只掉了 0.55 分。 如果完全去掉归一化,模型会直接崩塌。 而只用无标注文本去测困惑度(Perplexity),挑出来的参数在实际任务上又会严重翻车。 困惑度喜欢的归一化参考集,和真实下游任务喜欢的完全不是同一套。 这项研究同时揭示了一个底层规律。 在细粒度混合专家架构里,专家的身份远比分配给它们的权重重要。 过去许多被当作「智力受损」的性能暴跌。 并非模型失去了理解力。 纯粹是工程师在给系统减负时,不小心拧爆了它的输出音量。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情