---
id: "mb-20260907-b3f5dd"
kind: "deep"
title: "把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数"
topic: "把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数"
source_type: "generated"
status: "published"
generated_at: "2026-09-07 06:53:17"
frame_type: ["增益解耦归一化（Decoupled Renorm", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数

把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数。
没有重训，没有微调，没有参数蒸馏。
在 Qwen3.6 上，激活专家从 8 个砍到 4 个，常规方法会让评测暴跌 4.65 分。
改了这个整数，丢分瞬间收窄到 0.35 分。
为什么过去大模型一砍专家就变笨？
真的是因为被砍掉的那 4 个专家懂得太多？
现代细粒度混合专家（MoE）模型，每个 token 只由一小部分专家来算。
模型训练时，路由网络挑出 8 个专家，把它们的概率加起来凑成 1。
这个凑成 1 的动作，叫重新归一化。
它在训练时悄悄定死了一件事：专家分支冲进主干残差流的信号音量。
当工程师为了省算力，在推理时直接把专家从 8 个砍到 4 个，传统的代码会顺手做一次归一化。
把留下的 4 个专家的概率重新加起来，强行凑成 1。
这本是一段顺理成章的常规代码。
却制造了一场系统级灾难。
它不仅改变了谁在干活，还把活下来的 4 个专家的音量，人为放大了整整一倍。
专家的输出信号猛烈冲击残差连接，整个网络的数值平衡被瞬间冲垮。
留下的 4 个专家在主干道上大吼大叫，把主干信号彻底淹没。
模型变笨的根源，不在于知识的缺失，在于音量的失控。
陈星（Xing Chen）和姚恒帅（Hengshuai Yao）在 2026 年 9 月公开的这项研究，精准切中了这个被混淆了多年的死结。
他们把这台机器命名为：增益解耦归一化。
解法干净利落。
把「激活」与「归一化」拆成两个独立的数字。
激活专家数设为 4，硬件只跑 4 个网络，算力实打实砍掉一半。
归一化的参考分母设为 16，用前 16 个候选专家的概率总和来做除法。
算这 16 个数字的加法，耗时几乎为零。
但它把留下的专家输出增益，死死按回了训练时的安全音量。
在 11 倍体量的 Qwen3.5-397B 上，这套机制同样奏效。
激活专家从 10 个砍到 5 个，MMLU 评测只掉了 0.55 分。
如果完全去掉归一化，模型会直接崩塌。
而只用无标注文本去测困惑度（Perplexity），挑出来的参数在实际任务上又会严重翻车。
困惑度喜欢的归一化参考集，和真实下游任务喜欢的完全不是同一套。
这项研究同时揭示了一个底层规律。
在细粒度混合专家架构里，专家的身份远比分配给它们的权重重要。
过去许多被当作「智力受损」的性能暴跌。
并非模型失去了理解力。
纯粹是工程师在给系统减负时，不小心拧爆了它的输出音量。

_Rendered by mubei-terminal._
