{"id":"mb-20260907-b3f5dd","kind":"deep","title":"把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数","summary":"把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数","body":"把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数。\n没有重训，没有微调，没有参数蒸馏。\n在 Qwen3.6 上，激活专家从 8 个砍到 4 个，常规方法会让评测暴跌 4.65 分。\n改了这个整数，丢分瞬间收窄到 0.35 分。\n为什么过去大模型一砍专家就变笨？\n真的是因为被砍掉的那 4 个专家懂得太多？\n现代细粒度混合专家（MoE）模型，每个 token 只由一小部分专家来算。\n模型训练时，路由网络挑出 8 个专家，把它们的概率加起来凑成 1。\n这个凑成 1 的动作，叫重新归一化。\n它在训练时悄悄定死了一件事：专家分支冲进主干残差流的信号音量。\n当工程师为了省算力，在推理时直接把专家从 8 个砍到 4 个，传统的代码会顺手做一次归一化。\n把留下的 4 个专家的概率重新加起来，强行凑成 1。\n这本是一段顺理成章的常规代码。\n却制造了一场系统级灾难。\n它不仅改变了谁在干活，还把活下来的 4 个专家的音量，人为放大了整整一倍。\n专家的输出信号猛烈冲击残差连接，整个网络的数值平衡被瞬间冲垮。\n留下的 4 个专家在主干道上大吼大叫，把主干信号彻底淹没。\n模型变笨的根源，不在于知识的缺失，在于音量的失控。\n陈星（Xing Chen）和姚恒帅（Hengshuai Yao）在 2026 年 9 月公开的这项研究，精准切中了这个被混淆了多年的死结。\n他们把这台机器命名为：增益解耦归一化。\n解法干净利落。\n把「激活」与「归一化」拆成两个独立的数字。\n激活专家数设为 4，硬件只跑 4 个网络，算力实打实砍掉一半。\n归一化的参考分母设为 16，用前 16 个候选专家的概率总和来做除法。\n算这 16 个数字的加法，耗时几乎为零。\n但它把留下的专家输出增益，死死按回了训练时的安全音量。\n在 11 倍体量的 Qwen3.5-397B 上，这套机制同样奏效。\n激活专家从 10 个砍到 5 个，MMLU 评测只掉了 0.55 分。\n如果完全去掉归一化，模型会直接崩塌。\n而只用无标注文本去测困惑度（Perplexity），挑出来的参数在实际任务上又会严重翻车。\n困惑度喜欢的归一化参考集，和真实下游任务喜欢的完全不是同一套。\n这项研究同时揭示了一个底层规律。\n在细粒度混合专家架构里，专家的身份远比分配给它们的权重重要。\n过去许多被当作「智力受损」的性能暴跌。\n并非模型失去了理解力。\n纯粹是工程师在给系统减负时，不小心拧爆了它的输出音量。","topic":"把一个千亿 MoE 大模型的推理算力砍掉一半，代码里只需要改一个整数","frame_type":["增益解耦归一化（Decoupled Renorm","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-07 06:53:17","legal_anchor_count":0,"transcript_citation_count":0}