科技·via

很多人做垂类大模型,都有一个美好的设想

很多人做垂类大模型,都有一个美好的设想。 既然几百亿参数的模型在云端运行太贵、延迟太高。 那就通过剪枝和蒸馏,把它压缩成几十亿参数的端侧小模型。 只要在训练时疯狂给它喂量化金融、医疗或者法律的专业数据。 不就能用极低的算力成本,换来一个垂直领域的专家? 但为什么很多在测试集上跑分极高的小模型,一放到真实业务里就漏洞百出? 甚至在遇到复杂环境时,会频繁产生低级的逻辑幻觉? 当我们把一个庞大的神经网络向下压缩时,它最先丢掉的到底是什么? 2026 年 8 月,arXiv 上的一篇新论文把这个暗坑的底牌彻底翻了出来。 来自 NVIDIA 的研究学者 Lavinia Ghita、Dhruv Desai 和 Ioana Boier,给领域特定的大模型蒸馏推导出了一套全新的缩放定律。 他们用 50 万条金融新闻构成的 FinHeadlineMix 数据集作为实验场景。 对比了迭代结构化剪枝下的 Logit 蒸馏与 LoRA 蒸馏。 实验抓到了一个反常识的物理现象。 在模型被压缩的过程中,垂直领域的专业任务能力并没有断崖下跌。 它表现出平缓、可预测的线性衰减。 真正率先发生雪崩式坍塌的,是模型的通用常识基准。 通识能力的断崖,远在领域能力衰减之前就早已发生。 这直接戳破了过去垂直小模型的经验主义幻觉。 很多人以为通用知识是冗余的边角料,删掉也无伤大雅。 现实是,任何垂直领域的深度推演,底层全靠通识逻辑和因果表征在支撑。 通识一旦提前崩塌,小模型立刻退化成一个只能在固定题库里死记硬背的偏科生。 它表面上跑分漂亮,实质上已经失去了跨情境理解和复杂推理的能力。 这台让压缩模型失控的机器,核心卡点在监督格式上。 传统的蒸馏方式只对齐最终输出的概率分布,让 KL 散度在长推理链条上剧烈震荡。 剪枝的剪刀切下去,最先切断的就是高维空间里复杂的推理网络。 NVIDIA 团队给出的破局解法,叫混合思维链监督损失。 它没有停留在强迫小模型模仿大模型的最终答案。 它把大模型在得出结论前一步一步的推理痕迹,完整蒸馏给小模型。 思维链在这个时候,变成了一套不可替代的认知支架。 它在参数被剪掉的同时,把原本会被抹杀的通识逻辑结构,硬生生重新焊接回了神经网络里。 决定垂直模型上限的,从不取决于背诵了多少专业术语。 取决于底层支撑逻辑推演的通识结构,到底保留了多少。 绕开推理轨迹去谈模型压缩,做出来的终究只是一台脆弱的过拟合玩具。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情