{"id":"mb-20260907-4f01b4","kind":"deep","title":"让大模型解码速度暴涨 1.7 倍、吞吐量飙升 5 倍，需要的改动只有不到 0.5% 的参数","summary":"让大模型解码速度暴涨 1.7 倍、吞吐量飙升 5 倍，需要的改动只有不到 0.5% 的参数","body":"让大模型解码速度暴涨 1.7 倍、吞吐量飙升 5 倍，需要的改动只有不到 0.5% 的参数。\n既没有重写底层注意力算法，也没有换上更昂贵的显卡。\n只是在沿用了近十年的经典结构里，悄悄加了一行计算。\n为什么多算一步，换来的反而是几乎翻倍的推理速度？\n常规的算力直觉在这里彻底失效了。\n所有人都在抱怨大模型吃显存。\n当上下文拉长到几万、几十万个标记，庞大的 KV 缓存连最顶级的专业显卡也塞不下。\n工程上唯一的出路，是把装不下的缓存扔进主机的普通内存，要用的时候再临时往显卡里搬。\n但只要你这么做，生成速度就会瞬间断崖式跌落。\n显卡算得再快，大部分时间只能干等着数据从慢速总线上一点点挪过来。\n这台卡死了整个行业长文本推理的隐形机器，到底卡在什么地方？\n在标准的 Transformer 架构里，每一层注意力都在算三样东西：查询 Q、键 K、值 V。\n这是自 2017 年诞生以来被奉为铁律的标准对话。\n当前这层要算什么，必须先由自己的查询向量 Q 算出来，才能回头去上下文里挑出有用的碎片。\n这就制造了一个致命的串行死锁。\n第 1 层算完了，轮到第 2 层。\n第 2 层必须先花时间算出自己的 Q，才知道自己需要哪几块内存数据。\n显卡只能停下计算，发出指令，等着数据跨过 PCIe 总线慢吞吞运进显存。\n等数据终于到了，显卡才开始真正做数学计算。\n计算在等传输，传输在等查询。\n显卡里成千上万个计算核心，大半时间都在原地发呆。\nNVIDIA 与麻省理工学院韩松团队在 2026 年 6 月发表的 SparDA 架构，切中了这个死结。\n他们给每个注意力层配了第四个投影头：预测头 F。\n这第四个头不参与当前的注意力运算。\n它的唯一任务，就是在第 1 层还在算自己的数学题时，提前预判第 2 层马上要用到哪些上下文数据块。\n这一步让整个推理流水线彻底解耦。\n当第 1 层在显卡核心里全力运转时，一条独立的 CUDA 异步传输流已经在后台启动，把第 2 层需要的数据提前从主机内存搬进了高速显存。\n等第 1 层算完交棒给第 2 层，下一轮计算要吃的所有数据，已经严丝合缝地停在显存里等它。\n跨总线传输的时间，被完全藏进了上一层计算的时间里。\n这就是预测解耦预取。\n为了完成这个前瞻动作，模型只增加了不到 0.5% 的预测头参数，骨干网络完全不需要重新训练。\n换来的，是 1.7 倍的解码加速，以及在单张显卡上跑大批量任务时 5.3 倍的吞吐量爆发。\n计算机体系结构演进几十年来，最顶级的性能飞跃往往不来自把算盘拨得更快。\n它来自把那些原本必须互相等待的断点，在时间线上完全重叠起来。\n硬件的物理墙从来不会凭空消失。\n能跑在最前面的系统，只是在别人停下来等数据的时候，悄悄把下一步的原料提前摆上了流水线。","topic":"让大模型解码速度暴涨 1.7 倍、吞吐量飙升 5 倍，需要的改动只有不到 0.5% 的参数","frame_type":["预测解耦预取与延迟隐藏","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-07 06:53:24","legal_anchor_count":0,"transcript_citation_count":0}