DEEPgeneratedpublished

让大模型解码速度暴涨 1.7 倍、吞吐量飙升 5 倍,需要的改动只有不到 0.5% 的参数

预测解耦预取与延迟隐藏机制

让大模型解码速度暴涨 1.7 倍、吞吐量飙升 5 倍,需要的改动只有不到 0.5% 的参数。 既没有重写底层注意力算法,也没有换上更昂贵的显卡。 只是在沿用了近十年的经典结构里,悄悄加了一行计算。 为什么多算一步,换来的反而是几乎翻倍的推理速度? 常规的算力直觉在这里彻底失效了。 所有人都在抱怨大模型吃显存。 当上下文拉长到几万、几十万个标记,庞大的 KV 缓存连最顶级的专业显卡也塞不下。 工程上唯一的出路,是把装不下的缓存扔进主机的普通内存,要用的时候再临时往显卡里搬。 但只要你这么做,生成速度就会瞬间断崖式跌落。 显卡算得再快,大部分时间只能干等着数据从慢速总线上一点点挪过来。 这台卡死了整个行业长文本推理的隐形机器,到底卡在什么地方? 在标准的 Transformer 架构里,每一层注意力都在算三样东西:查询 Q、键 K、值 V。 这是自 2017 年诞生以来被奉为铁律的标准对话。 当前这层要算什么,必须先由自己的查询向量 Q 算出来,才能回头去上下文里挑出有用的碎片。 这就制造了一个致命的串行死锁。 第 1 层算完了,轮到第 2 层。 第 2 层必须先花时间算出自己的 Q,才知道自己需要哪几块内存数据。 显卡只能停下计算,发出指令,等着数据跨过 PCIe 总线慢吞吞运进显存。 等数据终于到了,显卡才开始真正做数学计算。 计算在等传输,传输在等查询。 显卡里成千上万个计算核心,大半时间都在原地发呆。 NVIDIA 与麻省理工学院韩松团队在 2026 年 6 月发表的 SparDA 架构,切中了这个死结。 他们给每个注意力层配了第四个投影头:预测头 F。 这第四个头不参与当前的注意力运算。 它的唯一任务,就是在第 1 层还在算自己的数学题时,提前预判第 2 层马上要用到哪些上下文数据块。 这一步让整个推理流水线彻底解耦。 当第 1 层在显卡核心里全力运转时,一条独立的 CUDA 异步传输流已经在后台启动,把第 2 层需要的数据提前从主机内存搬进了高速显存。 等第 1 层算完交棒给第 2 层,下一轮计算要吃的所有数据,已经严丝合缝地停在显存里等它。 跨总线传输的时间,被完全藏进了上一层计算的时间里。 这就是预测解耦预取。 为了完成这个前瞻动作,模型只增加了不到 0.5% 的预测头参数,骨干网络完全不需要重新训练。 换来的,是 1.7 倍的解码加速,以及在单张显卡上跑大批量任务时 5.3 倍的吞吐量爆发。 计算机体系结构演进几十年来,最顶级的性能飞跃往往不来自把算盘拨得更快。 它来自把那些原本必须互相等待的断点,在时间线上完全重叠起来。 硬件的物理墙从来不会凭空消失。 能跑在最前面的系统,只是在别人停下来等数据的时候,悄悄把下一步的原料提前摆上了流水线。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情