给多模态大模型加速,工程界一直在为一个看似合理的方案买单
给多模态大模型加速,工程界一直在为一个看似合理的方案买单。 这个方案叫投机采样。 让一个极小、极快的草稿模型在前面先猜几个词,再由庞大的主模型跑一次前向验证全部猜想。 猜对了直接跳过,能省下几倍的计算时间。 可在看图说话、读报表的多模态模型上,这套方案撞上了一堵自相矛盾的死墙。 草稿模型要逐字猜测,为了快,它必须做得极小。 可一个小模型,根本塞不下图片展开后的成百上千个视觉词元。 为了让草稿跑得动,工程师们只能把图像压缩、剪枝,甚至直接把视觉特征对草稿模型隐藏。 荒谬的一幕出现了。 草稿模型被剥夺了视觉,偏偏在最依赖图片的场景下疯狂猜错。 你让它读一张财务报表,答案就在图表里,它却因为看不见图而不断吐出废词。 整个行业陷入了一个怪圈: 大家把图像当成了拖慢推理的负重,忙着用各种算法把视觉信息藏起来。 视觉信息真的是推理加速的累赘吗? 来自高丽大学与 Zoom 的研究团队在论文中指出了相反的物理现实。 在看图回答、提取文档这种任务里,大模型要输出的文字,绝大部分早就白纸黑字印在图片上。 图片不是负重。 图片是让下一个词变得极度确定的作弊条。 团队把这台打破怪圈的架构命名为 GLANCE。 它从两头拆掉了自回归草稿的死循环。 第一头,视觉零成本。 GLANCE 的草稿头不再重复去读原始图片。 它直接读取主模型在中间层已经计算完成的图文融合隐层状态。 主模型早就把图像和文本揉在了一起,草稿头直接继承这个现成状态,视觉开销瞬间降为零。 第二头,单步块级起草。 工业界标杆 EAGLE-3 的草稿头,猜 8 个词必须串行跑 8 次前向计算。 GLANCE 换用了一套 5 层的块扩散头。 只需要单次前向传播,就能一口气生成未来整整 16 个位置的词元分布。 生成的候选词元被排成一棵前缀树,交给主模型单次前向全部验证。 数学证明,这种验证在比特级别精确重现主模型自身的贪婪解码,完全无损。 为什么这套设计在看图任务上能迎来爆发式加速? 研究者测出了一条跨任务成立的物理定律: 草稿被主模型接收的长度,直接由主模型的下一个词元熵决定。 任务越依赖图片,下一个词元的熵就越低。 在读文档和读图表时,模型直接进入了字面照抄状态。 在字面照抄状态下,自回归草稿每抄一个字都要串行计算一次,而单步块级起草只需要一次计算就能把一整段文字端出来。 在 SGLang 生产引擎的实测中,GLANCE 比传统自回归解码快了 2.93 倍。 在相同数据训练下,它的单轮接收长度达到了 EAGLE-3 的 2.7 倍,在图表问答任务上更是达到了 4.0 倍。 真正的系统瓶颈,往往来自我们对旧工具的路径依赖。 当大家都在自回归的旧框架里给图像打补丁、做剪枝时, 换掉那个串行的齿轮,原本被当成负担的视觉信息,就变成了最强大的加速引擎。
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。