---
id: "mb-20260902-cd3522"
title: "给多模态大模型加速，工程界一直在为一个看似合理的方案买单"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-09-02 12:19:59"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260902-cd3522"
markdown_url: "https://mubeitech.com/p/mb-20260902-cd3522/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260902-cd3522"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 给多模态大模型加速，工程界一直在为一个看似合理的方案买单

给多模态大模型加速，工程界一直在为一个看似合理的方案买单。
这个方案叫投机采样。
让一个极小、极快的草稿模型在前面先猜几个词，再由庞大的主模型跑一次前向验证全部猜想。
猜对了直接跳过，能省下几倍的计算时间。
可在看图说话、读报表的多模态模型上，这套方案撞上了一堵自相矛盾的死墙。
草稿模型要逐字猜测，为了快，它必须做得极小。
可一个小模型，根本塞不下图片展开后的成百上千个视觉词元。
为了让草稿跑得动，工程师们只能把图像压缩、剪枝，甚至直接把视觉特征对草稿模型隐藏。
荒谬的一幕出现了。
草稿模型被剥夺了视觉，偏偏在最依赖图片的场景下疯狂猜错。
你让它读一张财务报表，答案就在图表里，它却因为看不见图而不断吐出废词。
整个行业陷入了一个怪圈：
大家把图像当成了拖慢推理的负重，忙着用各种算法把视觉信息藏起来。
视觉信息真的是推理加速的累赘吗？
来自高丽大学与 Zoom 的研究团队在论文中指出了相反的物理现实。
在看图回答、提取文档这种任务里，大模型要输出的文字，绝大部分早就白纸黑字印在图片上。
图片不是负重。
图片是让下一个词变得极度确定的作弊条。
团队把这台打破怪圈的架构命名为 GLANCE。
它从两头拆掉了自回归草稿的死循环。
第一头，视觉零成本。
GLANCE 的草稿头不再重复去读原始图片。
它直接读取主模型在中间层已经计算完成的图文融合隐层状态。
主模型早就把图像和文本揉在了一起，草稿头直接继承这个现成状态，视觉开销瞬间降为零。
第二头，单步块级起草。
工业界标杆 EAGLE-3 的草稿头，猜 8 个词必须串行跑 8 次前向计算。
GLANCE 换用了一套 5 层的块扩散头。
只需要单次前向传播，就能一口气生成未来整整 16 个位置的词元分布。
生成的候选词元被排成一棵前缀树，交给主模型单次前向全部验证。
数学证明，这种验证在比特级别精确重现主模型自身的贪婪解码，完全无损。
为什么这套设计在看图任务上能迎来爆发式加速？
研究者测出了一条跨任务成立的物理定律：
草稿被主模型接收的长度，直接由主模型的下一个词元熵决定。
任务越依赖图片，下一个词元的熵就越低。
在读文档和读图表时，模型直接进入了字面照抄状态。
在字面照抄状态下，自回归草稿每抄一个字都要串行计算一次，而单步块级起草只需要一次计算就能把一整段文字端出来。
在 SGLang 生产引擎的实测中，GLANCE 比传统自回归解码快了 2.93 倍。
在相同数据训练下，它的单轮接收长度达到了 EAGLE-3 的 2.7 倍，在图表问答任务上更是达到了 4.0 倍。
真正的系统瓶颈，往往来自我们对旧工具的路径依赖。
当大家都在自回归的旧框架里给图像打补丁、做剪枝时，
换掉那个串行的齿轮，原本被当成负担的视觉信息，就变成了最强大的加速引擎。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260902-cd3522>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-09-02 12:19:59_
