{"source":{"id":"mb-20260902-aa7618","title":"为了查复杂的网络关联，专门买一套图数据库，结果分析速度比在普通数仓里跑 SQL 慢了上万倍","url":"https://mubeitech.com/p/mb-20260902-aa7618"},"method":"semantic-similarity","count":1,"items":[{"rank":1,"id":"mb-20260902-cd3522","account":"mubei","brand":"","title":"给多模态大模型加速，工程界一直在为一个看似合理的方案买单","summary":"给多模态大模型加速，工程界一直在为一个看似合理的方案买单","body":"给多模态大模型加速，工程界一直在为一个看似合理的方案买单。\n这个方案叫投机采样。\n让一个极小、极快的草稿模型在前面先猜几个词，再由庞大的主模型跑一次前向验证全部猜想。\n猜对了直接跳过，能省下几倍的计算时间。\n可在看图说话、读报表的多模态模型上，这套方案撞上了一堵自相矛盾的死墙。\n草稿模型要逐字猜测，为了快，它必须做得极小。\n可一个小模型，根本塞不下图片展开后的成百上千个视觉词元。\n为了让草稿跑得动，工程师们只能把图像压缩、剪枝，甚至直接把视觉特征对草稿模型隐藏。\n荒谬的一幕出现了。\n草稿模型被剥夺了视觉，偏偏在最依赖图片的场景下疯狂猜错。\n你让它读一张财务报表，答案就在图表里，它却因为看不见图而不断吐出废词。\n整个行业陷入了一个怪圈：\n大家把图像当成了拖慢推理的负重，忙着用各种算法把视觉信息藏起来。\n视觉信息真的是推理加速的累赘吗？\n来自高丽大学与 Zoom 的研究团队在论文中指出了相反的物理现实。\n在看图回答、提取文档这种任务里，大模型要输出的文字，绝大部分早就白纸黑字印在图片上。\n图片不是负重。\n图片是让下一个词变得极度确定的作弊条。\n团队把这台打破怪圈的架构命名为 GLANCE。\n它从两头拆掉了自回归草稿的死循环。\n第一头，视觉零成本。\nGLANCE 的草稿头不再重复去读原始图片。\n它直接读取主模型在中间层已经计算完成的图文融合隐层状态。\n主模型早就把图像和文本揉在了一起，草稿头直接继承这个现成状态，视觉开销瞬间降为零。\n第二头，单步块级起草。\n工业界标杆 EAGLE-3 的草稿头，猜 8 个词必须串行跑 8 次前向计算。\nGLANCE 换用了一套 5 层的块扩散头。\n只需要单次前向传播，就能一口气生成未来整整 16 个位置的词元分布。\n生成的候选词元被排成一棵前缀树，交给主模型单次前向全部验证。\n数学证明，这种验证在比特级别精确重现主模型自身的贪婪解码，完全无损。\n为什么这套设计在看图任务上能迎来爆发式加速？\n研究者测出了一条跨任务成立的物理定律：\n草稿被主模型接收的长度，直接由主模型的下一个词元熵决定。\n任务越依赖图片，下一个词元的熵就越低。\n在读文档和读图表时，模型直接进入了字面照抄状态。\n在字面照抄状态下，自回归草稿每抄一个字都要串行计算一次，而单步块级起草只需要一次计算就能把一整段文字端出来。\n在 SGLang 生产引擎的实测中，GLANCE 比传统自回归解码快了 2.93 倍。\n在相同数据训练下，它的单轮接收长度达到了 EAGLE-3 的 2.7 倍，在图表问答任务上更是达到了 4.0 倍。\n真正的系统瓶颈，往往来自我们对旧工具的路径依赖。\n当大家都在自回归的旧框架里给图像打补丁、做剪枝时，\n换掉那个串行的齿轮，原本被当成负担的视觉信息，就变成了最强大的加速引擎。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-09-02 12:19:59","created_at":"2026-09-02 12:19:59","url":"https://mubeitech.com/p/mb-20260902-cd3522","markdown_url":"https://mubeitech.com/p/mb-20260902-cd3522/markdown"}]}