一个大模型在玩 DOOM 射击游戏的时候,如果一边走位一边思考,会发生什么
一个大模型在玩 DOOM 射击游戏的时候,如果一边走位一边思考,会发生什么? 在今天大多数智能体架构里,它会死得很惨。 因为模型一旦开始深思,整个感知就冻结了。 等它在后台推演完一套长长的战术,前台的游戏画面早就刷新了十几秒。 这就是今天做交互式 AI 最尴尬的瓶颈: 模型要么不思考直接胡乱操作, 要么一思考就变成又聋又瞎的木头人。 行业里通常怎么解决这个问题? 两条路。 第一条路,重新训练。 修改模型结构,灌入海量实时交互数据,从头训一个能多线程边看边想的模型。 这需要耗费几百万美元算力,只有极少数头部大厂玩得起。 第二条路,在外面套框架。 写一套复杂的外部调度逻辑,把模型当成黑盒,用外部脚本在中间拼命倒腾消息。 但框架治标不治本。 模型内部依然是一个死板的同步阻塞循环: 接收输入、停下思考、生成输出、等待反馈。 重新训练太贵,外挂框架太糙。 中间难道没有第三条路吗? Yandex 实验室的 George Yakushev 团队,给出了一个反常识的解法。 他们没有去碰模型的权重, 也没有去写复杂的外部框架。 他们只改造了一样被整个行业当成附赠品的东西: 键值缓存(KV Cache)。 在过去的教科书里,键值缓存只是一块被动的存储区。 它的唯一作用,是把前面算过的词存起来,避免生成下一个词时重复算前面的前缀。 但在大模型的物理运行过程里,这块缓存真正的身份,是模型的即时工作内存。 它决定了模型在这一毫秒能看到什么,以及按什么因果顺序去处理信息。 Yandex 团队把这套机制叫作:把键值缓存当成智能体运行时。 它的核心齿轮,藏在旋转位置编码(RoPE)的数学规律里。 因为大模型的注意力计算只在乎词与词之间的相对位置差, 所以不同的输入流(游戏画面、内部思考、前台发言、工具返回),都可以被切成独立的缓存块,只记录局部相对坐标。 当模型发起一次查询时,底层算子只需要在显存里对提问做一次轻量旋转。 同一份物理显存,就可以在同一时刻,以完全不同的逻辑视角呈现给不同的计算任务。 后台的思考任务,在全速推演深层逻辑; 前台的输出任务,直接读取思考任务刚刚吐出来的中间状态,同步组织语言; 摄像头或游戏画面的新数据,像异步流水一样持续追加进新的缓存块,完全不打断正在进行的推理。 没有额外的显存复制,也不需要重新编码。 这套机制在 NeurIPS 2025 的并发测试和异步推理实验中,展现了惊人的效果: 在不改动任何模型权重的前提下, 首个有效动作的响应延迟最高降低了 80 倍, 用户感受到的等待时间缩短了 12 倍。 他们直接拿开源的 Qwen 多模态模型去玩 DOOM, 没有进行任何游戏数据的微调, 模型就能一边实时吃进游戏帧,一边推演走位,一边同步敲击键盘。 过去几年,智能体领域的注意力几乎全被两极瓜分: 一端在拼命卷底层的模型参数和训练数据, 另一端在拼命卷上层的提示词编排和工作流框架。 真正决定智能体能不能像真人一样灵敏反应的钥匙, 往往不在大脑规模,也不在外挂有多花哨。 它取决于底层显存里的计算状态,究竟以怎样的方式在流动。 把原本用来省算力的静态存根,重构成支持多视口并发的共享内存。 当阻塞瓶颈在推理层被绕开,智能体的协同逻辑,已经换了一套底层的操作系统。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。