---
id: "mb-20260907-11b1d8"
kind: "deep"
title: "一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么"
topic: "一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么"
source_type: "generated"
status: "published"
generated_at: "2026-09-07 16:23:03"
frame_type: ["键值缓存即运行时（块级多视口共享状态运行时 /", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么

一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么？
在今天大多数智能体架构里，它会死得很惨。
因为模型一旦开始深思，整个感知就冻结了。
等它在后台推演完一套长长的战术，前台的游戏画面早就刷新了十几秒。
这就是今天做交互式 AI 最尴尬的瓶颈：
模型要么不思考直接胡乱操作，
要么一思考就变成又聋又瞎的木头人。
行业里通常怎么解决这个问题？
两条路。
第一条路，重新训练。
修改模型结构，灌入海量实时交互数据，从头训一个能多线程边看边想的模型。
这需要耗费几百万美元算力，只有极少数头部大厂玩得起。
第二条路，在外面套框架。
写一套复杂的外部调度逻辑，把模型当成黑盒，用外部脚本在中间拼命倒腾消息。
但框架治标不治本。
模型内部依然是一个死板的同步阻塞循环：
接收输入、停下思考、生成输出、等待反馈。
重新训练太贵，外挂框架太糙。
中间难道没有第三条路吗？
Yandex 实验室的 George Yakushev 团队，给出了一个反常识的解法。
他们没有去碰模型的权重，
也没有去写复杂的外部框架。
他们只改造了一样被整个行业当成附赠品的东西：
键值缓存（KV Cache）。
在过去的教科书里，键值缓存只是一块被动的存储区。
它的唯一作用，是把前面算过的词存起来，避免生成下一个词时重复算前面的前缀。
但在大模型的物理运行过程里，这块缓存真正的身份，是模型的即时工作内存。
它决定了模型在这一毫秒能看到什么，以及按什么因果顺序去处理信息。
Yandex 团队把这套机制叫作：把键值缓存当成智能体运行时。
它的核心齿轮，藏在旋转位置编码（RoPE）的数学规律里。
因为大模型的注意力计算只在乎词与词之间的相对位置差，
所以不同的输入流（游戏画面、内部思考、前台发言、工具返回），都可以被切成独立的缓存块，只记录局部相对坐标。
当模型发起一次查询时，底层算子只需要在显存里对提问做一次轻量旋转。
同一份物理显存，就可以在同一时刻，以完全不同的逻辑视角呈现给不同的计算任务。
后台的思考任务，在全速推演深层逻辑；
前台的输出任务，直接读取思考任务刚刚吐出来的中间状态，同步组织语言；
摄像头或游戏画面的新数据，像异步流水一样持续追加进新的缓存块，完全不打断正在进行的推理。
没有额外的显存复制，也不需要重新编码。
这套机制在 NeurIPS 2025 的并发测试和异步推理实验中，展现了惊人的效果：
在不改动任何模型权重的前提下，
首个有效动作的响应延迟最高降低了 80 倍，
用户感受到的等待时间缩短了 12 倍。
他们直接拿开源的 Qwen 多模态模型去玩 DOOM，
没有进行任何游戏数据的微调，
模型就能一边实时吃进游戏帧，一边推演走位，一边同步敲击键盘。
过去几年，智能体领域的注意力几乎全被两极瓜分：
一端在拼命卷底层的模型参数和训练数据，
另一端在拼命卷上层的提示词编排和工作流框架。
真正决定智能体能不能像真人一样灵敏反应的钥匙，
往往不在大脑规模，也不在外挂有多花哨。
它取决于底层显存里的计算状态，究竟以怎样的方式在流动。
把原本用来省算力的静态存根，重构成支持多视口并发的共享内存。
当阻塞瓶颈在推理层被绕开，智能体的协同逻辑，已经换了一套底层的操作系统。

_Rendered by mubei-terminal._
