{"id":"mb-20260907-11b1d8","kind":"deep","title":"一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么","summary":"一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么","body":"一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么？\n在今天大多数智能体架构里，它会死得很惨。\n因为模型一旦开始深思，整个感知就冻结了。\n等它在后台推演完一套长长的战术，前台的游戏画面早就刷新了十几秒。\n这就是今天做交互式 AI 最尴尬的瓶颈：\n模型要么不思考直接胡乱操作，\n要么一思考就变成又聋又瞎的木头人。\n行业里通常怎么解决这个问题？\n两条路。\n第一条路，重新训练。\n修改模型结构，灌入海量实时交互数据，从头训一个能多线程边看边想的模型。\n这需要耗费几百万美元算力，只有极少数头部大厂玩得起。\n第二条路，在外面套框架。\n写一套复杂的外部调度逻辑，把模型当成黑盒，用外部脚本在中间拼命倒腾消息。\n但框架治标不治本。\n模型内部依然是一个死板的同步阻塞循环：\n接收输入、停下思考、生成输出、等待反馈。\n重新训练太贵，外挂框架太糙。\n中间难道没有第三条路吗？\nYandex 实验室的 George Yakushev 团队，给出了一个反常识的解法。\n他们没有去碰模型的权重，\n也没有去写复杂的外部框架。\n他们只改造了一样被整个行业当成附赠品的东西：\n键值缓存（KV Cache）。\n在过去的教科书里，键值缓存只是一块被动的存储区。\n它的唯一作用，是把前面算过的词存起来，避免生成下一个词时重复算前面的前缀。\n但在大模型的物理运行过程里，这块缓存真正的身份，是模型的即时工作内存。\n它决定了模型在这一毫秒能看到什么，以及按什么因果顺序去处理信息。\nYandex 团队把这套机制叫作：把键值缓存当成智能体运行时。\n它的核心齿轮，藏在旋转位置编码（RoPE）的数学规律里。\n因为大模型的注意力计算只在乎词与词之间的相对位置差，\n所以不同的输入流（游戏画面、内部思考、前台发言、工具返回），都可以被切成独立的缓存块，只记录局部相对坐标。\n当模型发起一次查询时，底层算子只需要在显存里对提问做一次轻量旋转。\n同一份物理显存，就可以在同一时刻，以完全不同的逻辑视角呈现给不同的计算任务。\n后台的思考任务，在全速推演深层逻辑；\n前台的输出任务，直接读取思考任务刚刚吐出来的中间状态，同步组织语言；\n摄像头或游戏画面的新数据，像异步流水一样持续追加进新的缓存块，完全不打断正在进行的推理。\n没有额外的显存复制，也不需要重新编码。\n这套机制在 NeurIPS 2025 的并发测试和异步推理实验中，展现了惊人的效果：\n在不改动任何模型权重的前提下，\n首个有效动作的响应延迟最高降低了 80 倍，\n用户感受到的等待时间缩短了 12 倍。\n他们直接拿开源的 Qwen 多模态模型去玩 DOOM，\n没有进行任何游戏数据的微调，\n模型就能一边实时吃进游戏帧，一边推演走位，一边同步敲击键盘。\n过去几年，智能体领域的注意力几乎全被两极瓜分：\n一端在拼命卷底层的模型参数和训练数据，\n另一端在拼命卷上层的提示词编排和工作流框架。\n真正决定智能体能不能像真人一样灵敏反应的钥匙，\n往往不在大脑规模，也不在外挂有多花哨。\n它取决于底层显存里的计算状态，究竟以怎样的方式在流动。\n把原本用来省算力的静态存根，重构成支持多视口并发的共享内存。\n当阻塞瓶颈在推理层被绕开，智能体的协同逻辑，已经换了一套底层的操作系统。","topic":"一个大模型在玩 DOOM 射击游戏的时候，如果一边走位一边思考，会发生什么","frame_type":["键值缓存即运行时（块级多视口共享状态运行时 /","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-07 16:23:03","legal_anchor_count":0,"transcript_citation_count":0}