科技·via

让 AI 在脑子里面推演未来,最怕它把脑补当成现实

让 AI 在脑子里面推演未来,最怕它把脑补当成现实。 在基于强化学习的世界模型里,智能体靠着一套循环隐藏状态,在没有真实环境交互时做轨迹想象。 推演只要顺畅,它就能以极低的算力成本飞速学会复杂操作。 可一旦环境发生微调,或者推演踏入未知区域,误差就会在想象的链条里滚雪球。 如果 AI 察觉不到自己正在犯晕,脑内的想象就会沦为灾难性的欺诈。 过去学术界的标准做法,是给它挂一个由五个模型组成的集成委员会。 大家各算各的,通过比对不同模型的分歧度,来判定当前是不是进了一片盲区。 代价是算力开销直接翻了数倍。 而且分歧度只能告诉你眼前的输入是不是新东西,根本测不出 AI 内部状态深处的迷失程度。 AI 能不能在没有外部委员会监督的情况下,自己感知到自己的困惑? 2026 年 8 月,学者 Donald Aadithiyan 在一篇 arXiv 论文里,给出了一个极度反直觉的实验结论。 像 DreamerV3 这种基于 RSSM 循环状态空间模型构建的世界模型,内部早已悄悄长出了一套自我怀疑的神经。 这台藏在神经网络深处的机器,叫正交隐式困惑度编码。 在算法最初的数学设定里,这个循环隐藏状态只有一个唯一的训练目标:把下一步的预测误差压到最低。 代码里从来没有写过任何自我反思的损失函数,也没有人教过它怎么评估自身的不确定性。 可当研究人员用探针对这个状态进行解剖时,却发现了一个清晰的困惑度信号。 这个信号与当前的瞬时预测误差完全剥离。 数学建模显示,它精准对应着过去一段时间内高误差步数的时间折扣累加,解释力高达 80%。 也就是说,AI 在一步步推演的过程中,无意识地在状态里记下了一笔自己近期究竟碰了多少次壁的账本。 为什么这根神经在世界模型被研究了这么多年后才被第一次抓到? 因为它藏在一个传统分析工具完全看不到的盲区里。 它在几何空间上的分布,与整个状态方差最大的主方向近乎完全正交。 过去工程师用来观察模型内部表征的工具,大多基于主成分分析这类方差投影方法。 这就好比所有探照灯都打在振幅最大、最喧闹的几个维度上。 而这台记录困惑的精密仪器,静悄悄地躺在振幅极小、完全垂直的静默空间里。 在最喧闹的地方找钥匙,自然什么都看不见。 为了确认这串信号具备真实的因果作用,研究团队直接对隐藏状态进行了干预实验。 他们沿着这个正交方向修改了状态数值,甚至把其他真实轨迹里的数值移植进来。 AI 的下游行为立刻发生了显著改变。 在保持瞬时预测误差不变的控制实验中,线性探针捕捉这一困惑信号的判别能力达到了 AUROC 0.72,而原本作为基准的集成模型打分直接跌破了随机猜测线。 当 AI 的困惑度累积到阈值时,它会主动放弃继续在脑子里闭门造车,转而向真实世界请求一次观测输入,重新校准自己的坐标。 这项机制在三个连续控制任务的几何形态上全部得到了验证。 一个纯粹为了预测下一秒画面而训练的底层模型,在追求预测精度的单一压力下,自发压缩出了一条监控自身认知边界的备份通道。 复杂的计算系统往往拥有比设计者预想中更深邃的内省结构。 真正决定系统能否安全落地的关键信号,很少挂在那些数据波动最剧烈的主成分上。 它们往往藏在最不易察觉的静默角落,默默锚定着想象与现实之间的边界。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情