DEEPgeneratedpublished

给大模型插一根探针,特征识别准确率能飙到 99%

滞后耦合(Lagged Coupling)机制

给大模型插一根探针,特征识别准确率能飙到 99%。 顺着这个方向推它一把,模型毫无反应。 48 组干预测试,43 组结果完全等同于零。 探针明明把概念读得一清二楚,模型为什么就是不受控? 2026 年 9 月,学者 Xining Xun 团队在 arXiv 上披露了一项覆盖 Pythia 全系列的研究。 从 1.6 亿到 120 亿参数,横跨 8 个训练检查点和 4 个任务家族。 他们给这台反直觉的发育机器起了个名字:滞后耦合。 意思是:大模型在内部把概念记下来,和在输出端真正用这个概念去决策,是两条完全脱节的时间线。 实验把大模型的认知发育拆成了三条互不重合的轨道。 第一轨是内部可读性。 训练刚跑到第 1000 步,线性探针在残差流里读取目标变量的准确率,就直接饱和到了 AUROC 0.99 以上。 从 1.6 亿的小模型到 120 亿的大模型,无一例外。 大模型极早就在残差流里开辟出专门的几何方向,把概念整整齐齐存了进去。 第二轨是行为可读性。 模型在输出端的表现,发育得慢得多。 参数越大的模型,外在表现反而来得越迟。 120 亿参数的最大模型,一直熬到第 8 个终点检查点,行为层面的识别指标才堪堪爬到 0.909。 第三轨最致命:因果控制力。 研究人员顺着探针找出的特征方向注入激活干预,试图操控模型的输出。 在 48 个模型检查点单元格里,43 个的干预效果完全等同于零。 在模型发育早期,强行干预甚至还会让回答彻底错乱。 唯一的例外,只是 120 亿模型在第 8000 步时出现了一次无法稳定复现的孤立脉冲。 随着模型规模变大、训练步数加深,特征在残差流里占出的表征空间膨胀了整整 57 倍。 模型下游的读出回路对这个特征的实际调用量,却始终不到总空间的 0.11%。 脑子里的池子越挖越大,负责接水的管道却一直处于关闭状态。 11 个测试单元全部呈现同一个冷酷的单向时序:读先于写。 在开源模型 OLMo-2 上的预注册复现实验,也验证了完全相同的滞后断层。 这直接击穿了当下可解释性 AI 领域最流行的一套工程神话。 许多团队用线性探针在模型深处找到了特定概念的表征向量,就急着宣布找到了控制 AI 幻觉和偏见的思维方向盘。 他们看到的高准确率,只是大模型在脑子里默默记下的笔记。 记了笔记,离手脚听从指挥,中间隔着一整个尚未长成的因果读出回路。 能看懂模型在想什么,从来不等于你能命令它怎么做。 决定大模型最终行为的,不是内部存下了多少概念。 关键看那些负责调用的输出回路,到底在什么时刻才肯真正连通。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情