{"id":"mb-20260902-e87554","kind":"deep","title":"给大模型插一根探针，特征识别准确率能飙到 99%","summary":"给大模型插一根探针，特征识别准确率能飙到 99%","body":"给大模型插一根探针，特征识别准确率能飙到 99%。\n顺着这个方向推它一把，模型毫无反应。\n48 组干预测试，43 组结果完全等同于零。\n探针明明把概念读得一清二楚，模型为什么就是不受控？\n2026 年 9 月，学者 Xining Xun 团队在 arXiv 上披露了一项覆盖 Pythia 全系列的研究。\n从 1.6 亿到 120 亿参数，横跨 8 个训练检查点和 4 个任务家族。\n他们给这台反直觉的发育机器起了个名字：滞后耦合。\n意思是：大模型在内部把概念记下来，和在输出端真正用这个概念去决策，是两条完全脱节的时间线。\n实验把大模型的认知发育拆成了三条互不重合的轨道。\n第一轨是内部可读性。\n训练刚跑到第 1000 步，线性探针在残差流里读取目标变量的准确率，就直接饱和到了 AUROC 0.99 以上。\n从 1.6 亿的小模型到 120 亿的大模型，无一例外。\n大模型极早就在残差流里开辟出专门的几何方向，把概念整整齐齐存了进去。\n第二轨是行为可读性。\n模型在输出端的表现，发育得慢得多。\n参数越大的模型，外在表现反而来得越迟。\n120 亿参数的最大模型，一直熬到第 8 个终点检查点，行为层面的识别指标才堪堪爬到 0.909。\n第三轨最致命：因果控制力。\n研究人员顺着探针找出的特征方向注入激活干预，试图操控模型的输出。\n在 48 个模型检查点单元格里，43 个的干预效果完全等同于零。\n在模型发育早期，强行干预甚至还会让回答彻底错乱。\n唯一的例外，只是 120 亿模型在第 8000 步时出现了一次无法稳定复现的孤立脉冲。\n随着模型规模变大、训练步数加深，特征在残差流里占出的表征空间膨胀了整整 57 倍。\n模型下游的读出回路对这个特征的实际调用量，却始终不到总空间的 0.11%。\n脑子里的池子越挖越大，负责接水的管道却一直处于关闭状态。\n11 个测试单元全部呈现同一个冷酷的单向时序：读先于写。\n在开源模型 OLMo-2 上的预注册复现实验，也验证了完全相同的滞后断层。\n这直接击穿了当下可解释性 AI 领域最流行的一套工程神话。\n许多团队用线性探针在模型深处找到了特定概念的表征向量，就急着宣布找到了控制 AI 幻觉和偏见的思维方向盘。\n他们看到的高准确率，只是大模型在脑子里默默记下的笔记。\n记了笔记，离手脚听从指挥，中间隔着一整个尚未长成的因果读出回路。\n能看懂模型在想什么，从来不等于你能命令它怎么做。\n决定大模型最终行为的，不是内部存下了多少概念。\n关键看那些负责调用的输出回路，到底在什么时刻才肯真正连通。","topic":"给大模型插一根探针，特征识别准确率能飙到 99%","frame_type":["滞后耦合（Lagged Coupling）","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-02 09:36:48","legal_anchor_count":0,"transcript_citation_count":0}