---
id: "mb-20260902-e87554"
kind: "deep"
title: "给大模型插一根探针，特征识别准确率能飙到 99%"
topic: "给大模型插一根探针，特征识别准确率能飙到 99%"
source_type: "generated"
status: "published"
generated_at: "2026-09-02 09:36:48"
frame_type: ["滞后耦合（Lagged Coupling）", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 给大模型插一根探针，特征识别准确率能飙到 99%

给大模型插一根探针，特征识别准确率能飙到 99%。
顺着这个方向推它一把，模型毫无反应。
48 组干预测试，43 组结果完全等同于零。
探针明明把概念读得一清二楚，模型为什么就是不受控？
2026 年 9 月，学者 Xining Xun 团队在 arXiv 上披露了一项覆盖 Pythia 全系列的研究。
从 1.6 亿到 120 亿参数，横跨 8 个训练检查点和 4 个任务家族。
他们给这台反直觉的发育机器起了个名字：滞后耦合。
意思是：大模型在内部把概念记下来，和在输出端真正用这个概念去决策，是两条完全脱节的时间线。
实验把大模型的认知发育拆成了三条互不重合的轨道。
第一轨是内部可读性。
训练刚跑到第 1000 步，线性探针在残差流里读取目标变量的准确率，就直接饱和到了 AUROC 0.99 以上。
从 1.6 亿的小模型到 120 亿的大模型，无一例外。
大模型极早就在残差流里开辟出专门的几何方向，把概念整整齐齐存了进去。
第二轨是行为可读性。
模型在输出端的表现，发育得慢得多。
参数越大的模型，外在表现反而来得越迟。
120 亿参数的最大模型，一直熬到第 8 个终点检查点，行为层面的识别指标才堪堪爬到 0.909。
第三轨最致命：因果控制力。
研究人员顺着探针找出的特征方向注入激活干预，试图操控模型的输出。
在 48 个模型检查点单元格里，43 个的干预效果完全等同于零。
在模型发育早期，强行干预甚至还会让回答彻底错乱。
唯一的例外，只是 120 亿模型在第 8000 步时出现了一次无法稳定复现的孤立脉冲。
随着模型规模变大、训练步数加深，特征在残差流里占出的表征空间膨胀了整整 57 倍。
模型下游的读出回路对这个特征的实际调用量，却始终不到总空间的 0.11%。
脑子里的池子越挖越大，负责接水的管道却一直处于关闭状态。
11 个测试单元全部呈现同一个冷酷的单向时序：读先于写。
在开源模型 OLMo-2 上的预注册复现实验，也验证了完全相同的滞后断层。
这直接击穿了当下可解释性 AI 领域最流行的一套工程神话。
许多团队用线性探针在模型深处找到了特定概念的表征向量，就急着宣布找到了控制 AI 幻觉和偏见的思维方向盘。
他们看到的高准确率，只是大模型在脑子里默默记下的笔记。
记了笔记，离手脚听从指挥，中间隔着一整个尚未长成的因果读出回路。
能看懂模型在想什么，从来不等于你能命令它怎么做。
决定大模型最终行为的，不是内部存下了多少概念。
关键看那些负责调用的输出回路，到底在什么时刻才肯真正连通。

_Rendered by mubei-terminal._
