大模型一直被当成深不可测的黑盒
大模型一直被当成深不可测的黑盒。 想搞清楚它内部怎么思考,过去的研究员只能像考古学家拿着小刷子,一个个电路手动逆向。 或者一遍遍跑推理,抓取动态激活数据去碰运气。 2026 年 8 月,arXiv 上的一篇新论文把这个漫长的工作推平了。 学者 Richard Zhe Wang 提出了一个叫做「通信地图」的工具。 不用跑任何一行推理。 不用输入任何测试文本。 只靠硬盘里存着的静态权重,用一张普通消费级显卡。 15 秒扫透 GPT-2。 11 分钟扫透 69 亿参数的 Pythia-6.9B。 模型内部所有潜在的通信管道,被一次性全部画了出来。 不跑推理,只看静止的矩阵数字,怎么可能知道大模型在想什么? 大模型内部数以百亿计的计算单元,到底是怎么互相传递信息的? 这台机器的核心原理,叫「残差流总线机制」。 2021 年,Anthropic 的 Nelson Elhage 团队在《Transformer 电路的数学框架》里指出过一个底层事实。 Transformer 里的所有注意力头和神经元,彼此之间从不直接连线。 它们像一群坐在同一张长桌边的人,中间放着一块大家共用的长白板。 这块白板,在技术上叫残差流。 前面的计算单元把算出来的特征写到白板上,后面的单元再从白板上把特征读出来。 Richard Zhe Wang 做的突破,是把当年 Elhage 的组合分数,泛化成了一个通用的数学指标:耦合系数。 它一口气覆盖了注意力头到神经元之间全部 18 类连接方式。 上游写入矩阵的几何方向,跟下游读取矩阵的几何方向,重合度有多高? 重合度越高,耦合系数越大,意味着这两个单元之间有一条天然的通信专线。 这是一场对模型内部通道的全面人口普查。 从 GPT-2 的 6.3 亿条候选通道,到 Pythia-6.9B 的 1300 亿条通道。 普查出来的结果,打破了很多人对「神经网络全靠随机混沌」的想象。 70% 到 89% 的注意力头配对,几何朝向都远远偏离随机概率。 有些计算头之间存在强烈的固定协作,有些头则在严格彼此回避。 更颠覆认知的是两组干预实验。 第一组实验:算法在完全盲测、没有输入任何语义标签的前提下,单靠最强的头对头耦合系数,自动找出了模型内部著名的「归纳电路」社区。 把这个社区从模型里切除,模型的上下文复制能力瞬间瘫痪。 第二组实验展现了更反常识的结构。 当研究者把所有注意力头的耦合系数汇聚到一起时,在模型的残差流里,定位到了一个独特的几何子空间。 这个子空间只有整整 2 个维度。 从几亿参数的小模型,一直到 69 亿参数的 Pythia-6.9B。 只要在残差流里把这区区 2 个维度的空间切掉,六个模型的上下文归纳能力全部瞬间归零。 在这个由几千个高维向量构成的庞大空间里,决定核心上下文学习能力的通道,被压缩在一个 2 维的平面上。 这个 2 维空间,用传统的动态主成分分析抓不出来,看离群特征也找不到。 它只静静刻在静态权重的通信拓扑里。 这打破了人们对大模型黑盒的传统叙事。 我们曾经以为大模型之所以聪明,是因为海量参数在动态运算中交织出了无法拆解的混沌风暴。 通信地图证明,大模型的大脑没有那么玄学,只是我们过去的观测视角太粗糙。 那些看似神乎其神的上下文学习和推理,在底层不过是一套早已在静态权重里被精准焊死的总线路由。 当整个系统的通信拓扑被彻底展开。 黑盒就退去了神秘的迷雾,变成了一台每个齿轮和管道都可以被测量、被定位、被精准手术的精密钟表。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。