---
id: "mb-20260901-52974f"
kind: "deep"
title: "大模型在做复杂推理的时候，经常会出现一个荒谬的反常现象"
topic: "大模型在做复杂推理的时候，经常会出现一个荒谬的反常现象"
source_type: "generated"
status: "published"
generated_at: "2026-09-01 14:46:02"
frame_type: ["停止向量内化与离轴维度锁定", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 大模型在做复杂推理的时候，经常会出现一个荒谬的反常现象

大模型在做复杂推理的时候，经常会出现一个荒谬的反常现象。
它其实早就知道正确答案了。
很多时候，模型本身的答案概率已经稳定下来，却还要在思维链里自言自语，多聊整整一倍的时间。
在 DeepSeek-R1-Distill-Qwen-7B 上，这个过度思考的毛病被学者们抓了个正着。
既然知道它在说废话，为什么不能直接给它加一个全局长度惩罚？
或者在推理输出的时候，设一个置信度门槛强行截断？
因为每道题的难度完全不一样。
简单题里可能有一半是冗余，难题的每一个推理步骤都在刀刃上。
全局一刀切压长度，简单题的废话没挤掉，难题直接因为没想完而被腰斩算错。
如果在生成阶段靠外部钩子硬拉刹车，遇到死题，模型不仅不会停，反而会直接陷入无限循环的病态。
两位学者 Dylan Jayabahu 和 Tinuade Adeleke 把显微镜伸进了模型的神经层内部。
他们在残差流里找到了一台隐藏的几何机器。
停止向量。
在模型的第 18 层，存在一个均值差方向。
沿着这个方向施加引导，它的强度能直接控制模型到底要想多久。
它就像一个藏在模型深处的原生刹车旋钮。
但要把这个刹车旋钮真正焊进权重里，并没有那么简单。
最直觉的想法，是直接把激活值在这个方向上的标量投影拉到最大。
结果却走向了反面。
强行拉大单一维度的投影，直接破坏了周围的离轴维度。
下游固定的解码层读不懂被弄乱的特征，模型不但没停下来，生成长度反而越变越长。
真正管用的方案，是在重构受控激活值的时候，把所有离轴维度死死固定在原本的自然数值上。
既精准传递了停止信号，又保住了下游层赖以理解上下文的全部特征。
最关键的是，这项改造根本不需要昂贵的强化学习。
他们仅仅用了 24 道题目来拟合，就把这套因果干预完整烙进了模型权重里。
改造后的模型在 5 个完全没见过的基准测试集上跑了一遍。
在准确率完全不掉的前提下，直接砍掉了大约四分之一的思考长度。
削减动作精准利落，砍掉废话的幅度与题目本身的冗余程度保持着 0.70 的高度相关。
简单题少说废话，难题继续深入推导，完全实现了按题刹车。
甚至连那种随着难度上升加剧的停机死循环，也被这根内化进权重的向量彻底化解。
过去优化大模型的算力消耗，大家总习惯在外部挂各种限速器和硬截断规则。
那是在把模型当成黑盒，在外面暴力踩刹车。
当可解释性研究开始摸清模型内部的几何坐标，算力的效率优化正在发生质的转变。
不在外面拉警戒线。
让模型在算明白的那一刻，在神经元深处自己把笔放下。

_Rendered by mubei-terminal._
