大模型在做复杂推理的时候,经常会出现一个荒谬的反常现象
大模型在做复杂推理的时候,经常会出现一个荒谬的反常现象。 它其实早就知道正确答案了。 很多时候,模型本身的答案概率已经稳定下来,却还要在思维链里自言自语,多聊整整一倍的时间。 在 DeepSeek-R1-Distill-Qwen-7B 上,这个过度思考的毛病被学者们抓了个正着。 既然知道它在说废话,为什么不能直接给它加一个全局长度惩罚? 或者在推理输出的时候,设一个置信度门槛强行截断? 因为每道题的难度完全不一样。 简单题里可能有一半是冗余,难题的每一个推理步骤都在刀刃上。 全局一刀切压长度,简单题的废话没挤掉,难题直接因为没想完而被腰斩算错。 如果在生成阶段靠外部钩子硬拉刹车,遇到死题,模型不仅不会停,反而会直接陷入无限循环的病态。 两位学者 Dylan Jayabahu 和 Tinuade Adeleke 把显微镜伸进了模型的神经层内部。 他们在残差流里找到了一台隐藏的几何机器。 停止向量。 在模型的第 18 层,存在一个均值差方向。 沿着这个方向施加引导,它的强度能直接控制模型到底要想多久。 它就像一个藏在模型深处的原生刹车旋钮。 但要把这个刹车旋钮真正焊进权重里,并没有那么简单。 最直觉的想法,是直接把激活值在这个方向上的标量投影拉到最大。 结果却走向了反面。 强行拉大单一维度的投影,直接破坏了周围的离轴维度。 下游固定的解码层读不懂被弄乱的特征,模型不但没停下来,生成长度反而越变越长。 真正管用的方案,是在重构受控激活值的时候,把所有离轴维度死死固定在原本的自然数值上。 既精准传递了停止信号,又保住了下游层赖以理解上下文的全部特征。 最关键的是,这项改造根本不需要昂贵的强化学习。 他们仅仅用了 24 道题目来拟合,就把这套因果干预完整烙进了模型权重里。 改造后的模型在 5 个完全没见过的基准测试集上跑了一遍。 在准确率完全不掉的前提下,直接砍掉了大约四分之一的思考长度。 削减动作精准利落,砍掉废话的幅度与题目本身的冗余程度保持着 0.70 的高度相关。 简单题少说废话,难题继续深入推导,完全实现了按题刹车。 甚至连那种随着难度上升加剧的停机死循环,也被这根内化进权重的向量彻底化解。 过去优化大模型的算力消耗,大家总习惯在外部挂各种限速器和硬截断规则。 那是在把模型当成黑盒,在外面暴力踩刹车。 当可解释性研究开始摸清模型内部的几何坐标,算力的效率优化正在发生质的转变。 不在外面拉警戒线。 让模型在算明白的那一刻,在神经元深处自己把笔放下。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。