开源社区现在有一个近乎狂热的共识
开源社区现在有一个近乎狂热的共识: 大模型的思考链越长越好。 只要给模型足够的思考 token,复杂难题就能迎刃而解。 但在做自主智能体(Agent)的人眼里,这件事正在变成一场灾难。 做开源浏览器自动化工具 browser-use 的核心开发者 Gregor Žunič 抛出了一个尖锐的痛点: 像 Qwen 这类具备强推理能力的模型,是一个严重的“过度思考者”。 让它点一个网页按钮,它能在后台写出上千字的内心独白。 在数学题里立大功的深度思考,为什么一进真实交互任务就成了毒药? 模型自己停不下来,开发者难道只能干等着它算完? 要看懂这个死结,得先看清智能体运转的底层逻辑。 这类工具在底层运行的,叫状态-动作模型(State-Action Model)。 它的本质是一个高频的闭环: 看一眼当前的屏幕状态。 决策下一步具体动作。 执行点击或输入。 再看一眼新的屏幕状态。 在这个循环里,延迟是决定生死的硬指标。 用户要的是一秒内点下按钮,不是坐在屏幕前等模型思考半分钟。 但今天的推理模型在强化学习训练时,被奖励机制规训出了一种本能: 输出的思考步骤越多,拿到高分的概率越高。 这种本能带进现实任务,就变成了无休止的内耗。 让它在搜索框输入一个词,它会先论证一遍浏览器的渲染机制。 更麻烦的是,这种思考状态一旦启动,模型很难靠提示词被彻底叫停。 既然模型自己在权重里停不下来,那就必须在推理引擎层面给它戴上紧箍咒。 Gregor 给出的解法,是一台精巧的系统工程机器: 结构化输出 + 动态 Logit 偏置干预(Dynamic Logit Bias)。 这台机器分两步咬合。 第一步,把模型的思考与动作强行塞进结构化数据格式里。 比如用 JSON 明确规定:必须先输出思考字段,再输出动作字段。 第二步,在推理引擎(比如 vLLM)生成 token 时,启动动态概率干预。 大模型生成每一个字,本质上都是在所有候选词表里计算一组未归一化的概率分布,也就是 Logit。 推理引擎在底层实时数着思考 token 的数量。 一旦思考长度触碰到设定的预算红线,比如 50 个 token。 引擎立刻在结束标记的 Logit 上,强行叠加一个极大的正向偏置值。 在数学层面,结束标记被选中的概率瞬间飙升到百分之百。 模型甚至还没来得及继续展开内心戏,思考过程就被外力物理切断。 紧接着,结构化约束接管输出,逼迫它直接吐出下一步的具体动作。 不需要重新微调模型。 不需要修改任何底层权重。 纯粹依靠推理引擎在采样层面的概率干预,就把思考的控制权从模型手里夺回到了调度器手里。 行业总在比拼谁的模型参数更多、谁的思考链更长。 但在真正的系统工程落地里,分水岭不在于让模型想多久。 在于工程框架是否拥有在正确时刻让它闭嘴干活的能力。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。