{"id":"mb-20260823-f26400","account":"mubei","brand":"","title":"开源社区现在有一个近乎狂热的共识","summary":"开源社区现在有一个近乎狂热的共识","body":"开源社区现在有一个近乎狂热的共识：\n大模型的思考链越长越好。\n只要给模型足够的思考 token，复杂难题就能迎刃而解。\n但在做自主智能体（Agent）的人眼里，这件事正在变成一场灾难。\n做开源浏览器自动化工具 browser-use 的核心开发者 Gregor Žunič 抛出了一个尖锐的痛点：\n像 Qwen 这类具备强推理能力的模型，是一个严重的“过度思考者”。\n让它点一个网页按钮，它能在后台写出上千字的内心独白。\n在数学题里立大功的深度思考，为什么一进真实交互任务就成了毒药？\n模型自己停不下来，开发者难道只能干等着它算完？\n要看懂这个死结，得先看清智能体运转的底层逻辑。\n这类工具在底层运行的，叫状态-动作模型（State-Action Model）。\n它的本质是一个高频的闭环：\n看一眼当前的屏幕状态。\n决策下一步具体动作。\n执行点击或输入。\n再看一眼新的屏幕状态。\n在这个循环里，延迟是决定生死的硬指标。\n用户要的是一秒内点下按钮，不是坐在屏幕前等模型思考半分钟。\n但今天的推理模型在强化学习训练时，被奖励机制规训出了一种本能：\n输出的思考步骤越多，拿到高分的概率越高。\n这种本能带进现实任务，就变成了无休止的内耗。\n让它在搜索框输入一个词，它会先论证一遍浏览器的渲染机制。\n更麻烦的是，这种思考状态一旦启动，模型很难靠提示词被彻底叫停。\n既然模型自己在权重里停不下来，那就必须在推理引擎层面给它戴上紧箍咒。\nGregor 给出的解法，是一台精巧的系统工程机器：\n结构化输出 + 动态 Logit 偏置干预（Dynamic Logit Bias）。\n这台机器分两步咬合。\n第一步，把模型的思考与动作强行塞进结构化数据格式里。\n比如用 JSON 明确规定：必须先输出思考字段，再输出动作字段。\n第二步，在推理引擎（比如 vLLM）生成 token 时，启动动态概率干预。\n大模型生成每一个字，本质上都是在所有候选词表里计算一组未归一化的概率分布，也就是 Logit。\n推理引擎在底层实时数着思考 token 的数量。\n一旦思考长度触碰到设定的预算红线，比如 50 个 token。\n引擎立刻在结束标记的 Logit 上，强行叠加一个极大的正向偏置值。\n在数学层面，结束标记被选中的概率瞬间飙升到百分之百。\n模型甚至还没来得及继续展开内心戏，思考过程就被外力物理切断。\n紧接着，结构化约束接管输出，逼迫它直接吐出下一步的具体动作。\n不需要重新微调模型。\n不需要修改任何底层权重。\n纯粹依靠推理引擎在采样层面的概率干预，就把思考的控制权从模型手里夺回到了调度器手里。\n行业总在比拼谁的模型参数更多、谁的思考链更长。\n但在真正的系统工程落地里，分水岭不在于让模型想多久。\n在于工程框架是否拥有在正确时刻让它闭嘴干活的能力。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49"}