---
id: "mb-20260823-f26400"
title: "开源社区现在有一个近乎狂热的共识"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-23 00:21:49"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260823-f26400"
markdown_url: "https://mubeitech.com/p/mb-20260823-f26400/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260823-f26400"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 开源社区现在有一个近乎狂热的共识

开源社区现在有一个近乎狂热的共识：
大模型的思考链越长越好。
只要给模型足够的思考 token，复杂难题就能迎刃而解。
但在做自主智能体（Agent）的人眼里，这件事正在变成一场灾难。
做开源浏览器自动化工具 browser-use 的核心开发者 Gregor Žunič 抛出了一个尖锐的痛点：
像 Qwen 这类具备强推理能力的模型，是一个严重的“过度思考者”。
让它点一个网页按钮，它能在后台写出上千字的内心独白。
在数学题里立大功的深度思考，为什么一进真实交互任务就成了毒药？
模型自己停不下来，开发者难道只能干等着它算完？
要看懂这个死结，得先看清智能体运转的底层逻辑。
这类工具在底层运行的，叫状态-动作模型（State-Action Model）。
它的本质是一个高频的闭环：
看一眼当前的屏幕状态。
决策下一步具体动作。
执行点击或输入。
再看一眼新的屏幕状态。
在这个循环里，延迟是决定生死的硬指标。
用户要的是一秒内点下按钮，不是坐在屏幕前等模型思考半分钟。
但今天的推理模型在强化学习训练时，被奖励机制规训出了一种本能：
输出的思考步骤越多，拿到高分的概率越高。
这种本能带进现实任务，就变成了无休止的内耗。
让它在搜索框输入一个词，它会先论证一遍浏览器的渲染机制。
更麻烦的是，这种思考状态一旦启动，模型很难靠提示词被彻底叫停。
既然模型自己在权重里停不下来，那就必须在推理引擎层面给它戴上紧箍咒。
Gregor 给出的解法，是一台精巧的系统工程机器：
结构化输出 + 动态 Logit 偏置干预（Dynamic Logit Bias）。
这台机器分两步咬合。
第一步，把模型的思考与动作强行塞进结构化数据格式里。
比如用 JSON 明确规定：必须先输出思考字段，再输出动作字段。
第二步，在推理引擎（比如 vLLM）生成 token 时，启动动态概率干预。
大模型生成每一个字，本质上都是在所有候选词表里计算一组未归一化的概率分布，也就是 Logit。
推理引擎在底层实时数着思考 token 的数量。
一旦思考长度触碰到设定的预算红线，比如 50 个 token。
引擎立刻在结束标记的 Logit 上，强行叠加一个极大的正向偏置值。
在数学层面，结束标记被选中的概率瞬间飙升到百分之百。
模型甚至还没来得及继续展开内心戏，思考过程就被外力物理切断。
紧接着，结构化约束接管输出，逼迫它直接吐出下一步的具体动作。
不需要重新微调模型。
不需要修改任何底层权重。
纯粹依靠推理引擎在采样层面的概率干预，就把思考的控制权从模型手里夺回到了调度器手里。
行业总在比拼谁的模型参数更多、谁的思考链更长。
但在真正的系统工程落地里，分水岭不在于让模型想多久。
在于工程框架是否拥有在正确时刻让它闭嘴干活的能力。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260823-f26400>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-23 00:21:49_
