{"id":"mb-20260904-824587","kind":"deep","title":"把大模型叫做「下一个词预测器」，就像把 AlphaZero 叫做「下一步棋预测器」","summary":"把大模型叫做「下一个词预测器」，就像把 AlphaZero 叫做「下一步棋预测器」","body":"把大模型叫做「下一个词预测器」，就像把 AlphaZero 叫做「下一步棋预测器」。\n这个看似专业的定义，让很多人得出了一个彻底搞反的结论：\n既然模型只是在模仿人类历史语料里的下一个词，那它的能力上限就永远超不过人类写过的文本。\n逻辑听起来无懈可击。\n但它把一个系统的物理输出接口，当成了背后的决策引擎。\n大模型在屏幕上吐字的方式，确实是一颗一颗往外冒。\n一个写死的输出循环，每次根据前面的上下文，采样出下一个词。\n在预训练阶段，这确实是下一个词预测：\n喂进海量的人类网页，计算最大似然估计，让模型去猜人类写过的下一个字到底是什么。\n这是模仿学习，它学的是人类的语言习惯。\n但今天所有顶尖推理模型发生质变的地方，根本不在预训练。\n在后训练阶段的一台核心机器：可验证奖励强化学习（RLVR）。\n这台机器的运转目标，和猜词没有半点关系。\n它不再给模型看人类写好的标准答案。\n它只给模型一个任务，和一套确定性的验证规则：\n一段代码能不能通过单元测试，一道数学题的计算结果是不是唯一真解。\n模型在后台自己探索成千上万条人类从未写过的解题路径。\n一旦某条路径最终跑通了测试、拿到了正确答案，算法就会通过策略梯度，把这条成功路径上所有词的概率集体拉高。\n反过来，只要结果错了，哪怕中间每一步写得再像人类大师的草稿，概率也会被当场砸碎。\n这和国际象棋的演进一模一样。\n第一代国际象棋程序读了几百万盘人类大师的棋谱，遇到残局就去猜「人类大师在这里最可能走哪一步」。\n那是下一步预测器。\nAlphaZero 不这么干。\n它不在乎人类走过什么，它通过自我博弈探索了上亿种局面，每一步的选择只服务于一个目标：把最终胜率推到最高。\n没人会把 AlphaZero 叫做「下一步棋预测器」。\n因为它不是在复刻历史，它是在搜索最优解。\n现在的推理模型，正是在用同样的逻辑重写代码和数学。\n那些长达数千字的思维链，人类历史上从来没有人写过，模型也不是从任何语料库里抄来的。\n那是它在可验证规则的奖惩下，自己探索出来的解题空间。\n决定一个系统天花板的，从来不是它每次在界面上吐出多大一块碎片。\n在于决定这块碎片生死的，到底是人类过去的语料习惯，还是客观世界的确定性真理。","topic":"把大模型叫做「下一个词预测器」，就像把 AlphaZero 叫做「下一步棋预测器」","frame_type":["可验证奖励强化学习（RLVR）与策略搜索","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-04 20:42:00","legal_anchor_count":0,"transcript_citation_count":0}