把大模型叫做「下一个词预测器」,就像把 AlphaZero 叫做「下一步棋预测器」
把大模型叫做「下一个词预测器」,就像把 AlphaZero 叫做「下一步棋预测器」。 这个看似专业的定义,让很多人得出了一个彻底搞反的结论: 既然模型只是在模仿人类历史语料里的下一个词,那它的能力上限就永远超不过人类写过的文本。 逻辑听起来无懈可击。 但它把一个系统的物理输出接口,当成了背后的决策引擎。 大模型在屏幕上吐字的方式,确实是一颗一颗往外冒。 一个写死的输出循环,每次根据前面的上下文,采样出下一个词。 在预训练阶段,这确实是下一个词预测: 喂进海量的人类网页,计算最大似然估计,让模型去猜人类写过的下一个字到底是什么。 这是模仿学习,它学的是人类的语言习惯。 但今天所有顶尖推理模型发生质变的地方,根本不在预训练。 在后训练阶段的一台核心机器:可验证奖励强化学习(RLVR)。 这台机器的运转目标,和猜词没有半点关系。 它不再给模型看人类写好的标准答案。 它只给模型一个任务,和一套确定性的验证规则: 一段代码能不能通过单元测试,一道数学题的计算结果是不是唯一真解。 模型在后台自己探索成千上万条人类从未写过的解题路径。 一旦某条路径最终跑通了测试、拿到了正确答案,算法就会通过策略梯度,把这条成功路径上所有词的概率集体拉高。 反过来,只要结果错了,哪怕中间每一步写得再像人类大师的草稿,概率也会被当场砸碎。 这和国际象棋的演进一模一样。 第一代国际象棋程序读了几百万盘人类大师的棋谱,遇到残局就去猜「人类大师在这里最可能走哪一步」。 那是下一步预测器。 AlphaZero 不这么干。 它不在乎人类走过什么,它通过自我博弈探索了上亿种局面,每一步的选择只服务于一个目标:把最终胜率推到最高。 没人会把 AlphaZero 叫做「下一步棋预测器」。 因为它不是在复刻历史,它是在搜索最优解。 现在的推理模型,正是在用同样的逻辑重写代码和数学。 那些长达数千字的思维链,人类历史上从来没有人写过,模型也不是从任何语料库里抄来的。 那是它在可验证规则的奖惩下,自己探索出来的解题空间。 决定一个系统天花板的,从来不是它每次在界面上吐出多大一块碎片。 在于决定这块碎片生死的,到底是人类过去的语料习惯,还是客观世界的确定性真理。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。