很多用过最新推理模型的人都发现过一个诡异的现象
很多用过最新推理模型的人都发现过一个诡异的现象。 一道看似不难的逻辑题,AI 突然要想上几十秒。 消耗的算力暴增十倍。 最后吐出来的答案,可能还是错的。 业内把这种现象叫「过思考」。 过去大家总觉得,这是因为模型在更大的搜索树里迷了路。 或者是概率采样在碰运气。 德州大学奥斯汀分校的威廉·吉尔平(William Gilpin)团队,刚刚发了一篇论文。 他们用动力系统物理学拆开大模型的内部隐状态。 发现这根本不是搜索算法在摸索。 这是一场发生在大模型神经元里的物理海啸。 为什么一个已经学会自我纠错的模型,反而在遇到难题时更容易卡住? 那些暴增的算力和漫长的思考时间,到底被困在了什么地方? 这台藏在推理大模型底层的机器,叫分形盆瞬态混沌。 论文编号 arXiv:2609.04963。 在物理学视角下,大模型的推理过程本质上是一个高维动力系统。 解决一个问题,等于把一颗小球放进崎岖的重力场。 最终的正确答案,是那个唯一的稳定不动点。 如果是一道简单题,地势一马平川,小球顺着坡度直接滑进终点。 可一旦遇到高难度的数独、迷宫或者数学难题,整个重力场就彻底变了。 小球在滚向正确答案的过程中,会遭遇无数个鞍点。 什么叫鞍点? 放在具体的解题场景里,鞍点就是「差一点就做对的半成品解」。 在数独里,它是填满了八十个格子、只差最后一两个数字冲突的错误盘面。 在迷宫里,它是那条看起来走了九成路程、但在最后一米被封死的死胡同。 这些半成品解在数学上高度接近正确答案,带有微弱的引力。 模型以为自己快要找到了,于是一头扎了进去。 但因为那是一条死路,系统又必须把小球推出来。 于是小球在这些半成品解之间来回弹射、剧烈散射。 像掉进了一个装满钉子的弹珠台。 这种在有限时间内无法迅速收敛的无序震荡,在非线性动力学里被称为瞬态混沌。 更可怕的是初始条件的敏感度。 吉尔平团队在隐状态空间里切出切片进行测量。 他们发现,通往不同解题路径的吸引盆边界,呈现出无限嵌套的几何分形。 你在起点给初始状态施加一个微小到极致的扰动。 小球撞击鞍点的顺序就会彻底打乱。 推理耗时瞬间暴增几个数量级。 最反直觉的发现,还藏在模型的训练演化史里。 研究团队训练了一个专门解线性方程的循环推理模型,观察它在不同训练阶段的变化。 在早期阶段,模型很蠢,但它算得极快。 因为那时的错误答案是稳定的陷阱,小球滑进去就停了,模型毫不犹豫地给出错误答案。 随着训练推进,模型突然经历了一次物理学上的分岔。 模型学会了多步推理。 那些原本能困住它的错误答案,全部失去了稳定性,变成了可以逃逸的鞍点。 模型终于拥有了逃离错误、纠正假解的能力。 但代价也随之而来。 正是为了打破那些错误陷阱,模型把原本平滑的解题地形,硬生生塑造成了一个布满鞍点和分形边界的混沌迷宫。 为了能够纠错,模型必须容纳瞬态混沌。 一旦遇到真正复杂的约束问题,混沌就会把计算时间无限拉长。 所以大模型在难题面前的减速和过思考,并不是工程师没有调好参数。 这是高维计算复杂性在物理系统里必然投下的阴影。 能够纠错的智能,必须先学会从似是而非的诱惑里挣脱出来。 挣脱那些半成品答案的过程本身,就是一场在刀刃上的漫长漫游。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。