科技·via

把世界上所有的图片都识别成同一个常数,在数学上是一个零误差的完美预测

把世界上所有的图片都识别成同一个常数,在数学上是一个零误差的完美预测。 这不是系统报错,是过去几年困扰顶级 AI 架构师的致命梦魇。 它在算法世界里有一个名字:特征坍塌。 2022 年,图灵奖得主 Yann LeCun 提出了一套架构:联合嵌入预测架构,也就是 JEPA。 LeCun 当时公开向生成式 AI 宣战。 他的理由很犀利: 传统的生成模型在像素空间里预测,把大把算力浪费在树叶摆动、水面波纹这些微观噪点上。 智能的本质,不该是给每个像素画素描。 它应该直接在高度抽象的隐空间里做预测。 看完上半段视频,预测下半段的抽象概念。 听起来无懈可击。 但这套架构一跑起来,立刻撞上了一堵墙。 既然预测发生在抽象的特征空间,神经网络立刻找到了走捷径的终极办法。 它把所有的输入,无论是猫、狗、汽车还是一张白纸,全部映射为同一个零向量。 预测器输入零,目标也是零,两者之间的距离是完美的零。 损失函数直接降到最低。 模型向你交出一份满分答卷,实际上整个神经网络彻底摆烂,变成了一块死铁。 这就是特征坍塌。 为了不让模型钻这个数学空子,工程师们在过去几年里打满了眼花缭乱的补丁。 为了不让两边串通,有人强行切断一侧的梯度更新。 为了不让特征缩成一点,有人发明了动量编码器 EMA,让网络的一半慢吞吞地跟着另一半动。 还有人写出复杂的方差协方差惩罚项 VICReg,用外力硬生生把特征向量往四周扯开。 每一项补丁都在起作用。 但每一个补丁,都透着一股工程妥协的味道。 它们像是一群经验丰富的工匠,在一座随时会倒塌的危楼四周,拼命加装钢架和木桩。 2026 年的 ICML 会议上,牛津学者 Moritz Gögl 和 Christopher Yau 拿出了一篇论文。 他们把这层窗户纸彻底捅破了。 他们问了一个直击要害的问题: 为什么预测模型非要用这么多人工补丁,来对抗坍塌? 答案藏在一个被忽视的数学事实里。 LeCun 当年宣称 JEPA 是一种完全独立于概率生成模型的新物种。 但数学推导表明,这根本不是什么结构上的断裂,只是一种修辞上的包装。 标准的 JEPA 架构,本质上只是耦合隐变量模型在变分推断下的一个确定性特例。 它本该是一个完整的概率模型。 由于在设计时去掉了概率似然,原本应该由数学公式自然维持的平衡被打破了。 失去了数学引力,系统只能靠人工搭脚手架来防塌。 两位学者做了一件事:把这套架构重新写回变分推断的框架里,构造出了 Var-JEPA。 他们只用了一个统一的数学目标:单证据下界,也就是 ELBO。 奇迹就在这里发生。 当目标函数回到了严密的概率公式,内部的熵与散度项,像自然界的斥力一样发挥作用。 它们天然阻止了所有特征缩成同一个点。 动量编码器不要了。 梯度截断不要了。 人工调参的方差惩罚项全被扔进了垃圾桶。 模型彻底告别了特征坍塌。 它还顺手解锁了一项标准 JEPA 梦寐以求的能力:在抽象特征空间里,直接度量自身判断的不确定性。 知道自己知道什么,也知道自己对什么没有把握。 工程上那些让人焦头炼额的修修补补,往往只是因为底层的数学拼图少了一块。 当你需要用五个复杂的补丁去维持一个系统的稳定时,问题大概率不在工程实现上。 而在最初的理论地基里。 把地基补齐的那一刻,所有的脚手架都会自己掉下来。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情