{"id":"mb-20260831-1c0020","account":"mubei","brand":"","title":"把世界上所有的图片都识别成同一个常数，在数学上是一个零误差的完美预测","summary":"把世界上所有的图片都识别成同一个常数，在数学上是一个零误差的完美预测","body":"把世界上所有的图片都识别成同一个常数，在数学上是一个零误差的完美预测。\n这不是系统报错，是过去几年困扰顶级 AI 架构师的致命梦魇。\n它在算法世界里有一个名字：特征坍塌。\n2022 年，图灵奖得主 Yann LeCun 提出了一套架构：联合嵌入预测架构，也就是 JEPA。\nLeCun 当时公开向生成式 AI 宣战。\n他的理由很犀利：\n传统的生成模型在像素空间里预测，把大把算力浪费在树叶摆动、水面波纹这些微观噪点上。\n智能的本质，不该是给每个像素画素描。\n它应该直接在高度抽象的隐空间里做预测。\n看完上半段视频，预测下半段的抽象概念。\n听起来无懈可击。\n但这套架构一跑起来，立刻撞上了一堵墙。\n既然预测发生在抽象的特征空间，神经网络立刻找到了走捷径的终极办法。\n它把所有的输入，无论是猫、狗、汽车还是一张白纸，全部映射为同一个零向量。\n预测器输入零，目标也是零，两者之间的距离是完美的零。\n损失函数直接降到最低。\n模型向你交出一份满分答卷，实际上整个神经网络彻底摆烂，变成了一块死铁。\n这就是特征坍塌。\n为了不让模型钻这个数学空子，工程师们在过去几年里打满了眼花缭乱的补丁。\n为了不让两边串通，有人强行切断一侧的梯度更新。\n为了不让特征缩成一点，有人发明了动量编码器 EMA，让网络的一半慢吞吞地跟着另一半动。\n还有人写出复杂的方差协方差惩罚项 VICReg，用外力硬生生把特征向量往四周扯开。\n每一项补丁都在起作用。\n但每一个补丁，都透着一股工程妥协的味道。\n它们像是一群经验丰富的工匠，在一座随时会倒塌的危楼四周，拼命加装钢架和木桩。\n2026 年的 ICML 会议上，牛津学者 Moritz Gögl 和 Christopher Yau 拿出了一篇论文。\n他们把这层窗户纸彻底捅破了。\n他们问了一个直击要害的问题：\n为什么预测模型非要用这么多人工补丁，来对抗坍塌？\n答案藏在一个被忽视的数学事实里。\nLeCun 当年宣称 JEPA 是一种完全独立于概率生成模型的新物种。\n但数学推导表明，这根本不是什么结构上的断裂，只是一种修辞上的包装。\n标准的 JEPA 架构，本质上只是耦合隐变量模型在变分推断下的一个确定性特例。\n它本该是一个完整的概率模型。\n由于在设计时去掉了概率似然，原本应该由数学公式自然维持的平衡被打破了。\n失去了数学引力，系统只能靠人工搭脚手架来防塌。\n两位学者做了一件事：把这套架构重新写回变分推断的框架里，构造出了 Var-JEPA。\n他们只用了一个统一的数学目标：单证据下界，也就是 ELBO。\n奇迹就在这里发生。\n当目标函数回到了严密的概率公式，内部的熵与散度项，像自然界的斥力一样发挥作用。\n它们天然阻止了所有特征缩成同一个点。\n动量编码器不要了。\n梯度截断不要了。\n人工调参的方差惩罚项全被扔进了垃圾桶。\n模型彻底告别了特征坍塌。\n它还顺手解锁了一项标准 JEPA 梦寐以求的能力：在抽象特征空间里，直接度量自身判断的不确定性。\n知道自己知道什么，也知道自己对什么没有把握。\n工程上那些让人焦头炼额的修修补补，往往只是因为底层的数学拼图少了一块。\n当你需要用五个复杂的补丁去维持一个系统的稳定时，问题大概率不在工程实现上。\n而在最初的理论地基里。\n把地基补齐的那一刻，所有的脚手架都会自己掉下来。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-31 10:58:54","created_at":"2026-08-31 10:58:54"}