深度解读AI 与大模型generatedpublished

拆解 1100 个 AI 模型:为什么八竿子打不着的任务最后全挤进同一个 16 维空间?

架构归纳偏置与梯度下降谱偏置(通用权重子空间假说机制

给同一个模型底座分别喂几万张卫星遥感图和几千份医学病历,训出来的两台机器,内部走线会完全不同吗? 常识肯定会说:一个是看地的,一个是看病的,参数早就各走各的道了。 约翰斯·霍普金斯大学把 1100 多个已经训好的深度学习模型切开做了一次体检。 结果让所有人倒吸一口凉气。 不管是看卫星图的,还是看病历的,它们在各层真正用来干活的核心参数,居然全收敛到了同一个只有 16 维的小空间里。 怎么可能? 几亿甚至几十亿个参数的高维空间,能走的方向比宇宙里的原子还多。 几百个互不相识的工程师,在不同时间、用完全不相干的数据训出来的模型,凭什么会挤到同一个角落? 难道大家折腾了半天,造出来的其实是同一个东西? 把这件事测清楚的,是 2025 年底的一项研究(arXiv:2512.05117)。 约翰斯·霍普金斯大学的高希克(Prakhar Kaushik)团队找来了 1100 多个模型。 里面包括 500 个视觉 Transformer(ViT)、500 个大语言模型微调模块(LoRA),外加 50 个 LLaMA 和上百个其他模型。 这些模型来自开源社区 HuggingFace,训练任务千差万别,从医学影像、卫星遥感到文本理解都有。 研究人员用高阶奇异值分解的方法,一层一层去拆解这些模型的权重矩阵。 结果看到了一条极度陡峭的特征值衰减曲线。 什么意思呢? 一个原本有几百万维度的矩阵,绝大部分维度的方差几乎为零,根本没有发挥作用。 真正决定模型能力的,就只有排在最前面的几个主方向。 团队做了一个极其大胆的实验。 他们把 500 个做不同图像任务的视觉模型,强行投影到一个共同提取出来的 16 维谱子空间上。 除了最前和最后的特定层因为图片尺寸和分类数量不同保留原样,中间所有隐藏层全被压缩进这 16 个方向。 然后拿五个完全没见过的全新任务去跑评估。 分类准确率几乎没有掉。 原本存这 500 个视觉模型需要 150 GB 显存和硬盘,现在只需要存这套公共子空间,外加每台模型各自的少量线性系数。 存储体积直接砍掉了 100 倍。 把 50 个 LLaMA 语言模型做同样的投影,1.6 TB 的体积同样被削减了 100 倍。 而且这项庞大的谱分析,在一张普通的英伟达 RTX A5000 显卡上就跑完了。 这就带来了一个根本性的追问: 几百个工程师互不认识,喂进去的数据八竿子打不着,为什么模型最终会撞进同一个数学模具里? 这里头有两个极硬的数学约束。 一个在网络架构本身。 过去大家总觉得,深度学习就像一张白纸,给它喂什么数据,它就长成什么样。 但这项研究证明,网络架构本身的几何约束,远远大过了训练数据。 只要你用了 Transformer 的自注意力机制,架构本身就已经在参数空间里划定了一套非常狭窄的几何轨道。 数据在让参数前进,但轨道早就被架构焊死了。 另一个约束在梯度下降的优化过程里。 反向传播算法在更新参数时,天生有一种偏爱低频和平滑解的谱偏置。 这就好比往一座结构复杂的山脊上倒水。 不管你倒的是矿泉水、可乐还是雨水,也不管你从哪个山头开始倒,水流最终都会顺着山体天然凹陷的那十几条主河道流下来。 那十几条主河道,就是那 16 个主成分。 有人可能会问:这算不算是证明了所有人工智能都在用同一种语言思考? 网上有些推文已经开始这么吹了。 没那么玄乎。 论文作者在限制条件里说得很克制:这种低维子空间的收敛,发生在相同架构的内部。 也就是说,视觉 Transformer 之间共享一个空间,语言模型之间共享另一个空间,不同架构之间目前还无法直接对齐。 它没有创造一个全宇宙通用的人工智能心智。 但这已经足够改变很多工程现实了。 如果模型的核心能力只在那十几个主方向上,我们以后可能根本不需要每次都从头硬训几百亿参数。 开发一个新任务时,把底层的通用方向直接冻结,只微调那几个线性系数,训练变得极其平滑,几分钟就能收敛。 不同人微调出来的模型想要合体,也不再需要靠暴力裁剪或者盲猜权重,直接在共享的坐标系里做向量加法就行。 我们曾经以为每一个大模型都是一个难以捉摸的外星大脑。 但在数学显微镜底下,它们只是同一座滑梯上,滑进了同一道轨道的钢珠。

引用 / CITATIONS

No citations exported.

同领域解读 / AI & LLMS

查看全部「AI 与大模型」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情