{"id":"mb-20260916-cb11d5","kind":"deep","title":"拆解 1100 个 AI 模型：为什么八竿子打不着的任务最后全挤进同一个 16 维空间？","summary":"约翰斯·霍普金斯大学团队对 1100 多个深度学习模型进行谱分析，发现无论训练数据与任务多么悬殊，同架构模型的有效权重最终都会收敛到同一个 16 维的公共子空间。这揭示出网络架构的几何归纳偏置与梯度下降的谱偏置对参数空间的决定性约束，为无数据模型合并与极速微调提供了全新路径。","body":"给同一个模型底座分别喂几万张卫星遥感图和几千份医学病历，训出来的两台机器，内部走线会完全不同吗？\n常识肯定会说：一个是看地的，一个是看病的，参数早就各走各的道了。\n约翰斯·霍普金斯大学把 1100 多个已经训好的深度学习模型切开做了一次体检。\n结果让所有人倒吸一口凉气。\n不管是看卫星图的，还是看病历的，它们在各层真正用来干活的核心参数，居然全收敛到了同一个只有 16 维的小空间里。\n怎么可能？\n几亿甚至几十亿个参数的高维空间，能走的方向比宇宙里的原子还多。\n几百个互不相识的工程师，在不同时间、用完全不相干的数据训出来的模型，凭什么会挤到同一个角落？\n难道大家折腾了半天，造出来的其实是同一个东西？\n把这件事测清楚的，是 2025 年底的一项研究（arXiv:2512.05117）。\n约翰斯·霍普金斯大学的高希克（Prakhar Kaushik）团队找来了 1100 多个模型。\n里面包括 500 个视觉 Transformer（ViT）、500 个大语言模型微调模块（LoRA），外加 50 个 LLaMA 和上百个其他模型。\n这些模型来自开源社区 HuggingFace，训练任务千差万别，从医学影像、卫星遥感到文本理解都有。\n研究人员用高阶奇异值分解的方法，一层一层去拆解这些模型的权重矩阵。\n结果看到了一条极度陡峭的特征值衰减曲线。\n什么意思呢？\n一个原本有几百万维度的矩阵，绝大部分维度的方差几乎为零，根本没有发挥作用。\n真正决定模型能力的，就只有排在最前面的几个主方向。\n团队做了一个极其大胆的实验。\n他们把 500 个做不同图像任务的视觉模型，强行投影到一个共同提取出来的 16 维谱子空间上。\n除了最前和最后的特定层因为图片尺寸和分类数量不同保留原样，中间所有隐藏层全被压缩进这 16 个方向。\n然后拿五个完全没见过的全新任务去跑评估。\n分类准确率几乎没有掉。\n原本存这 500 个视觉模型需要 150 GB 显存和硬盘，现在只需要存这套公共子空间，外加每台模型各自的少量线性系数。\n存储体积直接砍掉了 100 倍。\n把 50 个 LLaMA 语言模型做同样的投影，1.6 TB 的体积同样被削减了 100 倍。\n而且这项庞大的谱分析，在一张普通的英伟达 RTX A5000 显卡上就跑完了。\n这就带来了一个根本性的追问：\n几百个工程师互不认识，喂进去的数据八竿子打不着，为什么模型最终会撞进同一个数学模具里？\n这里头有两个极硬的数学约束。\n一个在网络架构本身。\n过去大家总觉得，深度学习就像一张白纸，给它喂什么数据，它就长成什么样。\n但这项研究证明，网络架构本身的几何约束，远远大过了训练数据。\n只要你用了 Transformer 的自注意力机制，架构本身就已经在参数空间里划定了一套非常狭窄的几何轨道。\n数据在让参数前进，但轨道早就被架构焊死了。\n另一个约束在梯度下降的优化过程里。\n反向传播算法在更新参数时，天生有一种偏爱低频和平滑解的谱偏置。\n这就好比往一座结构复杂的山脊上倒水。\n不管你倒的是矿泉水、可乐还是雨水，也不管你从哪个山头开始倒，水流最终都会顺着山体天然凹陷的那十几条主河道流下来。\n那十几条主河道，就是那 16 个主成分。\n有人可能会问：这算不算是证明了所有人工智能都在用同一种语言思考？\n网上有些推文已经开始这么吹了。\n没那么玄乎。\n论文作者在限制条件里说得很克制：这种低维子空间的收敛，发生在相同架构的内部。\n也就是说，视觉 Transformer 之间共享一个空间，语言模型之间共享另一个空间，不同架构之间目前还无法直接对齐。\n它没有创造一个全宇宙通用的人工智能心智。\n但这已经足够改变很多工程现实了。\n如果模型的核心能力只在那十几个主方向上，我们以后可能根本不需要每次都从头硬训几百亿参数。\n开发一个新任务时，把底层的通用方向直接冻结，只微调那几个线性系数，训练变得极其平滑，几分钟就能收敛。\n不同人微调出来的模型想要合体，也不再需要靠暴力裁剪或者盲猜权重，直接在共享的坐标系里做向量加法就行。\n我们曾经以为每一个大模型都是一个难以捉摸的外星大脑。\n但在数学显微镜底下，它们只是同一座滑梯上，滑进了同一道轨道的钢珠。","topic":"拆解 1100 个 AI 模型：为什么八竿子打不着的任务最后全挤进同一个 16 维空间？","frame_type":["架构归纳偏置与梯度下降谱偏置（通用权重子空间假说","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-16 08:46:59","legal_anchor_count":0,"transcript_citation_count":0}