---
id: "mb-20260916-cb11d5"
kind: "deep"
title: "拆解 1100 个 AI 模型：为什么八竿子打不着的任务最后全挤进同一个 16 维空间？"
topic: "拆解 1100 个 AI 模型：为什么八竿子打不着的任务最后全挤进同一个 16 维空间？"
source_type: "generated"
status: "published"
generated_at: "2026-09-16 08:46:59"
frame_type: ["架构归纳偏置与梯度下降谱偏置（通用权重子空间假说", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 拆解 1100 个 AI 模型：为什么八竿子打不着的任务最后全挤进同一个 16 维空间？

给同一个模型底座分别喂几万张卫星遥感图和几千份医学病历，训出来的两台机器，内部走线会完全不同吗？
常识肯定会说：一个是看地的，一个是看病的，参数早就各走各的道了。
约翰斯·霍普金斯大学把 1100 多个已经训好的深度学习模型切开做了一次体检。
结果让所有人倒吸一口凉气。
不管是看卫星图的，还是看病历的，它们在各层真正用来干活的核心参数，居然全收敛到了同一个只有 16 维的小空间里。
怎么可能？
几亿甚至几十亿个参数的高维空间，能走的方向比宇宙里的原子还多。
几百个互不相识的工程师，在不同时间、用完全不相干的数据训出来的模型，凭什么会挤到同一个角落？
难道大家折腾了半天，造出来的其实是同一个东西？
把这件事测清楚的，是 2025 年底的一项研究（arXiv:2512.05117）。
约翰斯·霍普金斯大学的高希克（Prakhar Kaushik）团队找来了 1100 多个模型。
里面包括 500 个视觉 Transformer（ViT）、500 个大语言模型微调模块（LoRA），外加 50 个 LLaMA 和上百个其他模型。
这些模型来自开源社区 HuggingFace，训练任务千差万别，从医学影像、卫星遥感到文本理解都有。
研究人员用高阶奇异值分解的方法，一层一层去拆解这些模型的权重矩阵。
结果看到了一条极度陡峭的特征值衰减曲线。
什么意思呢？
一个原本有几百万维度的矩阵，绝大部分维度的方差几乎为零，根本没有发挥作用。
真正决定模型能力的，就只有排在最前面的几个主方向。
团队做了一个极其大胆的实验。
他们把 500 个做不同图像任务的视觉模型，强行投影到一个共同提取出来的 16 维谱子空间上。
除了最前和最后的特定层因为图片尺寸和分类数量不同保留原样，中间所有隐藏层全被压缩进这 16 个方向。
然后拿五个完全没见过的全新任务去跑评估。
分类准确率几乎没有掉。
原本存这 500 个视觉模型需要 150 GB 显存和硬盘，现在只需要存这套公共子空间，外加每台模型各自的少量线性系数。
存储体积直接砍掉了 100 倍。
把 50 个 LLaMA 语言模型做同样的投影，1.6 TB 的体积同样被削减了 100 倍。
而且这项庞大的谱分析，在一张普通的英伟达 RTX A5000 显卡上就跑完了。
这就带来了一个根本性的追问：
几百个工程师互不认识，喂进去的数据八竿子打不着，为什么模型最终会撞进同一个数学模具里？
这里头有两个极硬的数学约束。
一个在网络架构本身。
过去大家总觉得，深度学习就像一张白纸，给它喂什么数据，它就长成什么样。
但这项研究证明，网络架构本身的几何约束，远远大过了训练数据。
只要你用了 Transformer 的自注意力机制，架构本身就已经在参数空间里划定了一套非常狭窄的几何轨道。
数据在让参数前进，但轨道早就被架构焊死了。
另一个约束在梯度下降的优化过程里。
反向传播算法在更新参数时，天生有一种偏爱低频和平滑解的谱偏置。
这就好比往一座结构复杂的山脊上倒水。
不管你倒的是矿泉水、可乐还是雨水，也不管你从哪个山头开始倒，水流最终都会顺着山体天然凹陷的那十几条主河道流下来。
那十几条主河道，就是那 16 个主成分。
有人可能会问：这算不算是证明了所有人工智能都在用同一种语言思考？
网上有些推文已经开始这么吹了。
没那么玄乎。
论文作者在限制条件里说得很克制：这种低维子空间的收敛，发生在相同架构的内部。
也就是说，视觉 Transformer 之间共享一个空间，语言模型之间共享另一个空间，不同架构之间目前还无法直接对齐。
它没有创造一个全宇宙通用的人工智能心智。
但这已经足够改变很多工程现实了。
如果模型的核心能力只在那十几个主方向上，我们以后可能根本不需要每次都从头硬训几百亿参数。
开发一个新任务时，把底层的通用方向直接冻结，只微调那几个线性系数，训练变得极其平滑，几分钟就能收敛。
不同人微调出来的模型想要合体，也不再需要靠暴力裁剪或者盲猜权重，直接在共享的坐标系里做向量加法就行。
我们曾经以为每一个大模型都是一个难以捉摸的外星大脑。
但在数学显微镜底下，它们只是同一座滑梯上，滑进了同一道轨道的钢珠。

_Rendered by mubei-terminal._
