---
id: "mb-20260901-583295"
kind: "deep"
title: "Nature 统计了 21 世纪被人类引用最多的科学论文"
topic: "Nature 统计了 21 世纪被人类引用最多的科学论文"
source_type: "generated"
status: "published"
generated_at: "2026-09-01 14:46:03"
frame_type: ["残差流与工作总线机制（Residual Stre", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# Nature 统计了 21 世纪被人类引用最多的科学论文

Nature 统计了 21 世纪被人类引用最多的科学论文。
排在第一名的，不是相对论的后续验证，也不是基因编辑。
是 2015 年底微软亚洲研究院四位华人学者写下的一篇 12 页论文：
何恺明、张祥雨、任少卿、孙剑发表的 ResNet 残差网络。
累计引用超过 25 万次。
排在第七名的，是 2017 年奠定大模型底座的 Transformer。
但这篇登顶 21 世纪科学界的论文，动笔的起点，
是整个深度学习领域撞上的一堵高墙。
2015 年初，所谓「深度学习」，最核心的信仰就是把网络层数做深。
2012 年 AlexNet 只有 8 层。
2014 年牛津和谷歌把网络推到了 19 层和 22 层，识别率一路飙升。
可当研究人员试图把层数继续往上推，灾难发生了。
网络到了 20 层到 30 层之间，性能突然停滞，随后开始倒退。
一个 74 层的模型，识别准确率跌到了 38.9%。
被只有 8 层的原始模型轻松碾压。
这在当时被叫作「退化问题」。
最让人百思不得其解的是它的数学逻辑。
一个 30 层的网络，理论表现绝不可能比 14 层的网络更差。
因为多出来的 16 层，只要学会「什么都不做」。
把上一层的数据原封不动传给下一层就行。
这在数学上叫恒等映射。
既然网络有能力做到这一点，为什么最顶尖的优化算法死活找不到这个解？
答案藏在高维损失曲面的几何结构里。
神经网络训练的过程，是在几百万维的误差地形上寻找下坡方向。
每多叠一层非线性变换，误差信号向后反传的路径就被扭曲一次。
到了几十层以上，梯度信号不再是指引下坡的罗盘。
2017 年的一篇经典论文把这个现象命名为「破碎梯度」。
深层网络的梯度完全退化成了空间白噪声。
误差地形变成了布满尖刺和陷阱的悬崖峭壁。
算法每迈出一步都在撞墙。
何恺明团队拿出的解法，简单到近乎儿戏。
他们在每两层网络旁边，拉了一根直通的物理跳线。
把上一层的输入，直接加到这一层的输出上。
y = x + F(x)。
就是这么一个加法。
新加的网络层如果不知道该学什么，把自身参数全部归零即可。
F(x) 等于 0，输入数据 x 就顺着这条跳线无损流过。
李浩团队在 2018 年用高维投影画出了这前后的损失曲面：
没有跳线的深层网络，曲面像犬牙交错的碎石堆；
接上跳线之后，原本支离破碎的误差曲面，被拉成了一个平滑规整的巨大凹碗。
152 层的 ResNet 横空出世，横扫了 2015 年所有的计算机视觉比赛。
但这个看似只是为了解决训练困难的工程补丁，
很快逼着整个学术界重写了对神经网络的底层认知。
在 ResNet 出现前，主流世界坚信的是「分层特征阶梯」假说：
第 1 层提取边缘，第 2 层拼出纹理，第 5 层认出人脸。
每一层都是上一层不可或缺的台阶，抽掉任何一块，整栋楼就会塌陷。
2016 年，康奈尔大学团队做了一个反直觉的实验：
他们随手从一个 56 层的 ResNet 里删掉一层，甚至打乱层序。
网络的识别能力几乎没有受到任何影响。
这彻底打破了传统的特征阶梯假说。
网络内部根本不是严密的层级流水线。
那根被顺次连起来的跳线，在模型内部形成了一条贯穿始终、永不断流的「残差流」。
它是一条信息高速公路。
每一层网络不是必须承重的台阶，是挂在这条主干道旁边的读写单元：
从主干道里读取当前的中间状态，在旁边算一小段修正量，再悄悄写回主干道。
这台机器不再是单向加工流水线，它变成了神经网络的「工作记忆」。
一旦看懂了这台机器，后面十年的所有技术脉络全部严丝合缝。
2017 年谷歌造 Transformer 时，把残差流直接塞进了注意力机制的骨架里。
2024 年 Meta 研究视觉大模型 DINOv2 时，发现了一个诡异现象。
网络为了使用这段工作记忆，会自动霸占背景里毫无意义的白墙和抽屉像素。
把它们当成暂存全局信息的草稿纸。
当研究人员给它加上几个专用的「寄存器标记」，
模型便顺理成章地把全局特征全存进了寄存器里。
1900 年，普朗克为了解决黑体辐射的紫外灾难，
随手假设能量是一份一份离散发射的。
他当时以为这只是一个凑公式的数学补丁。
那个补丁最终撬开了量子力学的大门。
ResNet 当年在层与层之间连上的那根加法跳线，
起初也常被当作一个精巧的工程技巧。
但现代人工智能真正跨过深度门槛的起点，
就是从认出那条残差流开始的。

_Rendered by mubei-terminal._
