---
id: "mb-20260907-583295"
kind: "deep"
title: "2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文"
topic: "2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文"
source_type: "generated"
status: "published"
generated_at: "2026-09-07 16:25:06"
frame_type: ["破碎梯度与残差流高速总线", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文

2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文。
排名第一的不是希格斯玻色子，不是人类基因组，也不是 mRNA 疫苗。
是一篇 2015 年底发表、只有 12 页的计算机论文：何恺明团队提出的 ResNet。
单篇被引超过 20 万次。
这篇世纪论文的核心，表面看简单到近乎儿戏：在神经网络每隔两层之间拉一根跳线，把输入直接加到输出上。
也就是那行著名的公式：y 等于 F(x) 加 x。
为什么这么一个小学生级别的加法，成了现代 AI 的物理地基？
回到 2015 年初，深度学习其实刚经历过一场灭顶之灾。
当时整个学界坚信网络越深越聪明：AlexNet 8 层，VGG 19 层，GoogleNet 22 层。
微软亚洲研究院孙剑带领的团队想把层数继续往上做，结果整个系统直接撞墙。
56 层的模型，训练误差居然比 20 层的模型还要高。
74 层的模型，测试表现甚至不如只有 8 层的原始网络。
这甚至都不能叫过拟合。
因为过拟合是训练集表现完美、测试集拉胯。
而当时的深层网络，是在训练集上都根本学不会。
这在数学逻辑上是个荒谬的死结。
理论上只要让多出来的 36 层什么都不干、纯做恒等映射，把输入原封不动传给输出，56 层的效果至少应该和 20 层完全一样。
最优解明明就在解空间里摆着。
为什么主流的优化算法就是找不到它？
后来学界用显微镜看清了这台机器的物理本质。
深度前馈网络在物理上就像一场漫长的数据传话游戏。
输入图像经过几十层非线性变换，当误差信号从最后一层往回倒推时，梯度信号在千维参数空间里被反复拉扯。
2017 年 David Balduzzi 在论文里把这个元凶命名为破碎梯度。
当网络层数加深，指导模型学习的梯度信号不再是平缓的斜坡，在数学上退化成了高频白噪声。
2018 年 Hao Li 对损失曲面的三维可视化更残酷。
没有跨层直连的深层网络，参数空间是一片犬牙交错的悬崖乱石滩。
优化器只要一头扎进去，就会被困在无数个虚假的局部极小值里动弹不得。
何恺明加的那根跳跃连接，表面上是给数据修了一条旁路。
本质上，它是给整个神经网络搭了一条贯穿始终的高速总线：残差流。
原始数据 x 永远畅通无阻地流向终点。
每一层卷积不再需要从零开始重构整个世界，只需要在主干总线上增量修改一小笔。
悬崖乱石滩瞬间被熨平，变成了光滑的碗状平原。
这个补丁带来的真正震动，是它彻底推翻了人类对神经网络的传统理解。
过去学界普遍认为神经网络是分层抽象的流水线：第一层看边缘，第二层看轮廓，最后一层看语义。
如果真是流水线，只要抽掉中间任何一环，整条线就该当场瘫痪。
2016 年康奈尔大学团队做了一个暴力测试。
他们直接从 56 层的 ResNet 里强行拔掉几层，甚至打乱顺序，模型的准确率居然只掉了几个百分点。
残差流根本不是流水线。
它是神经网络的共享工作记忆。
2024 年 Meta 团队在视觉 Transformer 里发现了更诡异的一幕。
模型在残差流里，主动把背景空白区域的标记位，当成了自己的临时草稿纸。
研究人员用正常图像块的标记做分类探测，准确率只有 10.8%。
而拿那些对应着大白墙和空抽屉的背景标记做分类，准确率飙升到了 85.2%。
当研究人员主动给网络塞进几个空白的寄存器标记时，那些异常高响应全部消失，模型性能再次暴涨。
在没有任何人类干预的情况下，模型自己学会了利用残差流来存储和调用全局记忆。
1900 年，普朗克为了解决黑体辐射的紫外灾难，随手写下一个假设：能量是一份一份不连续发射的。
他当时觉得这只是个拼凑出来的数学技巧。
那个小技巧，开启了震动物理学三十年的量子力学革命。
ResNet 也是这样一个技巧。
12 页纸，一行加法。
它从一个解决训练报错的工程补丁，变成了统领 Transformer、扩散模型和所有大模型的底层中枢。
最深刻的技术突破，往往不来自宏大的顶层设计。
很多时候，它只是有人在机器被卡死的地方，顺手拆掉了一堵墙。

_Rendered by mubei-terminal._
