深度解读生物与医学generatedpublished

2025 年,《Nature》统计了 21 世纪被引用次数最多的科学论文

破碎梯度与残差流高速总线机制

2025 年,《Nature》统计了 21 世纪被引用次数最多的科学论文。 排名第一的不是希格斯玻色子,不是人类基因组,也不是 mRNA 疫苗。 是一篇 2015 年底发表、只有 12 页的计算机论文:何恺明团队提出的 ResNet。 单篇被引超过 20 万次。 这篇世纪论文的核心,表面看简单到近乎儿戏:在神经网络每隔两层之间拉一根跳线,把输入直接加到输出上。 也就是那行著名的公式:y 等于 F(x) 加 x。 为什么这么一个小学生级别的加法,成了现代 AI 的物理地基? 回到 2015 年初,深度学习其实刚经历过一场灭顶之灾。 当时整个学界坚信网络越深越聪明:AlexNet 8 层,VGG 19 层,GoogleNet 22 层。 微软亚洲研究院孙剑带领的团队想把层数继续往上做,结果整个系统直接撞墙。 56 层的模型,训练误差居然比 20 层的模型还要高。 74 层的模型,测试表现甚至不如只有 8 层的原始网络。 这甚至都不能叫过拟合。 因为过拟合是训练集表现完美、测试集拉胯。 而当时的深层网络,是在训练集上都根本学不会。 这在数学逻辑上是个荒谬的死结。 理论上只要让多出来的 36 层什么都不干、纯做恒等映射,把输入原封不动传给输出,56 层的效果至少应该和 20 层完全一样。 最优解明明就在解空间里摆着。 为什么主流的优化算法就是找不到它? 后来学界用显微镜看清了这台机器的物理本质。 深度前馈网络在物理上就像一场漫长的数据传话游戏。 输入图像经过几十层非线性变换,当误差信号从最后一层往回倒推时,梯度信号在千维参数空间里被反复拉扯。 2017 年 David Balduzzi 在论文里把这个元凶命名为破碎梯度。 当网络层数加深,指导模型学习的梯度信号不再是平缓的斜坡,在数学上退化成了高频白噪声。 2018 年 Hao Li 对损失曲面的三维可视化更残酷。 没有跨层直连的深层网络,参数空间是一片犬牙交错的悬崖乱石滩。 优化器只要一头扎进去,就会被困在无数个虚假的局部极小值里动弹不得。 何恺明加的那根跳跃连接,表面上是给数据修了一条旁路。 本质上,它是给整个神经网络搭了一条贯穿始终的高速总线:残差流。 原始数据 x 永远畅通无阻地流向终点。 每一层卷积不再需要从零开始重构整个世界,只需要在主干总线上增量修改一小笔。 悬崖乱石滩瞬间被熨平,变成了光滑的碗状平原。 这个补丁带来的真正震动,是它彻底推翻了人类对神经网络的传统理解。 过去学界普遍认为神经网络是分层抽象的流水线:第一层看边缘,第二层看轮廓,最后一层看语义。 如果真是流水线,只要抽掉中间任何一环,整条线就该当场瘫痪。 2016 年康奈尔大学团队做了一个暴力测试。 他们直接从 56 层的 ResNet 里强行拔掉几层,甚至打乱顺序,模型的准确率居然只掉了几个百分点。 残差流根本不是流水线。 它是神经网络的共享工作记忆。 2024 年 Meta 团队在视觉 Transformer 里发现了更诡异的一幕。 模型在残差流里,主动把背景空白区域的标记位,当成了自己的临时草稿纸。 研究人员用正常图像块的标记做分类探测,准确率只有 10.8%。 而拿那些对应着大白墙和空抽屉的背景标记做分类,准确率飙升到了 85.2%。 当研究人员主动给网络塞进几个空白的寄存器标记时,那些异常高响应全部消失,模型性能再次暴涨。 在没有任何人类干预的情况下,模型自己学会了利用残差流来存储和调用全局记忆。 1900 年,普朗克为了解决黑体辐射的紫外灾难,随手写下一个假设:能量是一份一份不连续发射的。 他当时觉得这只是个拼凑出来的数学技巧。 那个小技巧,开启了震动物理学三十年的量子力学革命。 ResNet 也是这样一个技巧。 12 页纸,一行加法。 它从一个解决训练报错的工程补丁,变成了统领 Transformer、扩散模型和所有大模型的底层中枢。 最深刻的技术突破,往往不来自宏大的顶层设计。 很多时候,它只是有人在机器被卡死的地方,顺手拆掉了一堵墙。

引用 / CITATIONS

No citations exported.

同领域解读 / BIO & MEDICINE

查看全部「生物与医学」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情