{"id":"mb-20260907-583295","kind":"deep","title":"2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文","summary":"2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文","body":"2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文。\n排名第一的不是希格斯玻色子，不是人类基因组，也不是 mRNA 疫苗。\n是一篇 2015 年底发表、只有 12 页的计算机论文：何恺明团队提出的 ResNet。\n单篇被引超过 20 万次。\n这篇世纪论文的核心，表面看简单到近乎儿戏：在神经网络每隔两层之间拉一根跳线，把输入直接加到输出上。\n也就是那行著名的公式：y 等于 F(x) 加 x。\n为什么这么一个小学生级别的加法，成了现代 AI 的物理地基？\n回到 2015 年初，深度学习其实刚经历过一场灭顶之灾。\n当时整个学界坚信网络越深越聪明：AlexNet 8 层，VGG 19 层，GoogleNet 22 层。\n微软亚洲研究院孙剑带领的团队想把层数继续往上做，结果整个系统直接撞墙。\n56 层的模型，训练误差居然比 20 层的模型还要高。\n74 层的模型，测试表现甚至不如只有 8 层的原始网络。\n这甚至都不能叫过拟合。\n因为过拟合是训练集表现完美、测试集拉胯。\n而当时的深层网络，是在训练集上都根本学不会。\n这在数学逻辑上是个荒谬的死结。\n理论上只要让多出来的 36 层什么都不干、纯做恒等映射，把输入原封不动传给输出，56 层的效果至少应该和 20 层完全一样。\n最优解明明就在解空间里摆着。\n为什么主流的优化算法就是找不到它？\n后来学界用显微镜看清了这台机器的物理本质。\n深度前馈网络在物理上就像一场漫长的数据传话游戏。\n输入图像经过几十层非线性变换，当误差信号从最后一层往回倒推时，梯度信号在千维参数空间里被反复拉扯。\n2017 年 David Balduzzi 在论文里把这个元凶命名为破碎梯度。\n当网络层数加深，指导模型学习的梯度信号不再是平缓的斜坡，在数学上退化成了高频白噪声。\n2018 年 Hao Li 对损失曲面的三维可视化更残酷。\n没有跨层直连的深层网络，参数空间是一片犬牙交错的悬崖乱石滩。\n优化器只要一头扎进去，就会被困在无数个虚假的局部极小值里动弹不得。\n何恺明加的那根跳跃连接，表面上是给数据修了一条旁路。\n本质上，它是给整个神经网络搭了一条贯穿始终的高速总线：残差流。\n原始数据 x 永远畅通无阻地流向终点。\n每一层卷积不再需要从零开始重构整个世界，只需要在主干总线上增量修改一小笔。\n悬崖乱石滩瞬间被熨平，变成了光滑的碗状平原。\n这个补丁带来的真正震动，是它彻底推翻了人类对神经网络的传统理解。\n过去学界普遍认为神经网络是分层抽象的流水线：第一层看边缘，第二层看轮廓，最后一层看语义。\n如果真是流水线，只要抽掉中间任何一环，整条线就该当场瘫痪。\n2016 年康奈尔大学团队做了一个暴力测试。\n他们直接从 56 层的 ResNet 里强行拔掉几层，甚至打乱顺序，模型的准确率居然只掉了几个百分点。\n残差流根本不是流水线。\n它是神经网络的共享工作记忆。\n2024 年 Meta 团队在视觉 Transformer 里发现了更诡异的一幕。\n模型在残差流里，主动把背景空白区域的标记位，当成了自己的临时草稿纸。\n研究人员用正常图像块的标记做分类探测，准确率只有 10.8%。\n而拿那些对应着大白墙和空抽屉的背景标记做分类，准确率飙升到了 85.2%。\n当研究人员主动给网络塞进几个空白的寄存器标记时，那些异常高响应全部消失，模型性能再次暴涨。\n在没有任何人类干预的情况下，模型自己学会了利用残差流来存储和调用全局记忆。\n1900 年，普朗克为了解决黑体辐射的紫外灾难，随手写下一个假设：能量是一份一份不连续发射的。\n他当时觉得这只是个拼凑出来的数学技巧。\n那个小技巧，开启了震动物理学三十年的量子力学革命。\nResNet 也是这样一个技巧。\n12 页纸，一行加法。\n它从一个解决训练报错的工程补丁，变成了统领 Transformer、扩散模型和所有大模型的底层中枢。\n最深刻的技术突破，往往不来自宏大的顶层设计。\n很多时候，它只是有人在机器被卡死的地方，顺手拆掉了一堵墙。","topic":"2025 年，《Nature》统计了 21 世纪被引用次数最多的科学论文","frame_type":["破碎梯度与残差流高速总线","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-07 16:25:06","legal_anchor_count":0,"transcript_citation_count":0}