2024 年计算机图灵奖得主理查德·萨顿,在红杉资本最新专访中泼了一盆冷水
2024 年计算机图灵奖得主理查德·萨顿,在红杉资本最新专访中泼了一盆冷水。 这位公认的强化学习之父直言:大语言模型充其量只展现了四分之一的智能。 当整个硅谷都在疯狂烧钱买算力、用合成数据给模型填坑的时候, 萨顿认为头部实验室已经集体陷入了局部最优。 2019 年写下《苦涩的教训》、教会所有人用通用算力碾压规则的祖师爷, 为什么会在大模型最辉煌的时刻泼出这盆冷水? 大模型漏掉的那大半心智,到底卡在了哪里? 萨顿把矛头指向了一个被行业刻意绕开的底层命题。 大世界假说。 真实世界的复杂度与动态变化,永远呈指数级大于任何模型参数,也大于任何人工建造的模拟器。 智能体永远无法把整个世界一次性装进肚子里。 如今主流 AI 走的是一条两阶段的截流路线: 先抓取互联网上的所有公开历史数据,花数亿美元做一次性离线预训练。 随后把几千亿参数的权重彻底冻结,打包交付。 这种模型没有此时此刻的环境感知,没有与物理世界的实时博弈。 它是一座博学的静态历史档案馆,对下一秒发生的新变量毫无招架之力。 当人类存量文本被消耗殆尽,巨头们转头用模型自产的合成数据来训练下一代模型。 在大世界假说面前,这无异于一种封闭系统里的近亲繁殖。 一个有限参数的容器,无论怎么自我演练,也无法凭空生成真实世界源源不断的未知熵增。 既然离线冷冻有天花板,为什么各大实验室不让大模型在现实交互中持续更新权重? 因为深度学习底层埋着一道几十年来没人跨过去的暗礁。 可塑性丧失。 2024 年 8 月,萨顿团队在《自然》(Nature)杂志发表了一篇重磅论文。 他们证实:传统的反向传播算法在面对持续流动的非平稳现实时,存在致命缺陷。 随着时间推移,深层网络里的大量神经元会逐步饱和、休眠或被旧任务焊死。 模型会迅速丧失吸收新信息的可塑性,最终性能甚至跌落到最简单的线性模型水平。 强行喂入新知识,又会引发灾难性遗忘,把过去掌握的常识全部冲垮。 现有的万卡集群之所以把权重死死冻结,并非技术圆满,纯粹是对网络退化的被迫妥协。 萨顿团队在论文中给出的解法,叫持续反向传播。 它在梯度计算的同时,给网络装上了一套动态代谢系统。 算法持续追踪神经元的活性与效用,定期将低贡献的休眠单元随机重置。 这种机制如同生物大脑的突触修剪,源源不断地为网络注入新的多样性。 深度网络终于能在不遗忘旧经验的前提下,永久维持学习新事物的可塑性。 人类大脑包含约 100 万亿个突触,每天 24 小时在未知世界中感知、预测、行动并实时进化。 它的一生从未冻结过权重。 维持这套心智终身自主学习的功耗,只有区区 20 瓦。 靠数十兆瓦电力冷冻参数堆出来的数字图书馆,终究只是通往真正智能的局部切片。 萨顿与贾维德创立 Oak Lab,将《阿尔伯塔计划》推向产业落地, 目标就是在 5 到 10 年内造出万亿参数、20 瓦功耗、在真实世界中终身学习的心智模型。 真正的技术分水岭,从来不在于谁在旧胡同里堆了更多芯片、跑了更多合成数据。 在于谁能率先打破冷冻参数的枷锁,让机器真正走向永远学习的无限世界。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。