DeepMind罕见承认落后:AI前沿为何在一夜之间漂向了软件工程母体?
Google DeepMind 的首席架构师 Koray Kavukcuoglu,在官方播客上坐了下来。 他说了句在巨头公关里几乎不可能听到的话。 他亲口承认: Google 当前的大模型质量,确实略微落后于行业前沿。 在整个 AI 行业眼里,这句话带来的震动比任何财报都大。 坐在话筒前的人,正是十多年前 DeepMind 刚成立时的第一位深度学习研究员。 他是从 Yann LeCun 实验室走出来的元老。 也是后来一手打出 DQN、AlphaGo 和 AlphaFold 的技术操盘手。 他背后站着全球算力最庞大的数据中心。 站着自研了十五年的 TPU 集群。 站着发明了 Transformer 架构的技术团队。 这样一家要算力有算力、要天才有天才的巨头, 为什么会在自己的官方频道上,承认自己落后了? 是 Google 突然不会做科研了吗? 还是他们预训练用的算力不够多? 算力和人才都没有掉队。 真正要追问的是: 过去一年里,AI 的前沿坐标到底被谁挪动了? 为什么所有人辛辛苦苦爬到了山顶,却发现山峰整个变了样? 把这套系统的演进拆开,底下运转着一台重新定义前沿的技术机器。 软件工程母体。 在上一轮竞赛里,行业对模型能力的衡量,几乎全被圈在静态的试卷里。 比谁在知识问答里考分更高。 比谁写诗写公文更顺畅。 比谁的上下文窗口能塞进更多几百万 Token。 只要预训练算力成倍往上砸,只要多模态数据够大,分数的指针就会往前走。 Gemini 3 刚发布的时候,DeepMind 团队笃定自己正站在前沿正中央。 可是前沿在一夜之间发生了漂移。 行业突然不再为静态的文字生成买单。 真正的分水岭,切到了智能体能不能接管真实的软件工程。 这远不止是写几行玩具代码。 这是让模型在一个完全陌生的代码库里穿梭。 自己调用终端命令,读取报错日志,修改逻辑,再跑通单元测试。 很多研究团队以前觉得,写代码不过是众多垂直领域里的一个细分技能。 Koray 在访谈里坦言,他们过去一直在它外围打转。 直到竞争格局彻底转变,他们才看清一个底层的技术现实: 软件工程超越了普通的垂直领域,它是所有自主智能体的母体。 为什么是代码? 因为自然语言是充满歧义的深水区。 你让模型写一篇文章,好与不好,现实中没有一个裁判能瞬间给出判定。 但在软件工程的世界里,有一台冰冷且绝对公正的机器。 编译器。 代码写对了,程序就能跑通。 逻辑漏了一处,控制台立刻吐出红色的报错堆栈。 测试用例过了就是过了,挂了就是挂了。 这是现实世界里唯一的特例。 它既承载着人类复杂的抽象逻辑, 又拥有绝对确定的即时反馈。 当年 DeepMind 靠 DQN 在 Atari 游戏上一战成名, 靠的就是游戏画面和分数的确定性闭环。 而在代码的世界里,编译器就是最严苛的 Atari 游戏机。 谁能在这个闭环里反复受挫、自我调试并跑通代码, 谁才真正拿到了自主行动的钥匙。 当对手把代码环境当成智能体训练的跳板, 继续在静态榜单上刷分, 就等于在上一代的阵地上拼刺刀。 技术的进阶从来就没有平滑的斜坡。 Koray 把它形容成多重叠加的 S 曲线。 每一次范式突破,就像解锁了一条陡峭的上升通道。 随后是一轮漫长而严酷的工程爬坡,把这套架构里的潜能彻底榨干。 直到它遭遇边际收益的瓶颈。 然后等待下一次底层创新的点火。 看懂了这台机器,就能看懂 Google 内部正在发生的急迫反扑。 外部开发者一直在焦急地催问:Gemini 3.5 Pro 到底在哪里? 为什么迟迟不发? DeepMind 摆在台面上的动作,是一场极高频率的闪电战。 在 Google I/O 发布 3.5 之后,紧跟着拿出 3.6。 仅仅隔了三个星期,又直接甩出 3.7 Flash。 他们没有在庞大的慢模型上死磕。 改用响应极快的小尺寸模型,去高频试错。 在工具调用和工作流里,把工程细节一点点磨透。 而在需要数月周期的深水区, 代号 Gemini 4 的预训练集群正在昼夜运转。 这是 Google 历史上规模最大的一场预训练战役。 两手准备。 一手用快节奏的敏捷小模型,补齐智能体操控工具的现实手感。 一手用超大规模的预训练底座,等待下一条 S 曲线的临界爆发。 总有人在争论:AGI 到底有没有一个终极测试? Koray 的回答很干脆:全世界没有任何一张试卷,能让你考完之后盖章认证 AGI 已经降临。 二十年前学者们觉得无法逾越的高山,很多今天早就成了手机里随手运行的后台功能。 智能不是某一个瞬间突然跨过的门槛。 它是你在成千上万次真实任务中,一点一滴建立起来的信任。 当一个系统从只会滔滔不绝地预测下一个词,变成能够接管复杂的环境,在报错和崩溃中自己找到出路,信任才真正开始扎根。 承认落后,不代表出局。 这恰恰是一台习惯了啃硬骨头的工程机器,在看清了新地形之后,重新校准了自己的齿轮。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。