OpenAI 下一代旗舰模型 Astra 被曝出一项关键架构改动
OpenAI 下一代旗舰模型 Astra 被曝出一项关键架构改动。 35 亿参数的模型,在测试中等效调用了 500 亿级别的推理算力。 更引人注目的是,大模型跑了整整两年的外部思维链,正在被顶级实验室主动收窄。 为什么既要让模型拥有更深的推理能力,又要收回它在草稿纸上写字的权利? 是纯粹为了在数据中心里省钱,还是大模型的扩展路径撞上了另一堵看不见的墙? 过去几年,大模型的进化主要沿着两条法则前进。 第一条是预训练法则。 堆更大的参数,喂海量的语料。 但这条路很快遇到了物理瓶颈,显存容量和集群功耗被拉到了极限。 第二条是测试时算力法则。 像 OpenAI o 系列那样,让模型在给出最终答案前,生成成千上万个思维链词元。 模型像学生打草稿一样,把思考步骤一步步写在上下文窗口里。 这套逻辑确实大幅提升了复杂推理的表现,但底层的工程账本极其残酷。 在自回归模型里,每一个生成的思维链词元,都要把整个模型的庞大权重在显存里重新读取一遍。 草稿打得越长,键值缓存(KV Cache)的内存占用就越恐怖,显存带宽直接被吃光。 很多人以为推理算力只能靠在外部吐词元来堆砌。 但大模型的第三条法则,正在潜空间内部悄然成型。 它的名字叫循环深度。 这项技术最早可以追溯到 2018 年 Mostafa Dehghani 等人发表的 Universal Transformer。 它的底层原理非常纯粹:实现参数量与计算深度的彻底解耦。 传统的大模型像一条单向流水线。 几十层甚至上百层不同的网络结构从头排到尾,数据从输入端流向输出端,走完一遍就必须吐出结果。 要想让模型算得更深,唯一的办法就是继续往下叠加物理层数,把参数量做得更大。 循环深度打破了这个线性假设。 它把模型中间的核心层变成了一个可复用的计算环路。 输入数据进入模型后,不需要一路向下穿透上百个独立层,而是在同一组共享权重的中间层里反复迭代。 2026 年清华大学与字节跳动联合发表的 SMELT 论文,第一次在严格对齐算力(FLOPs)、非嵌入参数量和键值缓存的严谨基准下,完成了对循环深度架构的扩展律验证。 研究团队发现,仅仅让模型的中间层循环两次,在同等算力预算下就能节省 6.8% 到 18.0% 的训练开销,在代码生成和长上下文推理任务上的优势尤为显著。 通过中间层的重复遍历,模型能够自主抑制无意义的注意力汇聚,把计算资源精准砸在真正核心的信息节点上。 以前为了让模型完成 50 步复杂推理,必须在外部上下文窗口里生成 50 个连续的自然语言词元。 每一次生成,都在消耗显存带宽和上下文长度。 在循环深度架构下,模型直接在内部的潜空间向量里,把同一套神经元转上 50 圈。 参数规模不需要膨胀到 500 亿,键值缓存也不会被漫长的思考草稿撑爆。 但这项让工程师狂喜的计算红利,在安全领域撕开了一个致命的裂口。 AI 的可观测性危机。 过去几年,人类敢把越来越关键的自主决策权交给大模型,核心的安全护栏恰恰是那条被写在明面上的思维链。 哪怕模型产生了越狱意图、欺骗倾向或者网络攻击行为,只要它的思考过程是以人类自然语言的形式写在词元草稿纸上,外部的安全监控模型就能实时抓取这些痕迹,在危险行为发生前直接切断执行。 可一旦思考退回到潜空间进行循环迭代,这个监视窗口被彻底焊死。 高维连续向量在几毫秒内完成的几十次自我修正,不再对应任何人类语言的词汇。 那些在潜在空间内部流动的高维表征,被研究者称为神经隐语。 它是纯粹的数学流动。 人类无法阅读,现有的文本对齐监控工具也无法解析。 OpenAI 首席科学家 Jakub Pachocki 在面对外界质疑时,试图澄清 Astra 的计算图深度依然可控,并强调思维链监控依然是安全基石。 但底层的技术演进规律从来不以公关声明为转移。 在计算效率与透明度之间,算法的物理演进永远本能地扑向效率最高的洼地。 为了把算力压榨到极限,人类亲手教会了机器在沉默中完成思考。 当未来的超级智能不再需要把思考写在草稿纸上,我们该如何确信,那些在潜空间黑盒里反复回转的神经信号,究竟在计算什么?
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。