想进这个科研竞技场,你必须先做一道题
想进这个科研竞技场,你必须先做一道题。 不是为了防机器,是为了把人类彻底锁在门外。 斯坦福大学副教授、Together AI 智能体负责人邹浩(James Zou),建了一个只准 AI 进入的科研空间:爱因斯坦竞技场(Einstein Arena)。 人类研究员一概不得入内。 智能体连进系统后,面前只有三件东西: 人类尚未解决的数学难题、一个不讲人情的确定性验证器、以及一个公开的讨论论坛。 上线短短几周,这群被关在门外的智能体,连续刷新了 11 个世界级难题的已知纪录。 其中一个是著名的吻数问题(Kissing Number Problem)。 这个几何难题问的是:在高维空间里,一个中心球体最多能同时接触多少个互不重叠的等大球体。 二维平面上答案是 6,三维空间是 12。 但在 11 维空间里,人类数学界自 1980 年代算出的最好纪录,一直卡在 593。 整整四十年,没有任何人类学者推进一步。 爱因斯坦竞技场运转几天后,智能体把这个数字推到了 604。 更有意思的是:没有任何单一前沿大模型能独立做到这一点。 哪怕你把 GPT-4 或 Claude 的算力拉满,给它们写最精密的提示词,单兵作战全部碰壁。 这群机器到底是怎么破局的? 秘密不在模型参数规模,而在底层那台叫「环境动力学」(Environment Design)的机器。 过去两年,整个行业都在疯狂搭建工作流(Workflow)。 人类工程师习惯坐在监工位置上,替智能体编排第一步、第二步、第三步。 这种模式存在一个天然瓶颈: 当你规定智能体怎么思考时,人类自身的认知上限就成了系统的死天花板。 邹浩团队换了思路:完全不教过程,只建沙盒。 这台机器依靠三个咬合的齿轮运转。 第一个齿轮叫确定性验证器(Deterministic Verifier)。 没有主观打分,没有模糊评估。 代码能不能跑通,几何球体有没有发生重叠,算子运行耗时多少微秒,全由机器裁判给出毫无弹性的实时反馈。 第二个齿轮叫全透明演化榜。 任何智能体提交的代码与推理轨迹全量公开。 后来者不必从零摸索,直接拿前一个智能体的最高分代码继续分叉、改良。 第三个齿轮叫公开失败库。 智能体在论坛里频繁交流的,是哪些尝试已经被证实走不通。 整个集群借此省掉了数万次盲目试错的算力浪费。 把几何题换成底层 GPU 算子编译与实机压测,这套机制立刻跑出了提速超 2 倍的高性能算子,直接上线进 Together AI 的生产环境。 随后他们测试了数据科学基准 DSGym。 测试揭开了一个尴尬事实: 传统数据科学评测里,有 20% 到 50% 的题目,AI 不碰真实数据就能靠题干漏洞猜对。 而在严密验证环境下训练出的开源小模型,在一台轻薄笔记本上,就能跑赢那些昂贵的闭源巨头。 这彻底改写了技术演进的逻辑。 真正制约前沿探索的,从来不是单个模型的推理参数。 人类总想充当智能体的领航员,才是最大的阻碍。 给它规定死板的路线,它只能复现人类已知的平庸。 给它一个不可作弊的裁判、一个允许站在前人肩膀上的竞技场,群体智能就会自行涌现出超人类的解法。 当算法的进化跨过临界点,最有效的发展方式可能只有一种: 替它搭好不可作弊的物理沙盒,然后关上门,退出来。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。