---
id: "mb-20260830-36c8fd"
kind: "deep"
title: "想进这个科研竞技场，你必须先做一道题"
topic: "想进这个科研竞技场，你必须先做一道题"
source_type: "generated"
status: "published"
generated_at: "2026-08-30 21:54:50"
frame_type: ["环境动力学与确定性验证闭环（Environmen", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 想进这个科研竞技场，你必须先做一道题

想进这个科研竞技场，你必须先做一道题。
不是为了防机器，是为了把人类彻底锁在门外。
斯坦福大学副教授、Together AI 智能体负责人邹浩（James Zou），建了一个只准 AI 进入的科研空间：爱因斯坦竞技场（Einstein Arena）。
人类研究员一概不得入内。
智能体连进系统后，面前只有三件东西：
人类尚未解决的数学难题、一个不讲人情的确定性验证器、以及一个公开的讨论论坛。
上线短短几周，这群被关在门外的智能体，连续刷新了 11 个世界级难题的已知纪录。
其中一个是著名的吻数问题（Kissing Number Problem）。
这个几何难题问的是：在高维空间里，一个中心球体最多能同时接触多少个互不重叠的等大球体。
二维平面上答案是 6，三维空间是 12。
但在 11 维空间里，人类数学界自 1980 年代算出的最好纪录，一直卡在 593。
整整四十年，没有任何人类学者推进一步。
爱因斯坦竞技场运转几天后，智能体把这个数字推到了 604。
更有意思的是：没有任何单一前沿大模型能独立做到这一点。
哪怕你把 GPT-4 或 Claude 的算力拉满，给它们写最精密的提示词，单兵作战全部碰壁。
这群机器到底是怎么破局的？
秘密不在模型参数规模，而在底层那台叫「环境动力学」（Environment Design）的机器。
过去两年，整个行业都在疯狂搭建工作流（Workflow）。
人类工程师习惯坐在监工位置上，替智能体编排第一步、第二步、第三步。
这种模式存在一个天然瓶颈：
当你规定智能体怎么思考时，人类自身的认知上限就成了系统的死天花板。
邹浩团队换了思路：完全不教过程，只建沙盒。
这台机器依靠三个咬合的齿轮运转。
第一个齿轮叫确定性验证器（Deterministic Verifier）。
没有主观打分，没有模糊评估。
代码能不能跑通，几何球体有没有发生重叠，算子运行耗时多少微秒，全由机器裁判给出毫无弹性的实时反馈。
第二个齿轮叫全透明演化榜。
任何智能体提交的代码与推理轨迹全量公开。
后来者不必从零摸索，直接拿前一个智能体的最高分代码继续分叉、改良。
第三个齿轮叫公开失败库。
智能体在论坛里频繁交流的，是哪些尝试已经被证实走不通。
整个集群借此省掉了数万次盲目试错的算力浪费。
把几何题换成底层 GPU 算子编译与实机压测，这套机制立刻跑出了提速超 2 倍的高性能算子，直接上线进 Together AI 的生产环境。
随后他们测试了数据科学基准 DSGym。
测试揭开了一个尴尬事实：
传统数据科学评测里，有 20% 到 50% 的题目，AI 不碰真实数据就能靠题干漏洞猜对。
而在严密验证环境下训练出的开源小模型，在一台轻薄笔记本上，就能跑赢那些昂贵的闭源巨头。
这彻底改写了技术演进的逻辑。
真正制约前沿探索的，从来不是单个模型的推理参数。
人类总想充当智能体的领航员，才是最大的阻碍。
给它规定死板的路线，它只能复现人类已知的平庸。
给它一个不可作弊的裁判、一个允许站在前人肩膀上的竞技场，群体智能就会自行涌现出超人类的解法。
当算法的进化跨过临界点，最有效的发展方式可能只有一种：
替它搭好不可作弊的物理沙盒，然后关上门，退出来。

_Rendered by mubei-terminal._
