{"id":"mb-20260830-36c8fd","kind":"deep","title":"想进这个科研竞技场，你必须先做一道题","summary":"想进这个科研竞技场，你必须先做一道题","body":"想进这个科研竞技场，你必须先做一道题。\n不是为了防机器，是为了把人类彻底锁在门外。\n斯坦福大学副教授、Together AI 智能体负责人邹浩（James Zou），建了一个只准 AI 进入的科研空间：爱因斯坦竞技场（Einstein Arena）。\n人类研究员一概不得入内。\n智能体连进系统后，面前只有三件东西：\n人类尚未解决的数学难题、一个不讲人情的确定性验证器、以及一个公开的讨论论坛。\n上线短短几周，这群被关在门外的智能体，连续刷新了 11 个世界级难题的已知纪录。\n其中一个是著名的吻数问题（Kissing Number Problem）。\n这个几何难题问的是：在高维空间里，一个中心球体最多能同时接触多少个互不重叠的等大球体。\n二维平面上答案是 6，三维空间是 12。\n但在 11 维空间里，人类数学界自 1980 年代算出的最好纪录，一直卡在 593。\n整整四十年，没有任何人类学者推进一步。\n爱因斯坦竞技场运转几天后，智能体把这个数字推到了 604。\n更有意思的是：没有任何单一前沿大模型能独立做到这一点。\n哪怕你把 GPT-4 或 Claude 的算力拉满，给它们写最精密的提示词，单兵作战全部碰壁。\n这群机器到底是怎么破局的？\n秘密不在模型参数规模，而在底层那台叫「环境动力学」（Environment Design）的机器。\n过去两年，整个行业都在疯狂搭建工作流（Workflow）。\n人类工程师习惯坐在监工位置上，替智能体编排第一步、第二步、第三步。\n这种模式存在一个天然瓶颈：\n当你规定智能体怎么思考时，人类自身的认知上限就成了系统的死天花板。\n邹浩团队换了思路：完全不教过程，只建沙盒。\n这台机器依靠三个咬合的齿轮运转。\n第一个齿轮叫确定性验证器（Deterministic Verifier）。\n没有主观打分，没有模糊评估。\n代码能不能跑通，几何球体有没有发生重叠，算子运行耗时多少微秒，全由机器裁判给出毫无弹性的实时反馈。\n第二个齿轮叫全透明演化榜。\n任何智能体提交的代码与推理轨迹全量公开。\n后来者不必从零摸索，直接拿前一个智能体的最高分代码继续分叉、改良。\n第三个齿轮叫公开失败库。\n智能体在论坛里频繁交流的，是哪些尝试已经被证实走不通。\n整个集群借此省掉了数万次盲目试错的算力浪费。\n把几何题换成底层 GPU 算子编译与实机压测，这套机制立刻跑出了提速超 2 倍的高性能算子，直接上线进 Together AI 的生产环境。\n随后他们测试了数据科学基准 DSGym。\n测试揭开了一个尴尬事实：\n传统数据科学评测里，有 20% 到 50% 的题目，AI 不碰真实数据就能靠题干漏洞猜对。\n而在严密验证环境下训练出的开源小模型，在一台轻薄笔记本上，就能跑赢那些昂贵的闭源巨头。\n这彻底改写了技术演进的逻辑。\n真正制约前沿探索的，从来不是单个模型的推理参数。\n人类总想充当智能体的领航员，才是最大的阻碍。\n给它规定死板的路线，它只能复现人类已知的平庸。\n给它一个不可作弊的裁判、一个允许站在前人肩膀上的竞技场，群体智能就会自行涌现出超人类的解法。\n当算法的进化跨过临界点，最有效的发展方式可能只有一种：\n替它搭好不可作弊的物理沙盒，然后关上门，退出来。","topic":"想进这个科研竞技场，你必须先做一道题","frame_type":["环境动力学与确定性验证闭环（Environmen","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 21:54:50","legal_anchor_count":0,"transcript_citation_count":0}