其它·via @mubei

模型没变。 只调了两个开关,成绩直接飙升到三倍。 GPT-5.6 Sol 已经能去解数学领域的开放难题了。 但在 ARC…

模型没变。 只调了两个开关,成绩直接飙升到三倍。

GPT-5.6 Sol 已经能去解数学领域的开放难题了。 但在 ARC-AGI-3 这个二维解谜游戏的基准测试里,它却表现得很吃力。

能解数学难题,玩不转2D解谜? 调查结果出来了,问题出在测试框架(harness)上。 这个框架的机制,根本没让模型记下它刚学到的内容。

这要怎么解? 团队没有重训模型,仅仅启用了两个 API 设置。 分数当场涨了三倍。

翻译视频 / X

导出 / EXPORT