其它·via @mubei
模型没变。 只调了两个开关,成绩直接飙升到三倍。 GPT-5.6 Sol 已经能去解数学领域的开放难题了。 但在 ARC…
模型没变。 只调了两个开关,成绩直接飙升到三倍。
GPT-5.6 Sol 已经能去解数学领域的开放难题了。 但在 ARC-AGI-3 这个二维解谜游戏的基准测试里,它却表现得很吃力。
能解数学难题,玩不转2D解谜? 调查结果出来了,问题出在测试框架(harness)上。 这个框架的机制,根本没让模型记下它刚学到的内容。
这要怎么解? 团队没有重训模型,仅仅启用了两个 API 设置。 分数当场涨了三倍。