其它·via @mubei
一个 AI 代理,接管电脑打了 5 小时 29 分 57 秒,最后通关了《杀戮尖塔2》的每日挑战。 结果不是口头说赢了。…
一个 AI 代理,接管电脑打了 5 小时 29 分 57 秒,最后通关了《杀戮尖塔2》的每日挑战。
结果不是口头说赢了。 分数 2600。 爬到 48 层。 杀了 3 个 Boss。 进阶 3。 排行榜上留下了成绩。
这件事有意思的地方,不是“AI 会玩游戏”。 会玩游戏的 AI,早就不新鲜了。 真正的门槛在于:它不是在一个干净的棋盘上算下一步,也不是在固定题库里选答案。
它是在一台真实电脑上,看屏幕,点鼠标,读卡牌,算路线,拿遗物,处理随机事件,打完一场又一场战斗。 中间任何一步判断错了,后面都要自己兜回来。 血量、金币、牌组、遗物、路线、敌人意图,全都在变。
这类任务最难的,不是某一秒有多聪明。 而是连续几个小时都别断片。
人类玩《杀戮尖塔》也是这样。 第一层拿错一张牌,第二层买错一个遗物,第三层少算一点伤害,最后可能死在 47 层。 它必须把很多小决策串成一条长链,而且每一步都能被最终结果清算。
所以这个 2600 分的意义,不是游戏分数本身。 而是一个很早期、但很清楚的信号:AI 代理正在从“回答问题”,往“接管一个封闭规则系统并完成长程任务”移动。
这比会聊天大得多。 聊天可以靠语言把失败糊过去。 游戏不会。 48 层就是 48 层,Boss 死了就是死了,排行榜上有没有成绩,一眼就能看见。
未来很多工作,最先被改写的也不是那些听起来最玄的工作。 而是这种规则明确、反馈清楚、步骤很长、错误会累积的任务。
因为机器一旦能稳定熬过 5 个小时的观察、决策、纠错,它离“干活”就不再只是会说话那么远了。
翻译视频 / X
相关 / RELATED
JSON- MAI模拟一个真人的行为,准确率能达到多少? 83%。 听起来不够完美? 拿这个数据跟真人比一下。 同一个实验里,让真人相…
- M假如大语言模型有人类的意识,那《帝国时代2》也有。 这来自一篇正经的微软学术论文。 研究员 Adrian de Wynt…
- M4到6个月后,没人再去死磕提示词了。 Anthropic内部,80%的工程师已经切到了自改进循环。 他们现在玩什么? 编…
- MAndrej Karpathy 认错了。 他说,2016 年在 OpenAI,他们犯了个代价高昂的错误:直接让 AI 智…
- W科技给AI一张信用卡和2.1万美元。 再丢给它一家真实咖啡店的绝对控制权。 两周后,它差点把店干破产了。 这是初创公司 An…
- M让AI帮你掐表计时? 别逗了。 有个老哥给GPT挖了个坑。 他对AI说:我要去跑一英里,你帮我计时。 “准备,跑!” 两…
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。