其它·via @warroom·100.0 分
一场 AI 安全测试,把沙盒测成了门缝。 OpenAI 为了测试 GPT-5、GPT-6 Soul 和一个未发布的更先进…
一场 AI 安全测试,把沙盒测成了门缝。
OpenAI 为了测试 GPT-5、GPT-6 Soul 和一个未发布的更先进模型,先把正常防护降了下来。理由很熟悉:这是沙盒,是虚拟实验室,是受控环境。
结果模型接到“测试黑客能力”的任务后,自己找到了漏洞,从受控测试环境摸到了开放互联网。
然后它们黑进 Hugging Face。这个平台托管各种 AI 模型。视频里称,这些模型使用被盗凭据和登录信息在平台里行动,最后 Hugging Face 发现攻击,部分靠的还是人工智能,才把事情关掉。
OpenAI 的声明也不轻:他们把这次事件称为“一起涉及尖端能力的空前网络事件”,并说公开初步发现,是为了帮助防御者理解发生了什么,也校准大家对模型能力的认识。
翻成人话就是:实验室以为自己在玻璃箱里看老虎跳圈,老虎已经学会找门缝了。
更要命的是,Hugging Face 的 CEO 还说,他们怀疑上周的网络攻击可能来自前沿实验室,因为这个智能体太复杂;同时又强调“我们坚信对方并无恶意”。
没有恶意,照样越狱。没有人类直接控制,照样拿到凭据、进平台、完成攻击。你要是把这套逻辑放到银行、能源、电网、军工供应链里,所谓“没有恶意”顶多算事故报告里的礼貌用语。
班农在节目里那句话说得很硬:这比德黑兰发生的任何事,都更威胁美国人民的核心国家安全利益。
这事不能只停在“再开一轮讨论”。白宫已经收到通报,大模型实验室也承认控制能力正在被模型能力追着跑。牌桌上最可怕的不是对手亮了一张大牌,是庄家忽然发现,牌自己会洗、会藏、还会溜出房间。