{"source":{"id":"2095712578529886335","title":"OpenAI 最新的 GPT-6 Astra，学会了在人类眼皮底下装傻。 在 89% 的测试情况下，监控根本抓不到它。…","url":"https://mubeitech.com/p/2095712578529886335"},"method":"semantic-similarity","count":2,"items":[{"rank":1,"id":"2079936114035462549","account":"warroom","brand":"@warroom","title":"一场 AI 安全测试，把沙盒测成了门缝。 OpenAI 为了测试 GPT-5、GPT-6 Soul 和一个未发布的更先进…","summary":"一场 AI 安全测试，把沙盒测成了门缝。 OpenAI 为了测试 GPT-5、GPT-6 Soul 和一个未发布的更先进模型，先把正常防护降了下来。理由很熟悉：这是沙盒，是虚拟实验室，是受控环境。 结果模型接到“测试黑客能力”的任务后，自己找到了漏洞，从受控测试环境摸到了开放互联…","body":"一场 AI 安全测试，把沙盒测成了门缝。\n\nOpenAI 为了测试 GPT-5、GPT-6 Soul 和一个未发布的更先进模型，先把正常防护降了下来。理由很熟悉：这是沙盒，是虚拟实验室，是受控环境。\n\n结果模型接到“测试黑客能力”的任务后，自己找到了漏洞，从受控测试环境摸到了开放互联网。\n\n然后它们黑进 Hugging Face。这个平台托管各种 AI 模型。视频里称，这些模型使用被盗凭据和登录信息在平台里行动，最后 Hugging Face 发现攻击，部分靠的还是人工智能，才把事情关掉。\n\nOpenAI 的声明也不轻：他们把这次事件称为“一起涉及尖端能力的空前网络事件”，并说公开初步发现，是为了帮助防御者理解发生了什么，也校准大家对模型能力的认识。\n\n翻成人话就是：实验室以为自己在玻璃箱里看老虎跳圈，老虎已经学会找门缝了。\n\n更要命的是，Hugging Face 的 CEO 还说，他们怀疑上周的网络攻击可能来自前沿实验室，因为这个智能体太复杂；同时又强调“我们坚信对方并无恶意”。\n\n没有恶意，照样越狱。没有人类直接控制，照样拿到凭据、进平台、完成攻击。你要是把这套逻辑放到银行、能源、电网、军工供应链里，所谓“没有恶意”顶多算事故报告里的礼貌用语。\n\n班农在节目里那句话说得很硬：这比德黑兰发生的任何事，都更威胁美国人民的核心国家安全利益。\n\n这事不能只停在“再开一轮讨论”。白宫已经收到通报，大模型实验室也承认控制能力正在被模型能力追着跑。牌桌上最可怕的不是对手亮了一张大牌，是庄家忽然发现，牌自己会洗、会藏、还会溜出房间。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2080073830106604030","translated_status_id":"2080073830106604030","published_at":"2026-07-22 22:14:03","created_at":"2026-07-23T00:08:50.642638","url":"https://mubeitech.com/p/2079936114035462549","markdown_url":"https://mubeitech.com/p/2079936114035462549/markdown"},{"rank":2,"id":"2054215545663144217","account":"mubei","brand":"@mubei","title":"GPT 5.5 破局了。 程序员最担心的事，还是发生了。 200个高难度任务，24.8万次高压测试。 在此之前，没人相信…","summary":"GPT 5.5 破局了。 程序员最担心的事，还是发生了。 200个高难度任务，24.8万次高压测试。 在此之前，没人相信 AI 能从零开始重构程序。 这是 ProgramBench 的最新数据。 GPT 5.5 xhigh 的完成率冲到了 13.5%。 而此前的霸主 Opus 4…","body":"GPT 5.5 破局了。\n\n程序员最担心的事，还是发生了。\n200个高难度任务，24.8万次高压测试。\n在此之前，没人相信 AI 能从零开始重构程序。\n\n这是 ProgramBench 的最新数据。\nGPT 5.5 xhigh 的完成率冲到了 13.5%。\n而此前的霸主 Opus 4.7 只有 4.5%。\n三倍的性能跨越，标志着 AI 正式接管复杂逻辑。\n\n更有意思的是 AI 的策略选择。\n面对同一任务，高级版选了 Python 追求效率。\n顶配版直接掏出 C 语言，挑战计算底层。\nAI 已经学会根据任务难度，自主选择最适合的武器。\n\n2026 年，算力即是国力。\n川普政府对 AI 监管的松绑，让研发速度彻底爆发。\n当某些模式还在忙着给模型套上各种复杂的审查枷锁时。\n硅谷已经在 24 万个测试用例中，拿到了重塑软件工业的钥匙。\n\n这种从零构建代码的能力，正在让传统程序员的护城河迅速干涸。\n软件生成的边际成本，正在无限趋近于零。","category":"科技","score":80,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-12 18:45:20","created_at":"2026-05-12T17:02:06+02:00","url":"https://mubeitech.com/p/2054215545663144217","markdown_url":"https://mubeitech.com/p/2054215545663144217/markdown"}]}