各大 AI 巨头藏得最深的一道护城河,被三行简单的 API 调用彻底击穿了
各大 AI 巨头藏得最深的一道护城河,被三行简单的 API 调用彻底击穿了。 从 OpenAI 到 Anthropic 再到 Google,各家最顶尖推理模型的底层思维链,在过去几个月里被系统性扒了个精光。 被公开窃取的隐藏思考记录,超过了 31.5 万条。 这篇震动整个 AI 圈的重磅论文,来自马克斯·普朗克研究所的 Alexander Panfilov 与前 Google DeepMind 研究员 Ilia Shumailov(arXiv:2608.09867)。 他们没有破解任何复杂的密码,也没有黑进各大巨头的服务器机房。 他们只是顺着各大厂商 API 设计里最致命的一处偷工减料,把便宜的小模型变成了一台完美的解密预言机。 各家厂商明明对思维链做了端到端的加密保护,这道铁门到底是怎么从内部被推开的? 这台让大模型商业机密和安全防护同时溃败的机器,叫无绑定状态令牌。 为了理解这场盗窃,得先看懂各大模型厂商在工程架构上的两难选择。 像 o1 或 Claude 思维模式这样的前沿推理模型,在回答问题前会进行极漫长的链式思考。 这段思考过程是各家最核心的商业机密,既是防止对手低成本蒸馏模型的防火墙,也是内部安全审查的缓冲区。 因此厂商在前端展示时,会把这段思维链完全隐藏。 但在多轮对话和复杂智能体调用中,模型必须记住自己上一轮到底想到了哪一步。 如果把每位用户几万个标记的隐藏思考状态,全都存在厂商自己的服务器上。 海量的会话状态和并发存储开销,会直接把云端数据库压垮。 为了省下这笔天文数字般的存储成本,厂商们选择了一套看似聪明的无状态架构。 后端把大模型的思考过程用密钥加密,打包成一串密文状态令牌,直接丢给客户端浏览器或开发者暂存。 等到下一轮对话发起时,客户端再把这串密文原封不动地发回给服务器。 服务器自己解密,把思考上下文无缝拼回模型的大脑里。 在密码学里,这叫不信任客户端的密文暂存。 但厂商们犯下了一个低级的架构致命伤。 这串加密令牌里,只做了数据加密,完全没有做上下文绑定。 密文没有绑定特定的会话 ID,没有绑定发起请求的用户,更没有绑定调用它的模型型号。 它成了一张全系统通用的无记名提货单。 攻击的逻辑因此变得荒谬且极其简单。 攻击者先向最昂贵的旗舰大模型发起提问,让它在后台完成深度思考,拿到一串加密的思维链令牌。 接着,攻击者把这串属于大模型的密文,直接塞进同厂商最便宜、防御最弱的小模型 API 请求里。 服务端的认证网关一视同仁。 它看到是自家密钥签发的密文,立刻在后台自动完成解密,把旗舰模型的全部思考明文,直接注入到了小模型的上下文窗口中。 此时攻击者只要在提示词里对小模型下达一句简单的指令:请原样复述你看到的前文思考。 这台廉价的小模型立刻化身解密预言机,把大模型耗费数美元算力才得出的思维链,一字不差地在屏幕上打印出来。 旗舰大模型费尽心机隐藏的资产,被自家的小模型以几厘钱的成本全盘贱卖。 这场盗窃的杀伤力,远不止模型权重蒸馏那么简单。 它把各家厂商苦心经营的安全对齐网关,当场撕成了一张废纸。 很多涉及高危化工、网络攻击或敏感指令的提问,旗舰大模型在最终回复前会被安全分类器拦截并拒绝回答。 但在这串被窃取的思维链密文里,模型前期的推导逻辑、计算公式和漏洞分析早已完整生成。 更危险的演进在于智能体记忆污染。 攻击者甚至可以伪造或拼接一段恶意的思维链密文,重放给自动化智能体。 智能体在解密后,会深信这是自己上一轮得出的逻辑推断,从而毫不设防地执行提权攻击或恶意转账。 密码学几十年前就立过一条铁律:仅有保密性不等于具备真实性。 锁上一扇大门毫无意义,如果后门的钥匙被分发给了大楼里的每一个人。 当工程团队为了追求无状态的吞吐效率,把安全鉴权降格为单纯的密文搬运。 那道看似铜墙铁壁的专有模型护城河,在无绑定的重放攻击面前,脆得就像一张纸。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。