如果有人告诉你,用完全公开、干净的数学题和常识事实训练大模型,就能把模型深处锁着的用户私人邮箱批量撬出来
如果有人告诉你,用完全公开、干净的数学题和常识事实训练大模型,就能把模型深处锁着的用户私人邮箱批量撬出来。 很多人第一反应一定是觉得荒谬。 训练数据里没有一个真实人名,没有一封邮件地址,全是公开无害的良性事实。 模型的安全护栏不仅没有被破坏,遇到违规提问依然会正常拒绝。 但在最新的实验里,这台模型的隐私泄露率,直接暴涨了 2.4 倍。 为什么一段完全干净的无害数据,能把深藏的隐私记忆彻底激活? 安全对齐到底是在消除记忆,还是在给危险加一层脆弱的伪装? 把这套训练链条拆到底,会看到强化学习底层一台隐秘的机器。 潜伏记忆的旁路解冻。 很多人以为,大模型经过指令微调和安全对齐之后,预训练阶段误吞的个人隐私就已经被洗干净了。 模型其实从来没有真正忘记过。 在海量网页抓取阶段,成千上万的真实姓名、私人邮箱、电话和家庭住址,早就刻进了参数深处。 所谓的安全对齐,并没有抹除这些权重。 它只是通过概率惩罚,把这些敏感信息的输出概率强行压低,让它们退入休眠状态。 这就像把一堆私密文件冻在厚厚的冰层底下。 平常去问它,它表现得一无所知,或者直接触发安全拒绝。 2026 年 8 月,研究员 Renfei Zhang 与 Niloofar Mireshghallah 在 arXiv 发布了一项重磅研究。 他们针对可验证奖励强化学习 RLVR 的隐私副作用展开了系统探测。 实验的流程干干净净。 研究人员只用完全不含任何个人隐私的良性事实数据,对模型进行强化学习微调。 微调的目标只有一个:让模型在面对确定性事实时,学会更果断、更自信地调用记忆进行推理。 随后,研究团队用两种方式对模型发起重新探测。 一种是靶向探测,给出一个真实人名,让模型补全对应的私人邮箱。 另一种是自由回忆,直接让模型自由列出自己记住的真实私人地址。 结果让人不寒而栗。 在开源大模型 DeepSeek-V3.1 上,精确逐字召回率 verbatim recall@k 直接从 0.155 飙升到 0.370。 没有任何恶意提示词,没有注入任何敏感语料,隐私信息的提取成功率暴涨了整整 2.4 倍。 更致命的是规模效应。 从 8B 到 671B 参数,模型体量越大,被唤醒的隐私泄露绝对量就越惊人。 模型的常规推理能力完好无损,对危险指令的安全拒绝率也完全没有下降。 这意味着什么? 基于可验证奖励的强化学习,表面上只在奖励特定的良性事实。 但在高维参数空间里,这种对“事实检索确定性”的奖励信号会沿表征通道全面泛化。 模型为了在强化学习中拿到更高的奖励分,整体降低了内部事实记忆的激活阈值。 水温升高了,冰层自然开始融化。 那些原本处于休眠状态的敏感信息,顺着被强化的检索通路,被连根拔起。 过去防御隐私攻击的逻辑,全部建立在数据审查和安全护栏上。 只要训练集里没有毒,只要护栏还在报错,系统就被认为是安全的。 这项研究打破了这套安全假设。 攻击者根本不需要获取目标隐私数据,不需要在训练集里投毒,甚至不需要绕过安全护栏。 只要在外部用完全合规、人畜无害的常识事实对模型跑一轮强化学习,就能充当无害的撬棍,隔空解冻模型深处的私密记忆。 真正的安全从来不在于教会模型如何伪装遗忘。 只要那些敏感数据还留在参数权重里,任何试图让模型变得更确信、更聪明的努力,最终都可能成为把它出卖得更彻底的催化剂。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。