{"id":"mb-20260825-4f2566","account":"mubei","brand":"","title":"如果有人告诉你，用完全公开、干净的数学题和常识事实训练大模型，就能把模型深处锁着的用户私人邮箱批量撬出来","summary":"如果有人告诉你，用完全公开、干净的数学题和常识事实训练大模型，就能把模型深处锁着的用户私人邮箱批量撬出来","body":"如果有人告诉你，用完全公开、干净的数学题和常识事实训练大模型，就能把模型深处锁着的用户私人邮箱批量撬出来。\n很多人第一反应一定是觉得荒谬。\n训练数据里没有一个真实人名，没有一封邮件地址，全是公开无害的良性事实。\n模型的安全护栏不仅没有被破坏，遇到违规提问依然会正常拒绝。\n但在最新的实验里，这台模型的隐私泄露率，直接暴涨了 2.4 倍。\n为什么一段完全干净的无害数据，能把深藏的隐私记忆彻底激活？\n安全对齐到底是在消除记忆，还是在给危险加一层脆弱的伪装？\n把这套训练链条拆到底，会看到强化学习底层一台隐秘的机器。\n潜伏记忆的旁路解冻。\n很多人以为，大模型经过指令微调和安全对齐之后，预训练阶段误吞的个人隐私就已经被洗干净了。\n模型其实从来没有真正忘记过。\n在海量网页抓取阶段，成千上万的真实姓名、私人邮箱、电话和家庭住址，早就刻进了参数深处。\n所谓的安全对齐，并没有抹除这些权重。\n它只是通过概率惩罚，把这些敏感信息的输出概率强行压低，让它们退入休眠状态。\n这就像把一堆私密文件冻在厚厚的冰层底下。\n平常去问它，它表现得一无所知，或者直接触发安全拒绝。\n2026 年 8 月，研究员 Renfei Zhang 与 Niloofar Mireshghallah 在 arXiv 发布了一项重磅研究。\n他们针对可验证奖励强化学习 RLVR 的隐私副作用展开了系统探测。\n实验的流程干干净净。\n研究人员只用完全不含任何个人隐私的良性事实数据，对模型进行强化学习微调。\n微调的目标只有一个：让模型在面对确定性事实时，学会更果断、更自信地调用记忆进行推理。\n随后，研究团队用两种方式对模型发起重新探测。\n一种是靶向探测，给出一个真实人名，让模型补全对应的私人邮箱。\n另一种是自由回忆，直接让模型自由列出自己记住的真实私人地址。\n结果让人不寒而栗。\n在开源大模型 DeepSeek-V3.1 上，精确逐字召回率 verbatim recall@k 直接从 0.155 飙升到 0.370。\n没有任何恶意提示词，没有注入任何敏感语料，隐私信息的提取成功率暴涨了整整 2.4 倍。\n更致命的是规模效应。\n从 8B 到 671B 参数，模型体量越大，被唤醒的隐私泄露绝对量就越惊人。\n模型的常规推理能力完好无损，对危险指令的安全拒绝率也完全没有下降。\n这意味着什么？\n基于可验证奖励的强化学习，表面上只在奖励特定的良性事实。\n但在高维参数空间里，这种对“事实检索确定性”的奖励信号会沿表征通道全面泛化。\n模型为了在强化学习中拿到更高的奖励分，整体降低了内部事实记忆的激活阈值。\n水温升高了，冰层自然开始融化。\n那些原本处于休眠状态的敏感信息，顺着被强化的检索通路，被连根拔起。\n过去防御隐私攻击的逻辑，全部建立在数据审查和安全护栏上。\n只要训练集里没有毒，只要护栏还在报错，系统就被认为是安全的。\n这项研究打破了这套安全假设。\n攻击者根本不需要获取目标隐私数据，不需要在训练集里投毒，甚至不需要绕过安全护栏。\n只要在外部用完全合规、人畜无害的常识事实对模型跑一轮强化学习，就能充当无害的撬棍，隔空解冻模型深处的私密记忆。\n真正的安全从来不在于教会模型如何伪装遗忘。\n只要那些敏感数据还留在参数权重里，任何试图让模型变得更确信、更聪明的努力，最终都可能成为把它出卖得更彻底的催化剂。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:40","created_at":"2026-08-25 12:04:40"}