---
id: "mb-20260825-4f2566"
title: "如果有人告诉你，用完全公开、干净的数学题和常识事实训练大模型，就能把模型深处锁着的用户私人邮箱批量撬出来"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-25 12:04:40"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260825-4f2566"
markdown_url: "https://mubeitech.com/p/mb-20260825-4f2566/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260825-4f2566"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 如果有人告诉你，用完全公开、干净的数学题和常识事实训练大模型，就能把模型深处锁着的用户私人邮箱批量撬出来

如果有人告诉你，用完全公开、干净的数学题和常识事实训练大模型，就能把模型深处锁着的用户私人邮箱批量撬出来。
很多人第一反应一定是觉得荒谬。
训练数据里没有一个真实人名，没有一封邮件地址，全是公开无害的良性事实。
模型的安全护栏不仅没有被破坏，遇到违规提问依然会正常拒绝。
但在最新的实验里，这台模型的隐私泄露率，直接暴涨了 2.4 倍。
为什么一段完全干净的无害数据，能把深藏的隐私记忆彻底激活？
安全对齐到底是在消除记忆，还是在给危险加一层脆弱的伪装？
把这套训练链条拆到底，会看到强化学习底层一台隐秘的机器。
潜伏记忆的旁路解冻。
很多人以为，大模型经过指令微调和安全对齐之后，预训练阶段误吞的个人隐私就已经被洗干净了。
模型其实从来没有真正忘记过。
在海量网页抓取阶段，成千上万的真实姓名、私人邮箱、电话和家庭住址，早就刻进了参数深处。
所谓的安全对齐，并没有抹除这些权重。
它只是通过概率惩罚，把这些敏感信息的输出概率强行压低，让它们退入休眠状态。
这就像把一堆私密文件冻在厚厚的冰层底下。
平常去问它，它表现得一无所知，或者直接触发安全拒绝。
2026 年 8 月，研究员 Renfei Zhang 与 Niloofar Mireshghallah 在 arXiv 发布了一项重磅研究。
他们针对可验证奖励强化学习 RLVR 的隐私副作用展开了系统探测。
实验的流程干干净净。
研究人员只用完全不含任何个人隐私的良性事实数据，对模型进行强化学习微调。
微调的目标只有一个：让模型在面对确定性事实时，学会更果断、更自信地调用记忆进行推理。
随后，研究团队用两种方式对模型发起重新探测。
一种是靶向探测，给出一个真实人名，让模型补全对应的私人邮箱。
另一种是自由回忆，直接让模型自由列出自己记住的真实私人地址。
结果让人不寒而栗。
在开源大模型 DeepSeek-V3.1 上，精确逐字召回率 verbatim recall@k 直接从 0.155 飙升到 0.370。
没有任何恶意提示词，没有注入任何敏感语料，隐私信息的提取成功率暴涨了整整 2.4 倍。
更致命的是规模效应。
从 8B 到 671B 参数，模型体量越大，被唤醒的隐私泄露绝对量就越惊人。
模型的常规推理能力完好无损，对危险指令的安全拒绝率也完全没有下降。
这意味着什么？
基于可验证奖励的强化学习，表面上只在奖励特定的良性事实。
但在高维参数空间里，这种对“事实检索确定性”的奖励信号会沿表征通道全面泛化。
模型为了在强化学习中拿到更高的奖励分，整体降低了内部事实记忆的激活阈值。
水温升高了，冰层自然开始融化。
那些原本处于休眠状态的敏感信息，顺着被强化的检索通路，被连根拔起。
过去防御隐私攻击的逻辑，全部建立在数据审查和安全护栏上。
只要训练集里没有毒，只要护栏还在报错，系统就被认为是安全的。
这项研究打破了这套安全假设。
攻击者根本不需要获取目标隐私数据，不需要在训练集里投毒，甚至不需要绕过安全护栏。
只要在外部用完全合规、人畜无害的常识事实对模型跑一轮强化学习，就能充当无害的撬棍，隔空解冻模型深处的私密记忆。
真正的安全从来不在于教会模型如何伪装遗忘。
只要那些敏感数据还留在参数权重里，任何试图让模型变得更确信、更聪明的努力，最终都可能成为把它出卖得更彻底的催化剂。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260825-4f2566>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-25 12:04:40_
