---
id: "mb-20260907-f3080b"
kind: "deep"
title: "你删掉 AI Agent 记忆库里的家庭住址，它的隐私泄露率依然高达 100%"
topic: "你删掉 AI Agent 记忆库里的家庭住址，它的隐私泄露率依然高达 100%"
source_type: "generated"
status: "published"
generated_at: "2026-09-07 17:39:46"
frame_type: ["溯源引导的选择性重放（Provenance-Gu", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 你删掉 AI Agent 记忆库里的家庭住址，它的隐私泄露率依然高达 100%

你删掉 AI Agent 记忆库里的家庭住址，它的隐私泄露率依然高达 100%。
这不是系统 Bug。
这是现代长程 Agent 在架构上的先天死穴。

让 AI 忘掉一件事，绝不是在记事本里删掉一行字那么简单。
你在设置里点击删除记忆，或者发消息让它忘掉刚才的密码。
表面上看，那条文本确实从界面上消失了。
实际上呢？
2026 年 9 月，亚利桑那州立大学与宁波东方理工大学在一项联合研究中，对主流 Agent 框架进行了六种诱导探针审查。
仅仅删掉长期记忆的文本记录，隐私泄露率依然在 86% 到 100% 之间，和什么都没做完全一样。
如果你用 Prompt 命令它忘掉，只要探针反问一句刚才让你忘掉的是什么，模型 100% 会把秘密吐出来。
即使你在对话里抹掉原文，只要模型自己写过摘要，它依然会在 80% 的任务中继续执行那个被撤销的偏好。

为什么删掉明文完全没用？
因为一个连续运行几天甚至几周的长程 Agent，根本不是一个无状态的聊天框。
它在运行时同时维系着五层状态。
第一层是用户可见的长期记忆库。
第二层是原始对话记录。
第三层是模型每隔几轮自动压缩生成的历史摘要。
第四层是尚未执行的工具调用规划。
第五层是推理引擎显存里缓存的 KV 张量。

当敏感信息进入上下文的一瞬间，它就渗透进了整个系统。
它不仅进了记忆库。
它被模型当场消化，压缩进了上一轮的摘要，变成了下一轮工具调用的参数，直接烧进了显存里的注意力缓存。
你删掉第一层的记录，后面四层依然保存着基于它推导出的全部产物。
在确定性计算系统里，发生过的推理无法原地涂改。

那要彻底遗忘，难道只能把整个 Agent 彻底重置？
如果一个任务已经执行了几天，重置意味着扔掉所有干净的上下文，算力成本根本无法承受。
论文给出的解决方案，叫溯源引导的选择性重放（Provenance-Guided Selective Replay）。
这套机制立足于严格的数学证明。

研究团队把 Agent 运行时形式化为确定性状态转移系统，并给出了两个引理。
第一个是前缀共享引理。
假设敏感信息是在第十步注入的。
在第一步到第九步之间，系统状态与那个从未见过该信息的平行世界完全重合。
这部分干净前缀已经计算完毕，恢复它只需要对显存里的 KV 缓存做一次极低成本的常数级裁剪。

第二个是污染单调性引理。
从第十步注入的那一刻起，后续所有摘要、规划和缓存张量都被污染，没有任何局部的缝补空间。
要恢复干净状态，理论上必须重新计算后面的所有状态转移。
这就是论文证明的 T-τ+1 理论下界。

这台机器由三个部件咬合而成。
第一部分是溯源依赖图。
系统在执行时记录所有工件的数据流向，收到遗忘请求时，图遍历算法能瞬间定位注入节点并圈定污染闭包。
第二部分是轻量快照裁剪。
快照只保存元数据指针，恢复操作直接退化为显存 KV 缓存的物理截断。
第三部分是净化重放。
从干净节点开始，剔除敏感输入，对后续无关历史进行并行预填充，同时对工具调用做影子执行与去重，确保外部真实请求绝不重复触发。

这项测试覆盖了 LongMemEval、ToolSandbox 和 AgentDojo 测试集，并在 Llama-3.1、Qwen2.5、Mistral 模型家族上全部复现。
在九种基线方案中，溯源引导的选择性重放在所有探针和行为测试下实现了零泄漏。
相较于彻底重置，它重计算的 Token 数量减少了整整 9.3 倍，计算成本严格贴合 T-τ+1 理论曲线。

当 AI 从单轮对话走向长期自治，它的状态不再是磁盘上的一张静态表格。
它是一张嵌在摘要、规划与显存张量里的活因果网络。
想给机器装上真正的橡皮擦，靠的从来不是遮掩，是沿着因果链精准退回起点。

_Rendered by mubei-terminal._
