{"id":"mb-20260825-8922d4","account":"mubei","brand":"","title":"欧洲的被遗忘权法案和创作者发起的版权诉讼，正在把大模型团队逼进死胡同","summary":"欧洲的被遗忘权法案和创作者发起的版权诉讼，正在把大模型团队逼进死胡同","body":"欧洲的被遗忘权法案和创作者发起的版权诉讼，正在把大模型团队逼进死胡同。\n法律条文写得干脆直接：作者只要撤回授权，AI 就必须把对应的数据从模型里彻底抹掉。\n学术界和工业界争相拿出了机器反学习算法。\n他们宣称可以在不重新耗费数百万美元重训模型的前提下，让神经网络精准遗忘某一段记忆。\n听起来很完美。\n但在真实的工程流水线里，这里横亘着一个极少被摆上台面的尴尬断层。\n所有的机器反学习算法，在启动时都必须依赖一个关键输入：一份被称为遗忘集合的数据清单。\n算法必须确切知道，具体要从模型权重里抠掉哪几万行数据。\n可当一位作者拿着撤回通知找上门时，\n工程师打开训练数据集，却根本查不出哪一行数据属于这位作者。\n这要怎么解？\n为什么把数据喂进模型的人，自己都找不到数据的出处？\n答案藏在现代预训练流水线的数据粉碎机里。\n一篇原始文章在喂进显卡之前，要经历复杂的清洗、去重、切分与分词。\n为了榨干 GPU 的吞吐算力，工程师会把成百上千篇不同作者的短文本，强行拼接到一条长达数千标记的序列窗口中。\n经过这轮流水线加工，作者身份、版权归属和原始文档的物理边界，被彻底磨成了粉末。\n等海量语料打包完成，谁也分不清哪几个标记来自哪一位作者。\n传统的数据版本管理工具，粒度只能停留在文件或整个数据集的粗糙层级。\n面对删除请求，模型训练方只能在两个糟糕的选项里二选一。\n第一种选项，是靠事后模糊猜测去抓取数据。\n这种盲猜不仅抓不准模型真正背诵的内容，还会误伤大批无辜神经元，让模型的语言能力出现严重滑坡。\n第二种选项，是把包含该作者文章的整个数据集分块彻底丢弃。\n这在工业界被称为灾难性过度删除。\n为了删掉某位作者写的一个自然段，系统不得不连带销毁上百倍的干净数据。\n模型为了忘掉一个人，被迫接受了一次大面积的局部脑切除。\n计算机学者 Haolin Xue 在数据溯源研究中，给出了破解这台困境机器的方案：OriginBlame。\n这套被称为 ob 的系统，把数据血统追踪推进到了记录与标记层级。\n它在数据清洗、分词到多文档拼接打包的整条链路里，为每个标记构建起独立的血统索引。\n作者的身份标签，会穿透流水线的层层变形，精准锚定在最终的训练数据流中。\n一旦收到撤销请求，系统不需要事后盲猜，通过确定性查询就能秒级导出精确的遗忘集合。\n在针对 219,555 篇维基百科页面的严格测评中，记录级血统追踪把过度删除的倍数，从过去的 101 倍直接压缩到了 1.3 倍。\n多余销毁的数据被砍掉了 99%。\n在 1.7B 参数的模型实测中，基于精准血统生成的遗忘集合，让机器反学习的有效性比同体量基线提升了 42%。\n成员推理测试证实，算法精准剔除了模型真正死记硬背的特定内容，同时将模型通用能力的次生损伤降到了最低。\n更关键的是工程代价。\n这套细粒度溯源系统接入主流的 HuggingFace 流水线时，只增加了 1.3% 到 4.0% 的吞吐开销。\n接入大规模分布式数据清洗工具 Datatrove 时，开销也仅在 2.1% 到 19.0% 之间。\n大模型合规与安全的真正分水岭，从来不在于纸面上的伦理口号或精巧的反学习数学公式。\n在于工程流水线有没有能力在海量标记的泥沙俱下中，守住每一颗标记的源头账本。\n如果连喂进神经网络的零件是谁造的都说不清楚，\n再精妙的手术刀，落下去也只是一场蒙着眼睛的盲切。\n摸清每一颗标记的来龙去脉，智能的边界才有了真正可控的缰绳。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:39","created_at":"2026-08-25 12:04:39"}