DEEPgeneratedpublished

820 万次真实用户的对话记录里,只有 24 次吐出了超过 30 个匹配原著的字

市场替代测试与对抗性提取机制

820 万次真实用户的对话记录里,只有 24 次吐出了超过 30 个匹配原著的字。 在原告作家提交法庭的 212 本书中,有 202 本在真实世界里一次都没有被复现过。 2026 年 9 月 4 日,微软向曼哈顿联邦地区法院提交了一份简易判决申请。 这份长达几十页的法律文件里,最硬的武器是一组真实的专家审计数据。 就在几个月前,全美顶尖的作家协会和新闻出版商还在法庭上展示厚厚的截屏证据,指控 AI 正在肆无忌惮地逐字抄袭他们的作品。 为什么到了数百万真实用户的日常记录里,这些所谓的侵权铁证几乎完全蒸发了? 是谁在法庭上制造了这场版权毁灭的幻觉? 把两边的证据链拆开来看,会发现一场法学与计算机科学的精密博弈。 这台机器的核心,叫市场替代测试。 原告在起诉书里展示的那些逐字复制片段,是怎么来的? 那些证据没有造假,但它们来自实验室的极端压力测试。 原告雇佣的测试人员,给模型喂进小说特定章节的前几句话,反复用精心设计的提示词施加诱导,把随机性参数调到最低,强行逼迫神经网络吐出训练记忆。 在计算机安全领域,这叫对抗性提取。 只要算力和提示词足够刁钻,任何深度学习模型都可能被诱导榨出极少量的原始记忆残片。 但美国版权法第 107 条的裁判逻辑,从来不建立在实验室的极端攻防上。 法官必须衡量的最关键支柱,是合理使用原则中的第四要素:该项使用是否对原作品的潜在市场造成了实质性的替代。 这根支柱在司法史上的标杆,是 2015 年第二巡回上诉法院裁决的《作家协会诉谷歌案》。 当年谷歌把两千万本有版权的图书全部扫描进数据库。 皮埃尔·莱瓦尔法官最终判定谷歌构成合理使用。 核心逻辑只有一条:谷歌向公众展示的只是经过检索的片段,读者不可能靠拼凑这些片段来替代购买一本完整的图书。 它提供的是关于图书的高维索引,具有高度的转换性,不构成图书本身的替代品。 微软把 820 万条真实交互数据推到斯坦因法官案头,打的正是同一记重拳。 真实世界里的几百万用户,在用 AI 写代码、改邮件、分析报表、提炼要点。 没有任何一个正常读者,会跑到生成式工具里靠每次吐出几十个字去读一本小说。 在 820 万次真实运转中,复现 30 个字以上片段的概率只有三万四千分之一。 当一项技术在真实市场里充当替代品的概率无限趋近于零,所谓摧毁出版市场的指控就失去了法律支点。 版权诉讼最容易被情绪带偏的地方,在于混淆了能力极限与市场行为。 实验室里的对抗诱导,展示的是神经网络在极端攻击下的记忆回响。 法庭衡量文明与创新的尺度,永远是这项技术在真实世界里究竟在给谁提供什么价值。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情