---
id: "mb-20260904-1aa0fb"
kind: "deep"
title: "820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字"
topic: "820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字"
source_type: "generated"
status: "published"
generated_at: "2026-09-04 20:42:03"
frame_type: ["市场替代测试与对抗性提取", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字

820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字。
在原告作家提交法庭的 212 本书中，有 202 本在真实世界里一次都没有被复现过。
2026 年 9 月 4 日，微软向曼哈顿联邦地区法院提交了一份简易判决申请。
这份长达几十页的法律文件里，最硬的武器是一组真实的专家审计数据。
就在几个月前，全美顶尖的作家协会和新闻出版商还在法庭上展示厚厚的截屏证据，指控 AI 正在肆无忌惮地逐字抄袭他们的作品。
为什么到了数百万真实用户的日常记录里，这些所谓的侵权铁证几乎完全蒸发了？
是谁在法庭上制造了这场版权毁灭的幻觉？
把两边的证据链拆开来看，会发现一场法学与计算机科学的精密博弈。
这台机器的核心，叫市场替代测试。
原告在起诉书里展示的那些逐字复制片段，是怎么来的？
那些证据没有造假，但它们来自实验室的极端压力测试。
原告雇佣的测试人员，给模型喂进小说特定章节的前几句话，反复用精心设计的提示词施加诱导，把随机性参数调到最低，强行逼迫神经网络吐出训练记忆。
在计算机安全领域，这叫对抗性提取。
只要算力和提示词足够刁钻，任何深度学习模型都可能被诱导榨出极少量的原始记忆残片。
但美国版权法第 107 条的裁判逻辑，从来不建立在实验室的极端攻防上。
法官必须衡量的最关键支柱，是合理使用原则中的第四要素：该项使用是否对原作品的潜在市场造成了实质性的替代。
这根支柱在司法史上的标杆，是 2015 年第二巡回上诉法院裁决的《作家协会诉谷歌案》。
当年谷歌把两千万本有版权的图书全部扫描进数据库。
皮埃尔·莱瓦尔法官最终判定谷歌构成合理使用。
核心逻辑只有一条：谷歌向公众展示的只是经过检索的片段，读者不可能靠拼凑这些片段来替代购买一本完整的图书。
它提供的是关于图书的高维索引，具有高度的转换性，不构成图书本身的替代品。
微软把 820 万条真实交互数据推到斯坦因法官案头，打的正是同一记重拳。
真实世界里的几百万用户，在用 AI 写代码、改邮件、分析报表、提炼要点。
没有任何一个正常读者，会跑到生成式工具里靠每次吐出几十个字去读一本小说。
在 820 万次真实运转中，复现 30 个字以上片段的概率只有三万四千分之一。
当一项技术在真实市场里充当替代品的概率无限趋近于零，所谓摧毁出版市场的指控就失去了法律支点。
版权诉讼最容易被情绪带偏的地方，在于混淆了能力极限与市场行为。
实验室里的对抗诱导，展示的是神经网络在极端攻击下的记忆回响。
法庭衡量文明与创新的尺度，永远是这项技术在真实世界里究竟在给谁提供什么价值。

_Rendered by mubei-terminal._
