{"id":"mb-20260904-1aa0fb","kind":"deep","title":"820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字","summary":"820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字","body":"820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字。\n在原告作家提交法庭的 212 本书中，有 202 本在真实世界里一次都没有被复现过。\n2026 年 9 月 4 日，微软向曼哈顿联邦地区法院提交了一份简易判决申请。\n这份长达几十页的法律文件里，最硬的武器是一组真实的专家审计数据。\n就在几个月前，全美顶尖的作家协会和新闻出版商还在法庭上展示厚厚的截屏证据，指控 AI 正在肆无忌惮地逐字抄袭他们的作品。\n为什么到了数百万真实用户的日常记录里，这些所谓的侵权铁证几乎完全蒸发了？\n是谁在法庭上制造了这场版权毁灭的幻觉？\n把两边的证据链拆开来看，会发现一场法学与计算机科学的精密博弈。\n这台机器的核心，叫市场替代测试。\n原告在起诉书里展示的那些逐字复制片段，是怎么来的？\n那些证据没有造假，但它们来自实验室的极端压力测试。\n原告雇佣的测试人员，给模型喂进小说特定章节的前几句话，反复用精心设计的提示词施加诱导，把随机性参数调到最低，强行逼迫神经网络吐出训练记忆。\n在计算机安全领域，这叫对抗性提取。\n只要算力和提示词足够刁钻，任何深度学习模型都可能被诱导榨出极少量的原始记忆残片。\n但美国版权法第 107 条的裁判逻辑，从来不建立在实验室的极端攻防上。\n法官必须衡量的最关键支柱，是合理使用原则中的第四要素：该项使用是否对原作品的潜在市场造成了实质性的替代。\n这根支柱在司法史上的标杆，是 2015 年第二巡回上诉法院裁决的《作家协会诉谷歌案》。\n当年谷歌把两千万本有版权的图书全部扫描进数据库。\n皮埃尔·莱瓦尔法官最终判定谷歌构成合理使用。\n核心逻辑只有一条：谷歌向公众展示的只是经过检索的片段，读者不可能靠拼凑这些片段来替代购买一本完整的图书。\n它提供的是关于图书的高维索引，具有高度的转换性，不构成图书本身的替代品。\n微软把 820 万条真实交互数据推到斯坦因法官案头，打的正是同一记重拳。\n真实世界里的几百万用户，在用 AI 写代码、改邮件、分析报表、提炼要点。\n没有任何一个正常读者，会跑到生成式工具里靠每次吐出几十个字去读一本小说。\n在 820 万次真实运转中，复现 30 个字以上片段的概率只有三万四千分之一。\n当一项技术在真实市场里充当替代品的概率无限趋近于零，所谓摧毁出版市场的指控就失去了法律支点。\n版权诉讼最容易被情绪带偏的地方，在于混淆了能力极限与市场行为。\n实验室里的对抗诱导，展示的是神经网络在极端攻击下的记忆回响。\n法庭衡量文明与创新的尺度，永远是这项技术在真实世界里究竟在给谁提供什么价值。","topic":"820 万次真实用户的对话记录里，只有 24 次吐出了超过 30 个匹配原著的字","frame_type":["市场替代测试与对抗性提取","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-04 20:42:03","legal_anchor_count":0,"transcript_citation_count":0}