DEEPgeneratedpublished

一家估值数百亿的 AI 巨头,写得出复杂的长篇论文,却可能被几首流行歌词罚到破产

影子图书馆原罪与法定赔偿金杠杆机制

一家估值数百亿的 AI 巨头,写得出复杂的长篇论文,却可能被几首流行歌词罚到破产。 索赔金额不按实际损失慢慢核算,直接按每首歌最高 15 万美元顶格往上堆。 索尼音乐与华纳联合向加州北区联邦法院递交诉状,索赔总额直奔数十亿美元。 连同 Anthropic 首席执行官 Dario Amodei 和联合创始人 Benjamin Mann,个人全被列为被告。 为什么大模型能在文字和代码领域屡屡全身而退,一碰到音乐就会触发毁灭性的法律绞肉机? 是唱片公司太能打官司,还是大模型在底层架构里埋下了一个根本洗不掉的原罪? 顺着诉状把背后的版权法典拆开,会看到一台运转了三十年的猎杀机器。 影子图书馆原罪与法定赔偿金杠杆。 过去几年,AI 公司最大的法律护身符是合理使用原则。 2015 年 Authors Guild v. Google 案立下过一个标杆。 把图书数字化做成搜索索引,属于转换性使用,合法。 硅谷大模型公司顺理成章地以为,只要把海量数据吞进去提炼规律,就能靠学习的名义躲过版权追索。 但合理使用的前提,是原料获取必须干净。 2026 年 7 月获批的 Bartz v. Anthropic 案判决,在法律上切开了一道致命口子。 法官 Araceli Martínez-Olguín 明确裁定:训练本身或许可以主张学习。 但从 LibGen 和 PiLiMi 等盗版影子图书馆直接批量下载盗版文件,从第一秒起就是直接侵权。 Anthropic 为此付出了 15 亿美元的和解代价。 按每部作品赔偿约 3000 美元,并被强制销毁所有盗版源数据。 这次索尼和华纳的诉状,精准咬住了同一个死穴。 出版商指控 Anthropic 长期利用 BT 种子和未经授权的网络抓取,把成千上万首受版权保护的歌词拖进了训练集。 原料来源本身沾了盗版,整座大模型就吞下了毒树之果。 只要输入端被证实非法,合理使用的第一道防御瞬间坍塌。 真正的第二记重锤,砸在输出端。 流行歌词和普通长篇文本有着截然不同的物理属性。 一首歌词往往只有几百个词,结构凝练,在互联网数据集中被千万次高频重复。 极高的重复率让大模型极易产生严重的记忆化过拟合。 只要用户在提示词里输入歌名或前两句歌词,模型就会原封不动吐出完整的受保护文本。 这直接踩死了合理使用最核心的第四要素:对原作品潜在市场的实质性替代。 音乐出版商长年把歌词库授权给 Genius 或 LyricFind 赚取商业许可费。 当 Claude 能免费充当精准的点歌台和歌词库,原有的授权收费通道就被当场截流。 原料不干净,产出又直接抢生意,转换性使用的借口彻底失效。 这时候,等待 AI 巨头的就是美国版权法第 504(c) 条的数学核武。 普通民事侵权诉讼,原告必须千方百计证明自己亏了多少钱,或者被告非法赚了多少利润。 但 17 U.S.C. § 504(c) 给版权所有者提供了一柄无需证明具体损失的法槌。 只要陪审团认定存在故意侵权,法官可以直接对每件作品判处最高 15 万美元的法定赔偿。 这是一道让任何科技巨头都感到刺骨的乘法题。 索尼与华纳名下握着几十万首经典金曲。 哪怕只有两万首作品被判定侵权,两万乘以 15 万美元,总赔偿额就会立刻飙升到 30 亿美元。 二十多年前,唱片业就是用这套法定赔偿金杠杆,把红极一时的 Napster 和 LimeWire 告到连环破产。 唱片巨头提起这场诉讼,本意并不是要把 AI 公司告到关门。 几十亿美元的索赔与创始人的个人连带责任,是逼迫算力新贵坐到谈判桌前的终极筹码。 硅谷以为自己用神经网络重写了商业规则。 但在拥有百年版权积累和严密法典的出版帝国面前,再庞大的参数也绕不过最古老的通行法则。 只要你的智慧来自人类文明过去的积累,就必须为吃下的每一行字交出过路费。 算力扩张的终点,终究成了旧资产帝国的永久收税站。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情