---
id: "16529629"
title: "买下数百万本实体书，切掉书脊，扫描，然后把原件全部销毁。 这是AI时代“合法获取知识”的冷酷工业流程。 为了训练大模型C…"
account: "mubei"
brand: "@mubei"
category: "其它"
category_slug: "other"
score: null
percentile: null
published_at: "2026-07-28 23:16:00"
translated_x_url: null
reason_tags: []
canonical_url: "https://mubeitech.com/p/16529629"
markdown_url: "https://mubeitech.com/p/16529629/markdown"
json_url: "https://mubeitech.com/api/posts/16529629"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 买下数百万本实体书，切掉书脊，扫描，然后把原件全部销毁。 这是AI时代“合法获取知识”的冷酷工业流程。 为了训练大模型C…

买下数百万本实体书，切掉书脊，扫描，然后把原件全部销毁。
这是AI时代“合法获取知识”的冷酷工业流程。

为了训练大模型Claude，Anthropic就是这么干的。

法庭文件披露了这条“吃书”流水线。
不是黑进图书馆去偷，也不是靠爬取盗版网站。
第一步，在市场上合法扫货，买下海量的二手书。
第二步，直接切掉所有书脊，把书变成散落的纸片。
第三步，送进高速机器，把每一页都扫描成数字副本。
最后一步，把物理原件彻底销毁。

他们用真金白银买断了书的物理所有权。
然后榨干知识，抛弃躯壳。

在这个流程里，书不再是用来读的。
它们是一批数据矿石，提取完内容，残渣就可以倒掉了。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/16529629>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-07-28 23:16:00_
