其它·via @mubei

买下数百万本实体书,切掉书脊,扫描,然后把原件全部销毁。 这是AI时代“合法获取知识”的冷酷工业流程。 为了训练大模型C…

买下数百万本实体书,切掉书脊,扫描,然后把原件全部销毁。 这是AI时代“合法获取知识”的冷酷工业流程。

为了训练大模型Claude,Anthropic就是这么干的。

法庭文件披露了这条“吃书”流水线。 不是黑进图书馆去偷,也不是靠爬取盗版网站。 第一步,在市场上合法扫货,买下海量的二手书。 第二步,直接切掉所有书脊,把书变成散落的纸片。 第三步,送进高速机器,把每一页都扫描成数字副本。 最后一步,把物理原件彻底销毁。

他们用真金白银买断了书的物理所有权。 然后榨干知识,抛弃躯壳。

在这个流程里,书不再是用来读的。 它们是一批数据矿石,提取完内容,残渣就可以倒掉了。

导出 / EXPORT