AI公司摧毁稀有且不可再生的实体书
人工智能公司正在批量购入稀有实体书,通过“破坏性扫描”切下书脊、扫描后碎纸销毁,以获取无AI污染的旧书训练数据。Anthropic的“Project Panama”等计划将这一做法工业化,而法院裁定其属于合理使用。书籍不可再生,文化损失令人担忧。
人工智能行业早已爬取开放网络,吞噬非法获取的图书馆资料,如今又把目光投向实体书。数百万册纸质书正被批量购入,经历一种业界称为“破坏性扫描”的流程:切下书脊、送入扫描仪,随后粉碎丢弃。
这项服务来自ISBNdb公司,其声称每单最多可获取“一百万种书目”,并特别推荐“较老、稀有的专业书籍”作为优质训练数据。原因在于2022年之前的图书“在结构上”不含AI生成内容。随着AI开始自我循环,旧世界的文本对大型语言模型的延续愈发珍贵。该公司的营销材料直言,“AI公司销毁两百万本书”并不是一个能引发同情的标题,因此它向买家提供保密协议,并建议将这一行为包装成“数字保存”。
Anthropic是主要推手。版权诉讼中公开的内部文件显示,公司2024年启动“Project Panama”,使用“液压动力切割机”切开数百万册图书的书脊,再以“高速、高品质、生产级扫描仪”数字化。其内部备忘录称这是“以颠覆方式扫描全世界所有书籍”的努力,并明确表示“不希望外界知道”。该公司还雇用了Google Books前负责人来获取“世界上所有的书”。
法律上,联邦法官在Anthropic版权案中裁定:只要制作数字副本后销毁实物原件,做到“一对一”转移,该过程就属于“变革性”合理使用。因为同一时刻只存在一份副本,不算传统盗版。这一判决让类似做法加速蔓延。欧美多国的中小书商发现,稀有和绝版书籍的批量订单突然激增。一位书商告诉404 Media,他的销量从每周约20本增加到数百本,其中不乏罕见的外语作品。他说这在经济上有利,也能清掉原本卖不出去的库存,但他不喜欢最终的用途,也不愿看到稀见图书被制成纸浆。
荷兰的古籍书商收到一家新加坡公司的邮件,对方声称正在开展“多语言书籍收集项目”,并附上了3000本英文书目的ISBN清单。类似的报告还来自瑞士、西班牙和德国。书商们判断这些书是用于AI训练的,因为没有收藏者或转售商会需要如此随机的冷门书。
Elon Musk声称已指示自己的AI团队“以艰难方式扫描稀有书籍,保留图书馆藏书”,而不是切掉书脊。但文章指出,考虑到其AI模型曾生成儿童性虐待材料,很难认真对待他的道德立场。纸质书一旦被粉碎就永远消失,数字化版本也仅是AI解读后的数据。除非法律或公众压力改变现状,“亚历山大图书馆将再次燃烧”。