据美国科技媒体404 Media爆料,为了训练生成式人工智能,一些AI公司正在大规模地采购二手图书,并对其进行“破坏性扫描”。一些存世量极少的珍贵图书在高速扫描过程中被切掉书脊和拆散,扫描后的纸张甚至会被撕碎或制成纸浆。
电影《华氏451》剧照。
编译|李永博
美国科技媒体404 Media近日爆料,他们追踪了一本“怀疑会被AI公司买去作为训练数据”的珍稀图书,并一路追查它在美国各地的流转过程。调查显示这本珍贵图书经过多次转运,最后到达了位于美国拉斯维加斯的亚马逊公司仓库。在仓库工作的亚马逊员工表示,他们的工作就是接收大量的印刷图书。这些书会被送进高速扫描机器,机器会先切掉书脊扫描,在扫描结束后将原书撕碎或打成纸浆。在这个过程中,一本实体图书也就被彻底销毁了。
而据英国《每日电讯报》的报道,一位荷兰古籍书商表示曾收到一家名为2077AI的公司员工的邮件,对方提供了一份约3000种二手图书的清单,并表示计划进行大规模采购。受访书商表示他最初以为是诈骗,因为在珍贵图书交易中,人们很少会一次购买超过一本书,“所以如果有人过来告诉你,‘我想买你这里几百本书’,这实在太奇怪了。”
事件曝光引发了大量的网络舆论,有评论就指出:“那些经历过战争、火灾和数百年翻阅仍保存下来的书,如今却被撕碎,只为了让AI学会写一封更好的营销邮件。”甚至连科技公司自己都亲自下场表态,埃隆·马斯克在该网友评论下方回复:“我已经要求SpaceX的AI团队把任何珍稀图书保存在图书馆里,并采用传统方式扫描,而不是简单地切掉书脊后进行扫描。”
有专业人士指出,如今的科技公司对这些过去出版的图书拥有极高的需求。随着互联网中AI生成的内容越来越多,AI模型开发者正在面临所谓的“数据墙”,AI训练仍然需要更多由人类创作的原生内容。而据404 Media报道,如果书籍在2022年以前出版,这些文本通常不会包含AI生成内容,这就可以避免AI模型训练过程中因反复使用AI生成文本而产生的“模型坍缩”问题。
那么,科技公司为什么要对二手图书进行“破坏性扫描”呢?
《每日电讯报》指出,除了提高扫描效率以外,一些科技公司也是为了规避法律风险。美国加州联邦法院此前的一项裁定表示,通过数字扫描获取图书内容并随后销毁实体书,并不构成版权侵权,因为数字版本“替代”了实体版本,这一行为被视为转换而非复制。
这项裁决可能改变了科技公司获取训练数据的成本计算。对科技公司来说,与出版社逐一协商进行授权相比,购买二手书或无人需要的库存可能更有经济性。《每日电讯报》援引科技公司Anthropic的一份内部文件称,该公司曾定下“获取全世界所有的书”的目标。该公司在2024年聘用了曾负责Google Books图书扫描项目的前职员来负责推动这个项目,并要求该项目以尽可能少的“法律、实践和商业上的烦琐程序”来获取旧书。
参考资料:
上一篇:暴涨629.44%,宇树IPO了