AI公司收购二手图书,为训练模型找高质量人类文学遗产数据
公司在推动内存和存储资源日益紧张之后,如今似乎又将目光投向了人类的文学遗产。公司利用纸质图书训练模型已有先例。此外,这些采购行为几乎没有任何主题、类型或作者偏好,无论是小说、教材还是专业书籍都在采购范围内。Services,该公司提供非破坏性扫描和破坏性扫描两种图书数字化服务。
二手书市场突然火爆背后有猫腻
自从今年4月开始, 二手书市场呈现除了不一样的波动迹象。有一位不想透露真正姓名的职业书商讲出这样的情况, 之前那些日子平均一周只能卖出去大概20本书, 然而现在每周的销售量一下子猛地飙升到数百本, 这可是平常销量的五倍那般多。仔细观察可以得知的是, 在AbeBooks、ThriftBooks与其他等等的平台之上, 其他一些书商也反映出现了差不多类似的大宗批量采购的现象。而且,这般突然之间出现的销量急剧增加情况, 并不是普通的读者所造成的行为, 其实是源自某些很是神秘的买家开展了大规模扫货行动带来的结果。
买家不挑书也不看价格只认ISBN
这些采购行为展现出好几个反常的特征, 买家差不多仅仅购买带有国际标准书号也就是ISBN的图书, 而那个13位数字的编码可是全球图书独一无二的标识, 他们不存在任何主题、类型或者作者方面的偏好, 不管是小说、教材还是专业书籍都全部纳入到采购的范围之中, 更让人感到意外的是, 买家对价格是丝毫不在意的, 就算有部分图书明显要高于市场的价格, 也会直接去买下, 这样的扫货方式, 显然不是普通读者的消费习惯。
AI公司为何盯上纸质图书
首先, AI发展是离不开海量数据的, 然而这里面数据质量是极关重要的。随后, 近几年来, 那上网所看到的互联网上可都是充斥着好多大量由AI生成的质量很低的内容, 这就导致数据环境被污染了, 造成对降低AI学习效果也有影响了。所以, 那些处于领先地位的AI公司就开始重新去寻找人类原创的内容了, 特别是在2022年之前出版的纸质书籍。这些书籍可是还没有受到AI生成内容的污染的, 简直就是高质量训练数据的宝库。最后, 据调查媒体404 Media报道, 相关订单规模存在差异, 从一次采购1000本到一次采购100万本都是不等情况的。
已有先例:买书训练AI再销毁
AI公司借助纸质图书来训练模型, 这不是头一遭。身为卷入版权诉讼的主要AI公司当中的一个, Meta曾拿出数百万美元去购置大量纸质图书, 以此来提取内容训练AI模型, 之后又把这些图书给销毁掉。法院虽说判定将正版图书用于AI训练属于“合理使用”, 然而Meta因为长期保存一个含有700万本盗版图书的数据库, 被判定要赔偿高达15亿美元。类似的争议在谷歌那里也出现了, 近期一个出版商联盟已对它发起诉讼。
破坏性扫描导致数百万本书被拆毁
在Meta进行版权诉讼的进程当中, 有一位曾参与Google Books这个项目的人, 名叫汤姆·哈维, 他证实了这样一件事, 那就是Meta聘请了好多家专门从事文档扫描工作的公司, 目的是对纸质图书开展数字化转变处理。其中有一家和Meta合作的公司, 叫做Crown Records Management, 它提供了两种服务, 一种服务是不具有破坏性的扫描, 另一种服务是具有破坏性的扫描。具有非破坏性的扫描运用仰拍扫描仪之类的设备, 不会去将图书拆开;然而具有破坏性的扫描却是直接把书籍给拆开, 把每一页都送进高速工业扫描仪当中。AI公司普遍选择破坏性扫描这种方式, 是因为它效率更高, 成本更低, 结果致使数百万本纸质图书被拆毁。
知识宝库变私有库引发伦理争议
存在这样一个情况, 纸质图书在AI看来是如同巨大知识宝库一般的存在, 然而, 这样的一种做法却引发了越来越多的伦理争议。有批评者指出, 当前还不清楚AI公司在进行数字化的进程当中, 会不会去区分普通图书与珍贵图书、绝版图书。要是这些稀有书籍出现被拆毁的状况, 那么它们就有可能会永久地退出流通领域。更为严重的更大问题是, 扫描之后的内容最终进入了AI公司的私有数据库, 仅仅被用于AI的训练, 并且普通公众是没有办法对其进行访问的。这也就意味着, 人们或许能够得到更加智能的AI版本, 但是付出的代价却是人类积累起来的大量的知识资源不再能够公开进行获取了。
你认为, 那些为了对模型进行训练, 从而大规模展开收购行为, 并且将纸质图书实施销毁的AI公司, 这样的做法是不是显得合乎情理呢? 非常欢迎你在评论区域中分享出自身内心的看法, 去点赞以及进行转发等操作, 以此使得更多的人能够参与到讨论这个阶段上去。