近期新闻报道表明,领先的人工智能实验室正在批量购买古籍、剩余书籍和外文书籍,通过高速破坏性扫描仪将其转化为大型语言模型的训练语料库。报道的理由很直接:旧书提供了密集、经过编辑的散文、多样的领域以及领域丰富的长篇结构,且现代许可限制较少。一些报道点名了知名实验室作为潜在买家;细节尚不完整,部分内容存在争议。不管怎样,信号很明确:前沿模型竞争正从机会主义的网络抓取转向受控的数据获取,形成了人工智能数据的初步实体物流层,并为部署或集成此类模型的企业带来了即时的治理和品牌问题。
从经济角度看,这种动态类似于商品采购。买家针对价格每页、语言覆盖和主题多样性平衡的批次进行采购,然后应用工业成像、OCR和质量控制,将模拟资产转化为机器可读文本。利润取决于吞吐量(每小时页数)、OCR准确率、去重率以及处理脆弱或特殊格式的成本。这激励了破坏性裁切以适应平板进纸扫描仪和标准化工作流程。但这也与对稀有或罕见作品的管理期望发生冲突,如果文化价值材料被制浆,可能引发声誉反弹。对许多实验室而言,权衡点在于更高质量文本带来的边际模型收益与法律不确定性、供应商保密性及公众反弹风险之间。
法律上,两个概念主导讨论:首次销售原则和合理使用。首次销售原则通常允许所有者转售甚至销毁其拥有的实体副本;合理使用对扫描和模型训练的分析依赖具体事实,法院会评估目的、转化和市场影响。集成基于此类数据训练的第三方模型的企业面临间接风险:即使上游实验室认为其做法合法,下游的声誉和合同风险仍可能溢出,尤其是在来源披露不足的情况下。因此,实际治理需要可审计性(扫描了什么、何时、依据何种政策)、敏感类别的排除协议,以及在数据集或供应商成为诉讼或批评焦点时的应急方案。
对买家和运营者而言,当前的行动是专业化数据采购。将训练数据视为关键基础设施:实施供应商风险评估,要求所有权和获取方式的声明,坚持对稀有材料的非破坏政策(或有记录的例外),并在数据集和样本级别维护来源登记。考虑减少伦理和法律风险的替代方案:有许可的出版商档案、带有质量控制的公共领域语料库、针对识别出的覆盖缺口的合成数据,以及与图书馆合作的数字化项目以保护原件。投资者应关注二手书市场的价格信号、专业扫描供应商的出现以及标准化来源框架的发展;这些将在未来12至24个月内预示模型差异化和监管趋势。


