近期新聞報導顯示,領先的人工智慧實驗室正大量購買古籍、剩餘書籍及外文書,並透過高速破壞性掃描器將其數位化,以擴充大型語言模型的訓練語料庫。報導中指出的理由相當直接:舊書提供密集且經過編輯的散文、多元領域內容,以及具豐富領域知識的長篇結構,且較少現代授權限制。有些報導甚至點名知名實驗室為潛在買家;細節尚不完整且部分存在爭議。不論如何,訊號明確:前沿模型競爭正從機會主義的網路爬蟲轉向受控的資料取得,為人工智慧資料創造了新興的實體世界物流層,並對部署或整合此類模型的企業提出即時的治理與品牌問題。
從經濟角度看,這種動態類似商品採購。買家會挑選在每頁價格、語言涵蓋範圍與主題多樣性間取得平衡的批次,然後運用工業級影像處理、光學字元辨識(OCR)與品質控管,將類比資產轉換為機器可讀文本。利潤取決於產能(每小時頁數)、OCR準確度、去重率,以及處理脆弱或特殊格式的成本。這促使破壞性裁切以配合送紙式掃描器與標準化流程。但此舉也與對稀有或罕見作品的管理期望相衝突,若文化價值材料被打漿,將招致聲譽反彈。對許多實驗室而言,權衡點在於從高品質文本中獲得的邊際模型提升,與法律不確定性、供應商保密性及公眾反彈風險之間的取捨。
法律層面,兩個概念主導辯論:首次銷售原則與合理使用。首次銷售通常允許擁有者轉售甚至銷毀其持有的實體副本;合理使用對掃描與模型訓練的分析則依具體事實而定,法院會評估目的、轉化程度與市場影響。整合基於此類資料訓練的第三方模型的企業面臨間接風險:即使上游實驗室認為其做法合法,下游的聲譽與合約風險仍可能外溢,尤其在來源揭露不足時。實務治理因此需具備可稽核性(掃描內容、時間及政策依據)、敏感類別排除規範,以及若資料集或供應商成為訴訟或批評焦點時的應變計畫。
對買家與營運者而言,當務之急是專業化資料採購。將訓練資料視為關鍵基礎設施:實施供應商風險評估,要求所有權與取得方式的聲明,堅持對稀有材料的非破壞政策(或有文件化豁免),並在資料集及樣本層級維護來源登記。考慮降低倫理與法律風險的替代方案:授權出版商檔案、具策劃品質控管的公共領域語料庫、針對識別出的覆蓋缺口的合成資料,以及與圖書館合作的數位化方案以保留原件。投資者應關注二手書市場的價格訊號、專業掃描供應商的出現,以及標準化來源框架的發展;這些將在未來12至24個月內揭示模型差異化與監管趨勢。


