Các bài báo gần đây cho thấy các phòng thí nghiệm AI hàng đầu đang mua số lượng lớn sách cổ, sách tồn kho và sách ngoại ngữ, đưa chúng qua các máy quét phá hủy tốc độ cao để mở rộng tập dữ liệu huấn luyện cho các mô hình ngôn ngữ lớn. Lý do được báo cáo rất đơn giản: sách cũ cung cấp văn phong cô đọng, được biên tập kỹ, đa dạng lĩnh vực và cấu trúc dài phong phú với ít hạn chế bản quyền hiện đại hơn. Một số báo cáo đã nêu tên các phòng thí nghiệm nổi tiếng trong số các người mua tiềm năng; chi tiết vẫn chưa đầy đủ và ở một số nơi còn gây tranh cãi. Dù sao đi nữa, tín hiệu rất rõ ràng: cuộc cạnh tranh mô hình tiên phong đang chuyển sang hướng thu thập dữ liệu có kiểm soát thay vì thu thập dữ liệu web cơ hội, tạo ra một lớp logistics thế giới vật lý mới cho dữ liệu AI và đặt ra các câu hỏi quản trị và thương hiệu cấp bách cho các doanh nghiệp triển khai hoặc tích hợp các mô hình như vậy.
Về mặt kinh tế, động lực này tương tự như mua sắm hàng hóa. Người mua nhắm đến các lô hàng cân bằng giữa giá trên mỗi trang, phạm vi ngôn ngữ và đa dạng chủ đề, sau đó áp dụng công nghệ chụp ảnh công nghiệp, OCR và kiểm soát chất lượng để biến tài sản analog thành văn bản có thể đọc máy. Biên lợi nhuận phụ thuộc vào tốc độ xử lý (trang mỗi giờ), độ chính xác OCR, hiệu quả loại bỏ trùng lặp và chi phí xử lý các định dạng giòn hoặc đặc biệt. Điều này tạo động lực cho việc cắt phá hủy để sử dụng máy quét nạp tờ và quy trình chuẩn hóa. Nhưng nó cũng mâu thuẫn với kỳ vọng quản lý đối với các tác phẩm hiếm hoặc không phổ biến và có thể gây phản ứng tiêu cực về uy tín nếu tài liệu có giá trị văn hóa bị nghiền nát. Với nhiều phòng thí nghiệm, phép tính sẽ cân nhắc lợi ích biên của mô hình từ văn bản chất lượng cao hơn so với sự không chắc chắn pháp lý, bí mật nhà cung cấp và rủi ro phản ứng công chúng.
Về mặt pháp lý, hai khái niệm chi phối cuộc tranh luận: nguyên tắc bán lần đầu và sử dụng hợp lý. Nguyên tắc bán lần đầu thường cho phép chủ sở hữu bán lại hoặc thậm chí phá hủy các bản vật lý mà họ sở hữu; phân tích sử dụng hợp lý cho việc quét và huấn luyện mô hình phụ thuộc vào từng trường hợp cụ thể và chưa được xác định rõ, với các tòa án đánh giá mục đích, sự biến đổi và tác động thị trường. Các doanh nghiệp tích hợp mô hình bên thứ ba được huấn luyện trên dữ liệu như vậy đối mặt với rủi ro gián tiếp: ngay cả khi các phòng thí nghiệm đầu nguồn tin rằng thực hành của họ hợp pháp, rủi ro về uy tín và hợp đồng ở hạ nguồn có thể lan tỏa, đặc biệt khi các công bố nguồn gốc còn hạn chế. Do đó, quản trị thực tiễn đòi hỏi khả năng kiểm toán (đã quét gì, khi nào và theo chính sách nào), các giao thức loại trừ cho các danh mục nhạy cảm và kế hoạch dự phòng nếu một bộ dữ liệu hoặc nhà cung cấp trở thành tâm điểm của kiện tụng hoặc chỉ trích.
Đối với người mua và nhà vận hành, bước đi ngay lập tức là chuyên nghiệp hóa việc mua dữ liệu. Xem dữ liệu huấn luyện như hạ tầng quan trọng: thực hiện đánh giá rủi ro nhà cung cấp, yêu cầu cam kết về quyền sở hữu và phương pháp thu thập, bắt buộc chính sách không phá hủy đối với tài liệu hiếm (hoặc có miễn trừ được ghi nhận), và duy trì sổ đăng ký nguồn gốc ở cấp độ bộ dữ liệu và mẫu. Xem xét các lựa chọn thay thế giảm thiểu rủi ro đạo đức và pháp lý: kho lưu trữ nhà xuất bản có bản quyền, tập dữ liệu công cộng được kiểm soát chất lượng, dữ liệu tổng hợp nhắm vào các khoảng trống về phạm vi, và hợp tác số hóa với thư viện để bảo tồn bản gốc. Các nhà đầu tư nên theo dõi tín hiệu giá trên thị trường sách đã qua sử dụng, sự xuất hiện của các nhà cung cấp dịch vụ quét chuyên biệt và sự phát triển của các khung nguồn gốc tiêu chuẩn; những điều này sẽ báo hiệu sự khác biệt mô hình và xu hướng quy định trong 12–24 tháng tới.


