Các phân tích thu thập dữ liệu mới cho thấy một tỷ lệ đáng kể các trang web được xuất bản từ cuối năm 2022 — khoảng một phần ba — có các dấu hiệu về phong cách hoặc cấu trúc phù hợp với việc do AI sáng tác hoặc chỉnh sửa đáng kể bởi AI. Việc phát hiện không hoàn hảo, nhưng bức tranh tổng thể rất rõ ràng: các tên miền thương mại .com có tỷ lệ cao hơn đáng kể so với các trang .edu và .gov. Điều này có nghĩa là một phần lớn hơn của “thông tin mới” trên web hiện nay được hình thành bởi máy móc: cấu trúc mẫu, cách diễn đạt đồng nhất, các tuyên bố lặp lại và cách diễn giải nông cạn tập trung quanh các nguồn phổ biến. Bất kể bạn đứng ở đâu về việc viết nội dung AI, hỗn hợp nội dung cơ bản đã thay đổi và các hệ thống hạ nguồn sẽ phải thích nghi theo.
Đối với tìm kiếm, vấn đề cấp bách không chỉ là nội dung AI có được xếp hạng hay không; mà là cách các hệ thống xếp hạng học hỏi khi tập dữ liệu đào tạo và đánh giá của họ nghiêng về văn bản có phong cách tổng hợp. Hãy kỳ vọng các ngưỡng trùng lặp sẽ chặt chẽ hơn, trọng số cao hơn dành cho tương tác và bằng chứng trên trang, cùng các hình phạt nghiêm khắc hơn đối với các trang không độc đáo. Các trình thu thập dữ liệu sẽ chọn lọc hơn với ngân sách, ưu tiên tính mới, uy tín và nguồn gốc. Kết quả phong phú và đoạn trích có thể dựa nhiều hơn vào các nguồn cung cấp dữ liệu gốc, phương pháp hoặc trích dẫn có thể kiểm chứng thay vì các bản tóm tắt. Chiến lược SEO dựa trên các bài giải thích sản xuất hàng loạt ở mức độ trung bình sẽ giảm hiệu quả khi các tín hiệu hội tụ.
Đối với các nhà xây dựng mô hình và nhóm truy xuất, một web có phần tổng hợp đặt ra những lo ngại về vòng phản hồi và sự lệch phân phối. Nếu trợ lý được đào tạo hoặc truy xuất từ nội dung do các trợ lý khác tạo ra, các dấu hiệu phong cách — và đôi khi là lỗi thực tế — có thể vang vọng và tích tụ. Bộ công cụ giảm thiểu đang trở nên rõ ràng hơn: giới hạn tỷ lệ nội dung tổng hợp trong giai đoạn tiền đào tạo; ưu tiên các nguồn có độ đa dạng cao, nguồn gốc chính chủ và chuyên gia trong lĩnh vực; loại bỏ trùng lặp gần như hoàn toàn; và coi metadata nguồn gốc là tín hiệu đào tạo quan trọng. Trong các pipeline RAG, giới hạn thời gian tập dữ liệu, ưu tiên tài liệu có phương pháp, dữ liệu hoặc danh tính tác giả, và hạ bậc các trang có ngôn ngữ mẫu, ít thông tin.
Các nhà vận hành có thể hành động ngay bây giờ. Nhà xuất bản nên áp dụng nhật ký tạo và chỉnh sửa rõ ràng, nhúng các dấu hiệu nguồn gốc, và yêu cầu những hiểu biết độc đáo — dữ liệu, thí nghiệm hoặc chi tiết trực tiếp — trên mỗi trang. Các nhóm dữ liệu nên thực hiện kiểm toán đa tín hiệu về khả năng là AI (dấu hiệu phong cách, entropy, sự khác biệt lịch sử chỉnh sửa) thay vì chỉ dựa vào một bộ phát hiện duy nhất. Các nhà lãnh đạo sản phẩm nên điều chỉnh lộ trình biên tập tránh các bài giải thích đại trà và hướng tới các định dạng tạo ra tín hiệu có thể bảo vệ: các chuẩn mực, công cụ tương tác, nghiên cứu điển hình và bộ dữ liệu gốc. Tiêu chuẩn phân phối đang tăng lên; cách để vượt qua là sự khác biệt hóa cộng với khả năng truy xuất nguồn gốc.


