Tin ngành
ISBNdb gỡ bỏ trang dịch vụ sau làn sóng phẫn nộ vì tiếp tay 'nghiền nát' sách để huấn luyện AI
(giờ Việt Nam)
Tóm tắt AI
ISBNdb bị chỉ trích vì môi giới mua sách để AI huấn luyện, buộc phải gỡ bỏ dịch vụ và khẳng định không trực tiếp đào tạo mô hình. Vụ việc gợi nhắc bê bối Anthropic từng chi 1,5 tỷ USD hòa giải vì hành vi hủy hoại sách vật lý để số hóa dữ liệu.
Bản dịch AI
Theo tin từ IT ngày 2 tháng 8, tuần này, thông tin về việc một lượng lớn sách quý bị đem đi nghiền nát tập trung chỉ để lấy dữ liệu huấn luyện các mô hình ngôn ngữ lớn (LLM) đã thu hút sự quan tâm rộng rãi từ những người yêu sách và cộng đồng mạng.

Tin tức cho biết, một số nhà cung cấp sách gần đây đã nhận được các đơn đặt hàng với số lượng bất thường. Người trong ngành suy đoán rằng các công ty AI muốn có được dữ liệu huấn luyện chất lượng cao và "sạch" hơn, đồng thời cố gắng tránh rủi ro về bản quyền. Tâm điểm của cuộc tranh cãi này đổ dồn vào trang web cơ sở dữ liệu sách ISBNdb. Dư luận cho rằng trang web này không chỉ khuyến khích hành vi trên mà còn làm cầu nối giữa các công ty AI và nhà cung cấp sách. Khi dư luận bắt đầu bùng nổ, ISBNdb đã cố gắng tách mình ra khỏi cuộc tranh cãi này và xóa bỏ các nội dung liên quan mà họ từng đăng tải.
Trong tuyên bố mới nhất, ISBNdb cho biết: "Chúng tôi đã ghi nhận các báo cáo gần đây về một trang đích tiếp thị trên trang web của mình và hiểu rõ những lo ngại mà nó gây ra. Chúng tôi không huấn luyện các mô hình AI và chưa bao giờ tham gia vào lĩnh vực kinh doanh liên quan. Trang đó chỉ là một thử nghiệm về nhu cầu thị trường, dịch vụ liên quan chưa bao giờ thực sự được triển khai và hiện tại chúng tôi đã xóa trang này."
Vài ngày trước, 404 Media đưa tin rằng nhiều nhà cung cấp sách bất ngờ nhận được số lượng lớn đơn đặt hàng. Do ngân sách của các trường học và thư viện bị thắt chặt trong những năm gần đây dẫn đến nhu cầu mua sắm giảm sút, nhiều nhà cung cấp đang chịu áp lực kinh doanh lớn nên dễ dàng chấp nhận các đơn hàng giá trị cao như vậy.
Vào thời điểm đó, dư luận nghi ngờ rằng người mua đứng sau là các công ty AI, và ISBNdb trở thành tâm điểm vì họ từng ra mắt một dịch vụ dường như chuyên giúp các doanh nghiệp AI kết nối với các kho lưu trữ sách.
Trên trang quảng cáo hiện đã bị xóa từng viết: "Dữ liệu huấn luyện AI chất lượng nhất thế giới đang nằm ngay trên kệ sách. Sách chứa đựng tri thức nhân loại đã qua chọn lọc, bình duyệt và tích lũy chuyên sâu, mức độ cấu trúc hóa của nó là điều mà bất kỳ trình thu thập dữ liệu web (web crawler) nào cũng không thể sao chép được; nội dung dày đặc, đã qua biên tập và có tính thẩm quyền."
Trên thực tế, đây không phải là lần đầu tiên hành vi này bị phơi bày. Ngay từ tháng 1 năm nay, một tài liệu tòa án công khai đã tiết lộ dự án nội bộ của Anthropic có mật danh là "Project Panama". Dự án này nhằm mục đích mua càng nhiều sách càng tốt, hoàn tất việc quét kỹ thuật số rồi sau đó tiêu hủy sách vật lý.
Sau đó, Anthropic đã đạt được thỏa thuận hòa giải với các tác giả với tổng trị giá 1,5 tỷ USD (IT lưu ý: tỷ giá hiện tại tương đương khoảng 10,147 tỷ Nhân dân tệ). Tuy nhiên, các tài liệu tòa án được công khai sau đó cho thấy hành vi này được coi là hợp pháp, điều thực sự khiến công ty lo ngại chính là dư luận tiêu cực kéo theo. Do đó, Anthropic sẵn sàng trả cái giá đắt để tránh việc các hành vi liên quan bị phơi bày.
Giờ đây, khi nội dung này đã bị công khai, các đơn đặt hàng sách quý số lượng lớn gần đây cũng đã nhận được sự giám sát chặt chẽ hơn.
Một người bán sách ẩn danh chia sẻ với 404 Media: "Làm như vậy vừa giúp tôi giải phóng lượng hàng tồn kho vốn rất khó bán, vừa giúp tôi kiếm được tiền. Nhưng mặt khác, tôi không thích mục đích cuối cùng của những cuốn sách này, cũng không muốn nhìn thấy những cuốn sách quý hiếm bị đem đi nghiền thành bột giấy."
Báo cáo cho biết, khi các công ty AI ngày càng khó có được dữ liệu huấn luyện "sạch", họ đang tìm kiếm các nguồn dữ liệu mới.
Một lượng lớn nội dung chất lượng thấp trên Internet, cùng với ngày càng nhiều nội dung do chính AI tạo ra, có thể dẫn đến vấn đề "vòng lặp phản hồi tiêu cực" trong huấn luyện mô hình. Do đó, các công ty muốn có được dữ liệu chất lượng cao hơn, đồng thời cố gắng tránh thu hút sự chú ý từ bên ngoài.
Mùa hè năm nay, công ty điện ảnh A24 đã thông báo hợp tác với Google để cung cấp tài liệu huấn luyện cho DeepMind, với hy vọng giúp mô hình tạo nội dung truyền thông của họ thoát khỏi tình trạng chứa đầy nội dung AI chất lượng kém và phong cách hỗn loạn.
Về lý do tại sao phải tiêu hủy sách vật lý, báo cáo cho rằng điều này không phải để xóa dấu vết, cũng không phải vì mục đích lưu giữ tri thức quý hiếm.
Mặc dù các tài liệu liên quan đến "Project Panama" không nêu rõ lý do cụ thể cho việc tiêu hủy sách, nhưng lời giải thích khả thi nhất vẫn là để cắt giảm chi phí. Thực tế, việc quét kỹ thuật số sách không nhất thiết phải phá hủy sách gốc, nhưng nếu toàn bộ quy trình theo đuổi chi phí thấp và hiệu quả cao, rất có thể họ sẽ tháo gỡ gáy sách để có được kết quả quét phẳng và rõ nét hơn, sau đó xử lý những cuốn sách đã hư hỏng như giấy vụn.
Tuyên bố quảng cáo: Các liên kết ngoài (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) có trong bài viết được sử dụng để truyền tải thêm thông tin, giúp tiết kiệm thời gian lựa chọn, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.