Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Amazon bị tố hủy hoại sách quý để lấy dữ liệu huấn luyện AI

(giờ Việt Nam)

Tóm tắt AI

Amazon bị phát hiện thu mua và cắt bỏ gáy sách quý để quét nội dung phục vụ huấn luyện mô hình AI Nova, gây tranh cãi lớn về đạo đức và bản quyền so với cách số hóa bảo tồn của Internet Archive.

Bản dịch AI

It is a sign of the times that Amazon gets to  call this fair use while huge corporations try to sue the Internet Archive out of business.

Bản báo cáo của 404 này đang nhận được sự quan tâm đáng kể một cách xứng đáng.

Amazon đang thu mua một lượng lớn sách, quét nội dung để làm dữ liệu huấn luyện AI, và tiêu hủy chúng trong quá trình này.

Một cuộc điều tra của 404 Media đã tiết lộ hoạt động thu mua sách của Amazon, vốn chưa từng được báo cáo trước đây, bằng cách đặt một thiết bị theo dõi vào một cuốn sách hiếm mà chúng tôi nghi ngờ sẽ được một công ty AI mua lại để làm dữ liệu huấn luyện, rồi theo dấu nó trên khắp đất nước đến điểm đến cuối cùng.

Điểm đến cuối cùng đó là một nhà kho của Amazon tại Las Vegas, Nevada. Các nhân viên Amazon làm việc tại địa điểm này cho biết công việc của họ chỉ là tiếp nhận những lô hàng sách in khổng lồ, sau đó cắt bỏ phần gáy sách để quét nội dung nhanh hơn. Cuốn sách in bị tiêu hủy trong quá trình này. Logo của đội ngũ Amazon làm việc tại nhà kho này, có tên là VGT3, là hình một con khủng long đang nhe răng và cầm một cuốn sách trên tay.

...

Chúng tôi sẽ không tiết lộ tựa đề của những cuốn sách có trong lô hàng mà chúng tôi đã theo dõi, nhưng chúng đều là những cuốn sách hiếm, nghĩa là không còn nhiều bản sao lưu hành trên thị trường. Đôi khi lý do là vì số lượng in ấn ban đầu không nhiều, hoặc vì chúng được viết bằng một ngôn ngữ nước ngoài mà ít người sử dụng. Như người bán sách đã bán chúng cho tôi chia sẻ, không có nhiều người trên thế giới quan tâm đến chúng theo cách mà người ta quan tâm đến ấn bản đầu tiên của Oliver Twist, nhưng điều đó không có nghĩa là chúng không có giá trị.

"Có nhiều loại giá trị khác nhau," người bán sách nói. "Rõ ràng là có giá trị tiền tệ, nhưng còn rất nhiều loại giá trị khác. Đó là giá trị lịch sử, giá trị trí tuệ, giá trị tinh thần. Đủ mọi thứ, và tất cả những điều đó các công ty AI đều không quan tâm. Họ chỉ muốn nội dung như một tập hợp các từ ngữ được xâu chuỗi lại với nhau."

Như đã đề cập ở những nơi khác, đây cũng là hành vi vi phạm sở hữu trí tuệ (IP) trên quy mô lớn.

Tuy nhiên, có một khía cạnh chưa nhận được sự chú ý xứng đáng, đó là cách một công ty thực sự có đạo đức và tinh thần vì cộng đồng xử lý cùng một vấn đề này.

Năm 1996, kỹ sư máy tính Brewster Kahle đã thành lập Internet Archive với sứ mệnh cung cấp "quyền truy cập phổ quát vào mọi tri thức". Ngày nay, tầm nhìn đó thúc đẩy công việc tỉ mỉ đang diễn ra tại các trung tâm quét tài liệu, nơi các nhân viên cẩn thận số hóa từng trang sách một, bảo tồn cả nội dung lẫn tính nguyên vẹn vật lý của những tập sách hàng thế kỷ tuổi.

Cách tiếp cận của Internet Archive bắt nguồn từ sự bất đồng cơ bản với các phương pháp số hóa xuất hiện vào đầu những năm 2000. Khi Google khởi động dự án Books vào năm 2004, nó đã cách mạng hóa quy mô của các thư viện số nhưng lại đưa ra một sự đánh đổi đáng lo ngại: tốc độ so với bảo tồn. Cách tiếp cận công nghiệp của Google thường liên quan đến việc quét tài liệu mang tính hủy hoại—cắt gáy sách và tháo rời các trang để tạo điều kiện cho quá trình xử lý tự động diễn ra nhanh chóng.

Internet Archive đã chọn một con đường khác. "Tại Internet Archive, chúng tôi không bao giờ tiêu hủy một cuốn sách bằng cách cắt bỏ gáy của nó. Thay vào đó, chúng tôi số hóa theo cách thủ công, từng trang một". Điều đó dẫn đến việc điều chỉnh máy móc và phần mềm để phù hợp với mục đích rất cụ thể của Internet Archive, và tạo ra một công việc: người quét sách, hay còn gọi là người chép thuê (scribe operator).

Cần nói rõ rằng, phương pháp hủy hoại sách nhanh hơn và rẻ hơn, nhưng với nguồn lực khổng lồ của Amazon và số tiền khổng lồ đã chi ra—trong nhiều trường hợp là lãng phí một cách rõ ràng—để thổi phồng bong bóng AI, thì đó không phải là một cái cớ thỏa đáng. Điều này thậm chí còn tồi tệ hơn khi bạn nhớ rằng tất cả những thứ này đều đang được dùng để huấn luyện dòng Nova tệ hại mới nhất của Amazon.

Đây là lựa chọn mà họ đã thực hiện, cũng giống như việc xây dựng các nhà máy điện nhiên liệu hóa thạch khổng lồ ngay bây giờ thay vì dành thời gian để tăng cường năng lượng hạt nhân và năng lượng tái tạo là một lựa chọn, cũng giống như việc đánh cắp sở hữu trí tuệ của vô số nhà văn và nghệ sĩ là một lựa chọn, cũng giống như việc tung ra các sản phẩm chưa sẵn sàng cho thị trường là một lựa chọn, cũng giống như việc thiết lập các kế hoạch tài chính phức tạp và lừa đảo một cách lố bịch thay vì phát triển ngành công nghiệp một cách bền vững là một lựa chọn.

AmazonAIBản quyềnDữ liệu huấn luyệnĐạo đức AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.