TechCrunch: AI
92

Tin ngành

Tài liệu mật vụ kiện NYT: Lãnh đạo Microsoft thừa nhận AI là 'vụ trộm lao động lớn nhất lịch sử'

(giờ Việt Nam)

Tóm tắt AI

Các tài liệu mới được công bố từ vụ kiện giữa New York Times và OpenAI cho thấy chính nội bộ Microsoft và OpenAI cũng thừa nhận việc thu thập dữ liệu AI là mối đe dọa sinh tồn đối với ngành xuất bản.

Bản dịch AI

Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal

Những thông tin mới được công khai trong vụ kiện bản quyền mà The New York Times khởi xướng chống lại OpenAI và Microsoft ba năm trước đã tiết lộ một sự thừa nhận rằng việc thu thập dữ liệu (scraping) cho AI tương đương với hành vi trộm cắp, và các sản phẩm AI gây ra mối đe dọa lớn đối với các đơn vị xuất bản.

Theo hồ sơ vụ kiện, một giám đốc điều hành cấp cao của Microsoft đã mô tả riêng tư các hoạt động huấn luyện AI của các công ty này là "trộm cắp", và chính ban lãnh đạo của OpenAI cũng thừa nhận rằng các mô hình AI của họ gây ra "mối đe dọa hiện hữu" đối với các nhà xuất bản và nhà báo – những người có tác phẩm được dùng để huấn luyện các mô hình đó.

Các tài liệu được giải mật cũng nêu chi tiết cách các công ty này bị cáo buộc đã thu thập và sử dụng nội dung bằng cách vượt qua các tường phí (paywall) mà không bị phát hiện, xây dựng các tập dữ liệu huấn luyện thông qua việc thu thập dữ liệu hàng loạt, và cố tình loại bỏ các thông báo bản quyền khỏi dữ liệu huấn luyện.

Cần lưu ý rằng phần lớn thông tin mới đến từ bản tóm tắt của chính The Times, không phải từ các tài liệu đính kèm gốc, vốn vẫn đang được niêm phong. Các trích dẫn dưới đây được trình bày mà không có ngữ cảnh gốc của chúng.

Hồ sơ được công khai này là sự leo thang mới nhất trong vụ kiện kéo dài ba năm, trong đó The New York Times ban đầu cáo buộc các công ty này vi phạm luật bản quyền bằng cách huấn luyện các mô hình AI tạo sinh trên nội dung của họ.

Câu hỏi liệu các công ty AI có thể sử dụng hợp pháp tài liệu có bản quyền để huấn luyện AI hay không vẫn chưa có câu trả lời rõ ràng, nhưng các thẩm phán phần lớn nghiêng về lập luận của các công ty AI rằng việc huấn luyện cấu thành "sử dụng hợp lý" (fair use). Quy tắc pháp lý này cho phép mọi người sử dụng tác phẩm có bản quyền mà không cần xin phép trong một số trường hợp nhất định, như nhại lại, đưa tin tức hoặc phê bình. Đầu tháng này, chính quyền Trump đã đệ trình một bản tóm tắt để bảo vệ việc OpenAI sử dụng tài liệu có bản quyền mà không có giấy phép để huấn luyện các LLM của mình.

Tuy nhiên, một số thừa nhận mới lại đi ngược lại với lập luận "sử dụng hợp lý" của OpenAI, đặc biệt là yêu cầu của quy tắc này về việc việc sử dụng không được thay thế hoặc gây hại cho thị trường của tác phẩm gốc.

Ví dụ, dữ liệu của chính Microsoft cho thấy "công cụ trả lời" Copilot của họ đã khiến tỷ lệ nhấp chuột (click-through rate) vào tên miền của The New York Times giảm tới 93% so với tìm kiếm truyền thống trên Bing. Một bài thuyết trình nội bộ của Microsoft do Giám đốc Khoa học Ứng dụng của Microsoft, Brent Hecht, viết vào tháng 1 năm 2024 đã mô tả sự sụt giảm này là một "vòng lặp diệt vong" (doom loop) mà "sẽ làm tổn hại đến hiệu suất của các mô hình của chúng tôi và toàn bộ web cùng một lúc."

"Việc một sản phẩm cuối cùng đe dọa nền tảng kinh tế của các nhà cung cấp thiết yếu của chính nó là điều vô cùng bất thường, nhưng đó là tình thế mà chúng tôi đã tạo ra cho mảng kinh doanh LLM của mình đối với 'chuỗi cung ứng nội dung'", tài liệu của Microsoft viết, theo trích dẫn trong hồ sơ.

CEO Satya Nadella của Microsoft cũng đã làm chứng trong một buổi lấy lời khai đầu năm nay rằng "bất cứ thứ gì có tường phí đều nên được cấp phép bởi bất kỳ ai muốn sử dụng nó... để làm dữ liệu nền hoặc huấn luyện", và nói rõ rằng, nếu ông "biết được việc OpenAI đã thu thập và huấn luyện trên thông tin nằm sau tường phí", ông sẽ "yêu cầu OpenAI phải huấn luyện lại các mô hình của mình."

Các thừa nhận khác đi ngược lại với những trụ cột khác của bài kiểm tra "sử dụng hợp lý": Nick Turley, Trưởng bộ phận ChatGPT của OpenAI, đã viết trong một trao đổi nội bộ rằng các nhà xuất bản phải đối mặt với "mối đe dọa hiện hữu" từ các sản phẩm như chatbot, vốn "phần lớn mang tính thay thế" và "sẽ ngày càng thay thế nhiều hơn khi chúng trở nên tốt hơn."

Chủ tịch OpenAI Greg Brockman mô tả các mô hình này là "xuất sắc trong việc đưa tin tức". Nadella cũng đồng ý dưới lời tuyên thệ đầu năm nay rằng việc trò chuyện với chatbot "đã thay thế... việc cung cấp thông tin ngay trên trang web trên nền tảng AI thay vì cần phải truy cập vào nguồn gốc."

Kiểu ngôn ngữ đó cho thấy công nghệ này có thể cạnh tranh trực tiếp với tác phẩm gốc thay vì chuyển đổi nó.

Một tài liệu của Microsoft nêu rõ có một "rủi ro thực sự" rằng AI tạo sinh có thể "gây gián đoạn đáng kể đến việc làm của chính những người đã tạo ra dữ liệu mà mô hình nền tảng được huấn luyện trên đó."

Quy mô sao chép khổng lồ là điều đáng kinh ngạc. Các tài liệu tiết lộ lần đầu tiên rằng chỉ riêng các tập dữ liệu huấn luyện trung gian của OpenAI đã chứa hơn 91.692 bản sao các tác phẩm do NYT, Daily News và Center for Investigative Reporting xuất bản. Một tập dữ liệu bắt nguồn từ Common Crawl bao gồm hơn 2 triệu tài liệu chỉ riêng từ nytimes.com.

Trong một bản ghi nhớ nội bộ tháng 1 năm 2023, Hecht gọi đó là "một vụ trộm đáng kinh ngạc với quy mô chưa từng có" và là "vụ trộm sức lao động lớn nhất trong lịch sử nhân loại."

Hồ sơ trình bày chi tiết mới về cách OpenAI và Microsoft đã tiến hành thu thập nội dung của các nguyên đơn, bao gồm cả việc thu thập từ Bing Index.

"OpenAI đã chuyển toàn bộ tập dữ liệu huấn luyện GPT-3 cho Microsoft, công ty đã sử dụng nó để đánh giá cách triển khai các mô hình của OpenAI trong các sản phẩm thương mại của riêng mình", hồ sơ viết. "Microsoft cũng tương tự đã cung cấp dữ liệu huấn luyện cho OpenAI thông qua các sáng kiến có tên là Project Taxi và Project Mango."

Các công ty này bị cáo buộc đã tập hợp dữ liệu Project Mango thành một tập dữ liệu huấn luyện chứa các bản sao của ít nhất 160.903 tác phẩm độc nhất từ các nhà xuất bản tin tức.

Để tận dụng tối đa việc thu thập dữ liệu, các nhân viên OpenAI bị cáo buộc đã lập kế hoạch vượt qua các tường phí mà không bị phát hiện. Các hồ sơ cho thấy khi nhà nghiên cứu Nick Ryder của OpenAI nói với Brockman về một "mẹo để vượt qua tường phí của nytimes", Brockman đã trả lời: "ah hay đấy."

Các nhân viên OpenAI cũng bị cáo buộc đã xây dựng các tập dữ liệu huấn luyện như WebText và WebText2, vốn dựa quá mức vào nội dung tin tức được thu thập. Họ cũng bị cáo buộc đã lấy hàng triệu bài báo từ Common Crawl, một kho lưu trữ dữ liệu thu thập web miễn phí và mở. Các phát hiện cũng mô tả những nỗ lực cố tình nhằm loại bỏ các thông báo bản quyền khỏi dữ liệu huấn luyện trước khi nó đến được mô hình, vì các nhà nghiên cứu "sẽ không muốn mô hình xuất ra" "các thông báo bản quyền" cho người dùng.

OpenAI và Microsoft không phản hồi các yêu cầu bình luận.

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Rebecca BellanEvent Logo
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.