The Verge: AI
92

Thủ thuật

Tài liệu tòa án tiết lộ OpenAI và Microsoft sớm biết AI sẽ tạo ra 'vòng lặp hủy diệt' dữ liệu

(giờ Việt Nam)

Tóm tắt AI

Hồ sơ vụ kiện từ New York Times cho thấy OpenAI và Microsoft từng thừa nhận chiến lược nội dung AI của họ có nguy cơ tạo ra vòng lặp tự hủy hoại, gây hại cho chính mô hình và toàn bộ hệ sinh thái mạng.

Bản dịch AI

OpenAI and Microsoft knew they were starting a ‘doom loop’ for the web

Các tài liệu tòa án vừa được công khai trong vụ kiện của New York Times chống lại OpenAI và Microsoft thực sự rất đáng lên án. Chính tài liệu của các công ty này đã cảnh báo rằng họ đang khởi đầu một “vòng lặp diệt vong” (doom loop) gây tổn hại cho web, mô tả việc thu thập dữ liệu để huấn luyện mô hình của họ là “vụ trộm cắp lao động lớn nhất trong lịch sử nhân loại”, và biến “khái niệm sử dụng hợp lý (fair use) thành một trò hề hoàn toàn”.

Nhiều trích dẫn gây chú ý nhất từ tài liệu đến từ Brent Hecht, Giám đốc Khoa học Ứng dụng của Microsoft. Tuy nhiên, công ty đã cố gắng tách mình ra khỏi những khẳng định của Hecht. Người phát ngôn của Microsoft, Alex Haurek, nói với The Verge rằng: “Những bình luận này phản ánh quan điểm cá nhân của một nhân viên, không phải là phân tích pháp lý và không đại diện cho quan điểm của công ty.”

Trong một hồ sơ tòa án khác, Jordan Usdan, Tổng giám đốc Chiến lược và Vận hành Dữ liệu tại Microsoft AI, đã mô tả vai trò của Hecht là mang tính đối kháng. Ông cho biết Hecht “có những quan điểm khác biệt, mang tính học thuật và hướng tới tương lai về cách các hệ sinh thái dữ liệu cho AI nên vận hành, và được Microsoft tuyển dụng để đưa ra các quan điểm bất đối xứng, mang tính tương lai và học thuật… ông ấy cũng không phải là người phát ngôn thay mặt cho Microsoft về các quan điểm lý thuyết của mình đối với tác động tiềm tàng của AI lên những người sáng tạo nội dung.”

Nhưng dù Microsoft có muốn nhận những bình luận này hay không, rõ ràng là điều đó đã trở thành sự thật. Google Zero là có thật! AI đang “ăn mòn” web!

Có rất nhiều tuyên bố gây sốc khác trong hồ sơ của NYT từ nhiều nhân vật khác nhau, bao gồm Satya Nadella, Sam Altman và các nhân viên khác của OpenAI. Dưới đây là một số điểm nổi bật từ tài liệu dài 92 trang.

“Một vụ trộm cắp đáng kinh ngạc”

This case is about, as Microsoft’s Director of Applied Science [Brent Hecht] put it, “an astonishing theft of unprecedented proportions”; SF1437, perhaps the “largest theft of labor in human history.”

Phần giới thiệu trích dẫn Hecht và Trưởng bộ phận ChatGPT của OpenAI (có lẽ là Nick Turley) theo cách cho thấy các công ty này biết họ gây ra “mối đe dọa hiện hữu” đối với các nhà xuất bản như New York Times. Hecht gọi việc ChatGPT và Copilot thu thập dữ liệu là “vụ trộm cắp lao động lớn nhất trong lịch sử nhân loại” và nói rằng sự bào chữa của Microsoft đã biến “khái niệm ‘sử dụng hợp lý’ thành một trò hề hoàn toàn.”

Đó là một “vòng lặp diệt vong”

Microsoft’s CEO Satya Nadella agreed under oath that conversing with chatbots “hassubstituted … giving you the information right there on the website on the AI platform versusneeding to go to the unde

Satya Nadella thừa nhận rằng các chatbot về cơ bản đã thay thế tìm kiếm và loại bỏ nhu cầu truy cập trực tiếp vào nguồn thông tin. Nhưng có lẽ đáng lên án hơn là một tài liệu nội bộ của Microsoft viết rằng: “Chiến lược nội dung AI của chúng tôi đã bắt đầu một ‘vòng lặp diệt vong’ gây tổn hại đến hiệu suất của các mô hình và toàn bộ web cùng một lúc: Thật bất thường khi một sản phẩm cuối cùng lại đe dọa nền tảng kinh tế của các nhà cung cấp thiết yếu của chính nó, nhưng đó là tình thế mà chúng tôi đã tạo ra cho mảng kinh doanh LLM của mình liên quan đến ‘chuỗi cung ứng nội dung’.”

Đó thậm chí không phải là một con số thực

Around the same time, OpenAI co-founderGreg Brockman wrote he was “deeply motivated by the gazillions” he hoped to gain bycommercializing OpenAI’s technology. SF630. Lately, it has been reported that

Đừng để bị đánh lừa bởi những tuyên bố về ý định vị tha của OpenAI hay Microsoft. Đồng sáng lập OpenAI, Greg Brockman, quan tâm nhiều hơn đến “hàng tỷ tỷ” đô la mà ông có thể kiếm được thông qua AI thương mại.

Tường phí (paywall) thì sao chứ

Individuals within OpenAI and Microsoft ignored such issues as circumventing paywallsand violating terms of use when acquiring data. SF521-47, 790-92. For example, OpenAI’scorporate representative tes

Mặc dù sau đó Nadella được trích dẫn nói rằng “bất cứ thứ gì có tường phí đều nên được cấp phép”, một đại diện của OpenAI thừa nhận rằng ông “không biết” về bất kỳ nỗ lực nào nhằm phát hiện hoặc loại bỏ nội dung có tường phí khỏi dữ liệu huấn luyện.

“Khả năng tái tạo nội dung cực kỳ tốt”

That same year, OpenAI recognized that its API “might outputexisting content verbatim.” SF945. By 2021, OpenAI considered the prevention of memorizationimportant “for fair use [compliance] and minimiz

Về nội bộ, có vẻ như OpenAI biết rõ xu hướng của ChatGPT là chỉ đơn giản sao chép nguyên văn tài liệu có bản quyền. Mặc dù thừa nhận rằng việc “ngăn chặn ghi nhớ” là quan trọng để “giảm thiểu vi phạm bản quyền”, các nhân viên vẫn thừa nhận rằng GPT-4 “đã ghi nhớ rất nhiều dữ liệu và do đó sẽ cực kỳ giỏi trong việc tái tạo nội dung.”

Hồ sơ sau đó trích dẫn một số ví dụ về việc ChatGPT xuất ra các đoạn văn bản dài được sao chép trực tiếp từ các bài báo trên Times, Mercury News, The Denver Post, LifeHacker và Eurogamer để phản hồi các truy vấn.

“‘Hút sạch’ mọi công sức của họ”

Microsoft biết việc họ quét toàn bộ internet sẽ bị nhìn nhận như thế nào và thừa nhận rằng “hầu như không ai có ý định để nội dung họ tạo ra được sử dụng theo cách này, cũng như họ không được trả công cho việc sử dụng đó.”

Một “sự thay thế cho sức lao động của con người”

Giám đốc Chính sách của OpenAI, Jack Clark, đã nhìn thấy trước tương lai khi nói rằng họ đang “tạo ra các hệ thống thay thế cho sức lao động của những người định hình ‘văn hóa’ của xã hội.” Các tài liệu nội bộ mô tả ChatGPT là “sạp báo hiện đại”. Nick Turley của OpenAI sau đó được trích dẫn nói rằng một khi bạn nhận được câu trả lời từ chatbot của họ, sẽ “không có lý do chính đáng nào để nhấp” vào liên kết đến nguồn gốc.

Phá hủy chuỗi cung ứng của chính mình

Microsoft được trích dẫn thừa nhận rằng “LLM là một sản phẩm phá hủy chuỗi cung ứng của chính nó” vì trong nhiều trường hợp, nó là vật thay thế cho chính dữ liệu huấn luyện của nó.

OpenAI biết họ đang giết chết lưu lượng truy cập giới thiệu (referral traffic)

Các chuyên gia kinh tế và truyền thông của chính OpenAI cho rằng sự sụt giảm lưu lượng truy cập giới thiệu cho các trang web như Times là do trực tiếp từ các bản tóm tắt AI như AI Overviews của Google. Họ suy đoán rằng lưu lượng truy cập từ tìm kiếm có thể đã giảm tới 60 phần trăm.

Người phát ngôn của Microsoft, Haurek, cảnh báo rằng: “Lời khai của Satya và lập trường của Microsoft trong vụ kiện này hoàn toàn nhất quán. Ông ấy đã nói về các nguyên tắc rộng lớn và những thay đổi đang diễn ra trong cách mọi người tìm kiếm và tiêu thụ thông tin. Những quan sát đó không nên bị nhầm lẫn với các kết luận về các câu hỏi bản quyền trước Tòa án, điều mà Microsoft đã giải quyết trong các hồ sơ của mình.”

Nhưng dựa trên tài liệu vừa được công khai này, có vẻ khá rõ ràng rằng cả Microsoft và OpenAI đều biết họ sẽ gây ra thiệt hại không thể cứu vãn cho ngành xuất bản, cho “hàng triệu người” đang làm việc trong ngành này, và mở rộng ra là gây tổn hại cho chính sản phẩm của họ, nhưng vẫn tiếp tục thực hiện vì mục tiêu “hàng tỷ tỷ” đô la — mặc kệ vòng lặp diệt vong.

Theo dõi các chủ đề và tác giả từ bài viết này để xem thêm các nội dung tương tự trên trang chủ cá nhân hóa của bạn và nhận các bản cập nhật qua email.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Verge: AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.