← Về bảng nóng
SỰ KIỆNĐã lắng xuống

Bản tóm tắt vụ kiện của NYT tiết lộ: Các lãnh đạo Microsoft cho rằng việc thu thập dữ liệu AI là vụ trộm cắp lao động quy mô lớn nhất trong lịch sử nhân loại

Tổng quan sự kiện

Toàn cảnh do AI tổng thuật

Các tài liệu mới được giải mật trong vụ kiện bản quyền giữa The New York Times với OpenAI và Microsoft đã lộ diện. Theo TechCrunch, Hacker News và các nguồn tin khác, những tài liệu chưa qua chỉnh sửa tiết lộ rằng các giám đốc điều hành của Microsoft từng gọi cách làm của hai công ty trong việc huấn luyện AI là "hành vi trộm cắp", trong khi lãnh đạo OpenAI thừa nhận các mô hình của họ gây ra "mối đe dọa sinh tồn" đối với các nhà xuất bản và nhà báo có tác phẩm được sử dụng để huấn luyện. Tài liệu cũng mô tả chi tiết các thủ thuật như vượt qua tường phí (paywall) mà không bị phát hiện, xây dựng tập dữ liệu huấn luyện thông qua cào dữ liệu quy mô lớn, và loại bỏ các thông báo bản quyền khỏi dữ liệu huấn luyện. Lần đầu tiên, tài liệu tiết lộ rằng chỉ riêng tập dữ liệu huấn luyện trung hạn của OpenAI đã chứa hơn 91.692 bản sao các tác phẩm có bản quyền từ The New York Times, Daily News và Trung tâm Báo chí Điều tra. Một tập dữ liệu bắt nguồn từ Common Crawl chứa hơn 2 triệu tài liệu từ nytimes.com; dữ liệu của Project Mango đã được biên soạn thành tập dữ liệu huấn luyện chứa ít nhất 160.903 bản sao các tác phẩm độc quyền từ các nhà xuất bản tin tức. Trong một bản ghi nhớ nội bộ vào tháng 1 năm 2023, Brent Hecht, Giám đốc bộ phận Khoa học Ứng dụng của Microsoft, đã gọi đây là "vụ trộm quy mô lớn chưa từng có" và là "vụ trộm sức lao động lớn nhất trong lịch sử nhân loại".

Tài liệu cũng trích dẫn dữ liệu của chính Microsoft: "công cụ trả lời" Copilot của họ khiến tỷ lệ nhấp vào tên miền của The New York Times giảm tới 93% so với tìm kiếm Bing truyền thống. Trong một bài thuyết trình nội bộ vào tháng 1 năm 2024, Hecht mô tả sự sụt giảm này là một "vòng lặp hủy diệt" (doom loop), sẽ "đồng thời làm tổn hại hiệu suất của các mô hình của chúng ta và toàn bộ mạng lưới". CEO Satya Nadella của Microsoft trong lời khai đầu năm nay cho biết "bất kỳ nội dung nào sau tường phí đều nên được cấp phép", đồng thời khẳng định nếu biết trước OpenAI cào và huấn luyện thông tin từ sau tường phí, ông sẽ thực thi quyền của Microsoft để yêu cầu OpenAI huấn luyện lại mô hình. Nick Turley, người đứng đầu bộ phận ChatGPT của OpenAI, đã viết trong một thông tin liên lạc nội bộ rằng các nhà xuất bản đang đối mặt với "mối đe dọa sinh tồn" từ các sản phẩm như chatbot, vốn "có tính thay thế cao" và "sẽ ngày càng thay thế mạnh mẽ hơn khi chúng trở nên tốt hơn".

Ars Technica đưa tin, các tổ chức tin tức cáo buộc trong đơn kiện rằng Microsoft đã vi phạm "quy chuẩn ngành" khi bán các tập dữ liệu vốn được mua cho Bing để làm dữ liệu huấn luyện cho OpenAI mà không tham khảo ý kiến của các tổ chức tin tức. Họ cũng cáo buộc OpenAI đã lấy tập dữ liệu gồm 1,8 triệu bài báo của The New York Times từ bên thứ ba vốn bị ràng buộc bởi các thỏa thuận không được sử dụng cho mục đích thương mại; nhân viên OpenAI biết rằng việc sử dụng dữ liệu này để "huấn luyện mô hình là không phù hợp" nhưng vẫn thực hiện. The Verge đưa tin, người phát ngôn của Microsoft là Alex Haurek phản hồi rằng những phát biểu của Hecht "phản ánh quan điểm cá nhân của một nhân viên, không phải là phân tích pháp lý và không đại diện cho quan điểm của công ty". Một đại diện của OpenAI thừa nhận ông "không biết" về bất kỳ nỗ lực nào nhằm phát hiện hoặc loại bỏ nội dung sau tường phí trong dữ liệu huấn luyện. TechCrunch cho biết OpenAI và Microsoft chưa phản hồi yêu cầu bình luận.

The Decoder đưa tin, các nguyên đơn bao gồm The New York Times, tập đoàn Daily News, Ziff Davis, Trung tâm Báo chí Điều tra và The Intercept đã đệ trình bản tóm tắt phán quyết rút gọn chung dài 92 trang lên tòa án liên bang New York, yêu cầu bồi thường hàng tỷ USD. Bản tóm tắt này thuộc vụ kiện đa khu vực được hợp nhất, bắt đầu từ vụ kiện do The New York Times khởi xướng vào tháng 12 năm 2023.

Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T7 · 19/09 · 05:05.

Diễn biến mới nhất

Nhiều công ty truyền thông, bao gồm The New York Times, đã đệ trình bản tóm tắt phán quyết rút gọn chung dài 92 trang lên tòa án liên bang New York, yêu cầu bồi thường hàng tỷ USD. Bản tóm tắt này là một phần của vụ kiện đa khu vực được hợp nhất, bắt nguồn từ vụ kiện của The New York Times vào tháng 12 năm 2023.

Dòng thời gian đưa tin

Đang hiện 9 bài · tất cả · mới trước

CN · 20/09

  1. Bản tóm tắt vụ kiện của NYT tiết lộ: Các lãnh đạo Microsoft cho rằng việc thu thập dữ liệu AI là vụ trộm cắp lao động quy mô lớn nhất trong lịch sử nhân loại

    Hacker News: AI bài nổi bật

    Trong vụ kiện bản quyền chống lại OpenAI và Microsoft, tờ The New York Times đã đệ trình bản tóm tắt pháp lý yêu cầu phán quyết tóm tắt. Tài liệu này trích dẫn các văn bản nội bộ của bị đơn, trong đó mô tả việc thu thập dữ liệu AI là "vụ trộm cắp lao động quy mô lớn nhất trong lịch sử nhân loại", đồng thời lãnh đạo bộ phận ChatGPT của OpenAI cũng thừa nhận ChatGPT là "mối đe dọa sinh tồn" đối với các nhà xuất bản.

    Đọc bài gốc ↗

T7 · 19/09

  1. Các tài liệu được giải mật từ vụ kiện của New York Times cho thấy OpenAI và Microsoft từ lâu đã tự nhận thức được rằng họ đang khởi tạo một "vòng lặp diệt vong" (doom loop) gây nguy hại cho toàn bộ mạng lưới internet

    The Verge: AI

    Các tài liệu dài 92 trang mới được giải mật trong vụ kiện giữa The New York Times với OpenAI và Microsoft cho thấy, cả hai công ty đã sớm ghi nhận nội bộ rằng chiến lược nội dung AI của họ sẽ tạo ra một "vòng lặp hủy diệt" (doom loop), gây tổn hại cho chính các mô hình của họ và toàn bộ mạng lưới.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

T6 · 18/09

  1. The New York Times và các đơn vị truyền thông khác đã đệ trình kiến nghị phán quyết tóm tắt, viện dẫn các phát ngôn nội bộ của lãnh đạo OpenAI và Microsoft để thách thức lập luận "sử dụng hợp lý" (fair use)

    The Decoder: AI News

    The New York Times, tập đoàn Daily News, Ziff Davis và các công ty truyền thông khác đã đệ trình kiến nghị phán quyết tóm tắt dài 92 trang lên tòa án liên bang New York, yêu cầu OpenAI và Microsoft bồi thường hàng tỷ USD vì vi phạm bản quyền trong huấn luyện AI, đồng thời viện dẫn các email nội bộ và lời khai tuyên thệ chưa từng được công bố trước đó.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. Tài liệu mới được giải mật trong vụ kiện giữa The New York Times với OpenAI và Microsoft: Giám đốc điều hành Microsoft gọi việc thu thập dữ liệu AI là "vụ trộm sức lao động lớn nhất trong lịch sử nhân loại"

    Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)

    Tài liệu mới được giải mật trong vụ kiện bản quyền giữa The New York Times với OpenAI và Microsoft cho thấy, Giám đốc Khoa học Ứng dụng của Microsoft, Brent Hecht, trong một bản ghi nhớ nội bộ tháng 1 năm 2024 đã gọi việc thu thập dữ liệu AI là "vụ trộm sức lao động lớn nhất trong lịch sử nhân loại", trong khi Nick Turley của OpenAI thừa nhận sản phẩm của họ gây ra "mối đe dọa sinh tồn" đối với các nhà xuất bản.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. Tài liệu mới được giải mật trong vụ kiện giữa The New York Times với OpenAI và Microsoft tiết lộ các lãnh đạo cấp cao thừa nhận việc AI thu thập dữ liệu là vụ trộm cắp lao động lớn nhất trong lịch sử

    Hacker News: AI bài nổi bật

    Các tài liệu được giải mật trong vụ kiện bản quyền của The New York Times chống lại OpenAI và Microsoft tiết lộ rằng lãnh đạo Microsoft, Brent Hecht, gọi việc AI thu thập dữ liệu là vụ trộm cắp lao động lớn nhất lịch sử, trong khi các lãnh đạo OpenAI thừa nhận chatbot gây ra mối đe dọa sinh tồn cho các nhà xuất bản. Tài liệu cho thấy cả hai bên từng vượt qua bức tường phí để thu thập nội dung và loại bỏ thông báo bản quyền. Dữ liệu của Microsoft cho thấy Copilot khiến tỷ lệ nhấp vào tên miền The New York Times giảm tới 93%. Nadella làm chứng rằng nội dung sau bức tường phí cần được cấp phép và nếu biết trước, ông sẽ yêu cầu OpenAI huấn luyện lại mô hình.

    Đọc bài gốc ↗
  4. Tài liệu nội bộ của Microsoft và OpenAI bị rò rỉ: Các lãnh đạo từng cảnh báo AI gây ảnh hưởng hủy diệt đối với các cơ quan báo chí

    IT Home

    Trong vụ kiện bản quyền giữa The New York Times và các đơn vị khác với Microsoft và OpenAI, nhiều tài liệu nội bộ mật của hai bên đã được công khai. Giám đốc Microsoft, Brent Hecht, cho rằng việc sử dụng nội dung tin tức để huấn luyện AI là hành vi trộm cắp quy mô lớn chưa từng có, trong khi Nick Turley, người đứng đầu bộ phận ChatGPT tại OpenAI, cũng thừa nhận các sản phẩm AI có thể gây ra mối đe dọa hiện hữu đối với các nhà xuất bản.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  5. Hồ sơ vụ kiện của The New York Times cáo buộc OpenAI cố tình sao chép hàng loạt các bài báo có bản quyền dù biết rõ các nhà xuất bản đang bị đe dọa

    IT Home

    Hồ sơ vụ kiện mà The New York Times nộp vào thứ Năm cáo buộc OpenAI đã sao chép toàn bộ hàng triệu bài báo có bản quyền để huấn luyện mô hình mà không được phép, đồng thời vượt qua các bức tường phí để lấy nội dung, dù biết rõ sản phẩm AI gây ra mối đe dọa sinh tồn cho các nhà xuất bản. Vụ kiện yêu cầu bồi thường hàng tỷ USD. Tài liệu trích dẫn dữ liệu nội bộ của Microsoft cho thấy công cụ trả lời AI khiến tỷ lệ nhấp của người dùng vào nội dung gốc giảm từ 83% đến 93%. Trong khi đó, OpenAI lập luận rằng việc huấn luyện thuộc phạm vi sử dụng hợp lý, và cả OpenAI lẫn Microsoft đều đã đưa ra phản hồi hoặc phủ nhận các cáo buộc liên quan.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  6. Một lãnh đạo của Microsoft từng gọi việc thu thập dữ liệu AI là "vụ trộm cắp lao động quy mô lớn nhất trong lịch sử nhân loại", News Corp dựa vào đó để thúc đẩy các yêu cầu khởi kiện

    Ars Technica: AI

    Trong đơn kiện, News Corp cáo buộc Microsoft đã bán lại các tập dữ liệu mua cho Bing cho OpenAI để làm dữ liệu huấn luyện, đồng thời OpenAI đã lấy tập dữ liệu của NYT gồm 1,8 triệu bài báo từ bên thứ ba vốn bị ràng buộc bởi các thỏa thuận hạn chế thương mại để phục vụ việc huấn luyện. Phía nguyên đơn trích dẫn các tài liệu nội bộ của Microsoft thừa nhận AI tạo sinh gây ra "rủi ro thực sự" đối với việc làm của những người tạo ra dữ liệu huấn luyện, đồng thời lập luận rằng nếu tòa án xác định việc thu thập tin tức không thuộc phạm vi sử dụng hợp lý, điều này có thể phá vỡ "thế lưỡng nan của người tù" khi các công ty AI đua nhau sử dụng dữ liệu miễn phí.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  7. Các tài liệu được giải mật trong vụ kiện giữa The New York Times với OpenAI và Microsoft tiết lộ việc thu thập dữ liệu AI được gọi là vụ trộm cắp lao động lớn nhất trong lịch sử

    TechCrunch: AI

    Các tài liệu mới được giải mật trong vụ kiện bản quyền giữa The New York Times với OpenAI và Microsoft tiết lộ rằng, trong một bản ghi nhớ nội bộ, lãnh đạo Brent Hecht của Microsoft đã gọi việc thu thập dữ liệu AI là "vụ trộm cắp lao động quy mô lớn nhất trong lịch sử nhân loại", trong khi lãnh đạo Nick Turley của OpenAI cũng thừa nhận các chatbot gây ra "mối đe dọa hiện hữu" đối với các nhà xuất bản.

    Đọc bài gốc ↗

Sự kiện liên quan

← Về bảng nóng

Hồ sơ sự kiện được gom từ nhiều nguồn đưa tin độc lập rồi dịch, tóm tắt sang tiếng Việt. Bản quyền từng bài viết thuộc về cơ quan báo chí gốc. Nguồn dữ liệu: hồ sơ gốc trên AI HOT

Bản tóm tắt vụ kiện của NYT tiết lộ: Các lãnh đạo Microsoft cho rằng việc thu thập dữ liệu AI là vụ trộm cắp lao động quy mô lớn nhất trong lịch sử nhân loại — Hồ sơ sự kiện | AIHOT.vn