Thủ thuật
Dùng sách có bản quyền để huấn luyện AI: Ranh giới pháp lý mong manh
(giờ Việt Nam)
Tóm tắt AI
Việc dùng sách có bản quyền để huấn luyện AI vẫn là vùng xám pháp lý tại Mỹ. Dù tòa án coi việc huấn luyện là 'đọc' thay vì 'sao chép', các vụ kiện về 'sử dụng hợp lý' vẫn đang tạo ra những tiền lệ phức tạp cho ngành công nghệ.
Bản dịch AI

Có lẽ đến giờ bạn đã biết rằng các mô hình AI vận hành ChatGPT, Gemini, Claude và các chatbot khác đều được huấn luyện trên những cơ sở dữ liệu dường như vô tận gồm các tác phẩm đã xuất bản, chứa hàng trăm triệu cuốn sách, bài báo trực tuyến, tài liệu học thuật và về cơ bản là bất cứ thứ gì bạn có thể tìm thấy trên internet. Hầu hết các tác giả đã xuất bản, mà không hề hay biết hoặc không có sự đồng ý, đã góp phần vào việc phát triển chính những công cụ AI đang đe dọa làm suy yếu sinh kế của họ. Điều đó nghe có vẻ bất hợp pháp, phải không?
Thực tế không đơn giản như vậy.
“Tôi nghĩ một trong những vấn đề của toàn bộ lĩnh vực luật pháp và công nghệ này là có quá nhiều thứ đang diễn ra,” Cathy Gellis, một luật sư có chuyên môn về sở hữu trí tuệ, bản quyền và công nghệ, chia sẻ với TechCrunch. “Nó rất phức tạp và có rất nhiều cảm xúc trái chiều về những gì đang xảy ra, cả ủng hộ lẫn phản đối.”
Năm ngoái, trong một trong những phán quyết đầu tiên thuộc loại này, Thẩm phán William Alsup đã ra lệnh cho Anthropic phải trả khoản dàn xếp bản quyền khổng lồ 1,5 tỷ USD cho một nhóm các nhà văn có tác phẩm được sử dụng để huấn luyện các mô hình AI của công ty. Nhìn bề ngoài, đây có vẻ là một chiến thắng về mặt đạo đức cho các tác giả, nhưng thực tế Thẩm phán Alsup đã phán quyết rằng việc huấn luyện AI của Anthropic là hợp pháp. Điều mà Alsup phạt Anthropic là vì đã sao chép lậu những cuốn sách này từ các thư viện bóng tối (shadow libraries) bất hợp pháp trên mạng.
“Giống như bất kỳ độc giả nào khao khát trở thành nhà văn, các LLM của Anthropic được huấn luyện trên các tác phẩm không phải để chạy đua và sao chép hay thay thế chúng — mà là để chuyển hướng và tạo ra một thứ gì đó khác biệt,” vị thẩm phán viết, so sánh cách một LLM tiếp nhận hàng nghìn tỷ từ ngữ với việc một nhà văn nghiên cứu văn học.
Gellis cho rằng phán quyết này có lợi hơn cho các công ty AI. Một khoản tiền phạt 1,5 tỷ USD có nghĩa lý gì đối với một công ty dự kiến đạt doanh thu hàng năm khoảng 200 tỷ USD vào năm 2028?
“Tôi nghĩ nhìn chung đây là tin tốt cho việc huấn luyện AI khi ông ấy xem xét những gì đang diễn ra và thực sự coi nó tương tự như việc đọc một tác phẩm có bản quyền thay vì sao chép một tác phẩm có bản quyền,” Gellis nói. “Luật bản quyền dựa trên việc sao chép, nhưng nó không dựa trên việc sử dụng tác phẩm, trải nghiệm tác phẩm, tiêu thụ tác phẩm hay đọc tác phẩm.”
Luật bản quyền đã không được cập nhật kể từ năm 1976, điều đó có nghĩa là các thẩm phán phải tìm cách diễn giải các hướng dẫn từ 50 năm trước khi đối mặt với các câu hỏi pháp lý có tiềm năng định hình tương lai của ngành công nghiệp AI.
“Mọi người hiện đang rất lo lắng vì luật pháp đang rất hỗn loạn, và đó là vì câu hỏi này,” Jason Henderson, Luật sư cấp cao và là người sáng lập IP & Media Practice tại JWL International, nói với TechCrunch. “Họ biết rằng mô hình AI đã được huấn luyện trên rất nhiều dữ liệu, và luật pháp vẫn chưa thực sự bắt kịp với câu hỏi đó.”
Những câu hỏi này thường xoay quanh luật sử dụng hợp lý (fair use) — cụ thể là liệu việc sử dụng một tác phẩm có bản quyền có đủ tính “chuyển đổi” (transformative) để được coi là hợp pháp hay không.
Sử dụng hợp lý là một ngoại lệ của luật bản quyền cho phép sử dụng các tài liệu có bản quyền mà không cần sự cho phép rõ ràng, bảo vệ khả năng bình luận và lặp lại các tác phẩm có bản quyền thông qua phê bình, nhại lại, giáo dục và các phương tiện khác. Các thẩm phán xem xét các yếu tố cụ thể khi quyết định liệu một thứ gì đó có phải là sử dụng hợp lý hay không, bao gồm mục đích và bản chất của tác phẩm, số lượng sử dụng và tác động của nó đối với thị trường.
“Bản quyền luôn hướng tới việc bảo vệ và phát triển thị trường,” Henderson lưu ý. “Các tòa án đang có những lập luận khá khác biệt [trong các vụ kiện về AI]. Xu hướng thắng thế là nếu bạn đang huấn luyện trên tài sản của người khác vì mục đích cạnh tranh trực tiếp, thì tòa án sẽ không ủng hộ… Nếu những gì bạn đang làm không cạnh tranh, thì tòa án có xu hướng tìm cách để cho rằng điều đó là ổn.”
Henderson đang đề cập đến một vụ kiện mà công ty truyền thông và công nghệ Thomson Reuters đã kiện công ty nghiên cứu Ross Intelligence vì hành vi sao chép nội dung của họ để xây dựng một nền tảng pháp lý dựa trên AI cạnh tranh.
“Việc sử dụng của Ross không mang tính chuyển đổi vì nó không có ‘mục đích xa hơn hoặc đặc điểm khác biệt’ so với của Thomson Reuters,” Thẩm phán Stephanos Bibas viết năm ngoái.
Trong vụ kiện đó, Thẩm phán Bibas quyết định rằng việc huấn luyện trên nội dung của Reuters để tạo ra một nền tảng mới cạnh tranh trực tiếp với họ không phải là sử dụng hợp lý. Mặc dù các tác giả có thể lập luận rằng các chatbot đang cạnh tranh với họ bằng cách sử dụng tác phẩm của họ để tạo ra các cuốn sách tổng hợp mới, nhưng lập luận đó vẫn chưa giành chiến thắng tại tòa.
Khi nói đến mối quan hệ giữa AI và bản quyền, Gellis thấy hữu ích khi thu hẹp những gì chúng ta thực sự đang thảo luận – cách chúng ta nghĩ về bản quyền liên quan đến huấn luyện AI khá khác biệt so với cách chúng ta nghĩ về việc đăng ký bản quyền cho nội dung do AI tạo ra.
Trong một vụ kiện, Thaler v. Perlmutter, tòa án đã phán quyết rằng nếu một tác phẩm được tạo ra 100% bởi AI, thì nó không thể được bảo hộ bản quyền, điều này mở ra một loạt rắc rối mới – làm thế nào chúng ta có thể chứng minh một cách chắc chắn liệu một tác phẩm có được tạo ra bằng AI hay không, và nếu có, làm thế nào để biết bao nhiêu phần trăm trong đó được tạo ra hoặc hỗ trợ bởi AI?
“Nếu bạn viết tiểu thuyết của mình trong [Microsoft] Word và chạy kiểm tra chính tả, chúng ta cảm thấy thoải mái với ý tưởng rằng Word không sở hữu cuốn tiểu thuyết của bạn,” Gellis nói. “[AI] đang buộc chúng ta phải xem xét một loạt các quyết định mà chúng ta đã lờ đi trong một thời gian.”
Hầu hết các công ty AI vẫn đang bị mắc kẹt trong các vụ kiện tụng đang chờ xử lý về những vấn đề này, điều đó có nghĩa là chúng ta sẽ không sớm có một giải pháp dứt điểm cho những vấn đề này.
“Những gì bạn đang thấy là các đợt tấn công mở đầu đang có ảnh hưởng, và chính ảnh hưởng đó có thể bị đảo ngược nếu các tòa án khác quyết định những điều khác biệt, và sẽ cần các giai đoạn kiện tụng sau này để tìm ra phán quyết nào sẽ chiếm ưu thế,” Gellis nói. “Nhưng trong lúc chờ đợi, tất cả các quyết định này đang định hình mọi thứ đang diễn ra. Sẽ là khá dại dột nếu các công ty AI phớt lờ chúng.”
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.


Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.