The Decoder: AI News
85

Tin ngành

Tòa án Delhi bác bỏ yêu cầu cấm OpenAI của hãng tin ANI về vấn đề bản quyền

(giờ Việt Nam)

Tóm tắt AI

Tòa án Delhi từ chối lệnh cấm tạm thời đối với OpenAI, khẳng định ANI không chứng minh được việc sao chép trái phép và nhấn mạnh lợi ích công cộng của AI trong giáo dục, nghiên cứu.

Bản dịch AI

Trong một phán quyết tạm thời, Tòa án cấp cao Delhi đã bác bỏ yêu cầu của hãng tin Ấn Độ Asian News International (ANI) về việc áp dụng lệnh cấm sơ bộ đối với OpenAI.

ANI, một trong những hãng tin lớn nhất Ấn Độ, đã kiện OpenAI vì sử dụng tài liệu có bản quyền để huấn luyện AI và trong các kết quả đầu ra của ChatGPT. Thẩm phán Amit Bansal đã từ chối các yêu cầu cứu xét đối với cả hai cáo buộc này.

Quyết định này đề cập đến vấn đề ghi nhớ (memorization), Truy xuất tăng cường thế hệ (RAG) và tình trạng pháp lý của việc huấn luyện AI. Chuyên gia luật bản quyền AI Andres Guadamuz gọi đây là một chiến thắng sớm quan trọng đối với OpenAI.

Bằng chứng của ANI làm suy yếu các tuyên bố về bản quyền của họ

ANI đã đệ trình lên tòa án một số kết quả đầu ra của ChatGPT mà họ cho là bản sao đáng kể từ các bài báo của mình. Động thái này đã phản tác dụng vì OpenAI chứng minh được rằng các mô hình được sử dụng, GPT-4 và GPT-4o, được huấn luyện trên dữ liệu từ tháng 4 năm 2022 và tháng 4 năm 2024. Các bài báo mà ANI trích dẫn phần lớn là từ tháng 8 và tháng 9 năm 2024, vì vậy chúng không thể là một phần của dữ liệu huấn luyện.

Quan điểm sơ bộ của thẩm phán là những điểm tương đồng xuất phát từ RAG, công nghệ cho phép mô hình ngôn ngữ truy xuất thông tin trực tuyến theo thời gian thực, giống như một công cụ tìm kiếm. ANI đã không đề cập đến RAG trong đơn kiện của mình, vì vậy tòa án không thể đưa ra phán quyết cuối cùng về vấn đề này. Thẩm phán cho biết các kết quả đầu ra dựa trên RAG có thể được coi là "truyền đạt đến công chúng", một câu hỏi mà tòa án sẽ giải quyết trong các phiên tranh tụng chính.

Vụ kiện của ANI trở nên yếu thế hơn từ đó. Hãng tin này đã sử dụng các câu lệnh đối kháng (adversarial prompts), yêu cầu mô hình tái tạo các bài báo một cách "chính xác". Mặc dù vậy, ANI vẫn không thể đưa ra được một bản sao nguyên văn nào. Thẩm phán nhận thấy rằng các sự kiện trong các bài báo tin tức nói chung không thuộc đối tượng được bảo hộ bản quyền và việc tái tạo các chủ đề và tiêu đề không cấu thành hành vi cạnh tranh trực tiếp với ANI trong trường hợp này.

Các bằng chứng cũng không ủng hộ tuyên bố của ANI rằng OpenAI lưu trữ vĩnh viễn dữ liệu huấn luyện trong các mô hình của mình và có thể tái tạo nguyên văn tác phẩm của hãng tin này theo yêu cầu. Tuy nhiên, tòa án sẽ xem xét lại câu hỏi đó trong các phiên tranh tụng chính.

Tòa án tạm thời coi việc huấn luyện AI là sử dụng hợp lý (fair use)

ANI cũng không chứng minh được rằng việc sao chép tác phẩm của họ để huấn luyện AI cấu thành hành vi vi phạm bản quyền. Cả hai bên đều đồng ý rằng OpenAI đã sử dụng nội dung của ANI trong quá trình huấn luyện, nhưng OpenAI lập luận rằng tài liệu này chỉ chiếm một phần rất nhỏ trong tổng tập dữ liệu và mô hình chỉ trích xuất các yếu tố phi biểu đạt như ngữ pháp, cú pháp và các mô hình ngôn ngữ.

Thẩm phán đã xem xét các ngoại lệ theo luật bản quyền của Ấn Độ và dựa vào một điều khoản bao gồm "sử dụng cá nhân hoặc riêng tư, bao gồm cả nghiên cứu", với cách hiểu "nghiên cứu" đủ rộng để bao hàm cả việc huấn luyện AI.

Để ngoại lệ đó có hiệu lực, thẩm phán đã đặt ra các điều kiện. Các bản sao dùng để huấn luyện phải đến từ các nguồn hợp pháp, không phải từ các thư viện bóng tối (shadow libraries) hoặc các trang web yêu cầu trả phí mà không được phép. OpenAI cũng chưa bao giờ công khai các bản sao huấn luyện này và chỉ xử lý chúng trong nội bộ. Guadamuz cho biết đây là lần đầu tiên một tòa án xác định rõ ràng rằng việc huấn luyện AI thuộc ngoại lệ sử dụng cá nhân.

Tòa án đã thực hiện bài kiểm tra tính công bằng ba phần và đứng về phía OpenAI trong cả ba điểm. Việc OpenAI sử dụng các tác phẩm của ANI chỉ giới hạn ở mục đích huấn luyện, vì không có bằng chứng về việc ghi nhớ hay sao chép. ANI cũng không thể chứng minh được thiệt hại kinh tế vì hai công ty hoạt động trong các lĩnh vực khác nhau. Ngay cả khi người dùng hỏi ChatGPT về các tiêu đề của ANI, mô hình chỉ trả về các chủ đề và cùng lắm là một vài tiêu đề bài báo.

Thẩm phán đã trích dẫn các vụ kiện tại Hoa Kỳ bao gồm Bartz v. Anthropic và Kadrey v. Meta, nơi các kết quả đầu ra của mô hình ngôn ngữ được coi là có tính biến đổi (transformative). Ông cũng chỉ ra phán quyết trước đó về Google Books.

Thẩm phán cũng nhận thấy rằng các mô hình ngôn ngữ được huấn luyện giúp cải thiện khả năng tiếp cận thông tin, hỗ trợ giáo dục, thúc đẩy nghiên cứu khoa học, hỗ trợ phát triển phần mềm, cho phép dịch thuật và tạo ra các công cụ cho người khuyết tật.

Các vụ kiện bản quyền AI quốc tế mang lại bức tranh đa chiều

Phán quyết tại Delhi gia nhập danh sách ngày càng tăng các quyết định của tòa án trên toàn thế giới với những kết luận trái ngược nhau. Tại Hoa Kỳ, một thẩm phán đã bác bỏ vụ kiện do Raw Story và AlterNet đệ trình chống lại OpenAI vì các nguyên đơn không thể chứng minh đủ thiệt hại và khả năng tạo ra các bản sao chính xác là rất thấp. Tòa án đó cũng khẳng định rằng các sự kiện không thuộc đối tượng được bảo hộ bản quyền.

Vụ kiện GitHub Copilot cũng thất bại khi các nguyên đơn không thể đưa ra được một ví dụ nào về mã nguồn giống hệt nhau. Mặt khác, The Intercept đã giành được một phần chiến thắng thông qua khiếu nại DMCA về tài liệu có bản quyền đã bị xóa trước khi huấn luyện.

Trong vụ Ross Intelligence v. Thomson Reuters, tòa án đã từ chối áp dụng "sử dụng hợp lý" vì công cụ nghiên cứu AI cạnh tranh trực tiếp với cơ sở dữ liệu pháp lý Westlaw của Thomson Reuters, khiến việc sử dụng này không mang tính biến đổi. Tòa án nhấn mạnh rằng phán quyết này chỉ áp dụng cho trường hợp sử dụng phi tạo sinh này và không thể mở rộng cho các mô hình ngôn ngữ lớn.

Trong vụ kiện Anthropic, một tòa án liên bang ở San Francisco gọi việc huấn luyện AI bằng các tác phẩm có bản quyền là "cực kỳ" mang tính biến đổi, một tín hiệu mạnh mẽ ủng hộ "sử dụng hợp lý". Tuy nhiên, tòa án đã đưa ra "sự so sánh với Napster" vì Anthropic đã sử dụng sách lậu từ các thư viện bóng tối làm dữ liệu huấn luyện. "Sử dụng hợp lý" không bao gồm các tài liệu thu được bất hợp pháp. Sau đó, Anthropic đã trả 1,5 tỷ USD cho các tác giả sách vì sử dụng các bản sao lậu đó.

Văn phòng Bản quyền Hoa Kỳ đã bác bỏ lập luận của ngành công nghiệp AI rằng việc huấn luyện trên "kho tàng khổng lồ các tác phẩm có bản quyền" được coi là sử dụng hợp lý trên diện rộng. Quan chức viết báo cáo này đã bị chính quyền Trump sa thải ngay sau khi nó được công bố.

Tại châu Âu, hai tòa án đã đưa ra các kết luận trái ngược nhau gần như cùng lúc. Tòa án khu vực Munich trong vụ GEMA đã phán quyết rằng lời bài hát có thể tái tạo trong trọng số của mô hình, khiến nó trở thành một hành vi sao chép liên quan đến bản quyền. Tòa án cấp cao ở London đã bác bỏ vụ kiện Getty Images v. Stability AI, phán quyết rằng một mô hình AI không phải là một "bản sao vi phạm". Các nghiên cứu mới cho thấy các mô hình ngôn ngữ có thể ghi nhớ sách có bản quyền có thể làm gia tăng thêm cuộc tranh luận về vấn đề ghi nhớ.

Trong tất cả các vụ kiện này, những câu hỏi cốt lõi vẫn chưa được giải quyết. Các mô hình AI có lưu trữ vĩnh viễn dữ liệu huấn luyện không? Việc huấn luyện có thể được coi là sử dụng hợp lý không? Ranh giới giữa dữ liệu thu được hợp pháp và bất hợp pháp nằm ở đâu? Và các bản sao được tạo ra thông qua các câu lệnh đối kháng có phản ánh việc sử dụng bình thường không?

AI và truyền thông đối mặt với vấn đề vượt xa bản quyền

Ngoài bản quyền, một câu hỏi khác đang đe dọa ngành truyền thông. Ngay cả khi tòa án phán quyết rằng việc huấn luyện AI là hợp pháp, các sản phẩm tìm kiếm dựa trên AI vẫn có thể làm sụp đổ thị trường tin tức. Một nghiên cứu gần đây của Trung tâm Nghiên cứu Pew cho thấy tỷ lệ nhấp vào các trang web bên ngoài giảm xuống chỉ còn 8% với AI Overviews của Google, so với 15% khi không có tóm tắt bằng AI. Người dùng có xu hướng ngừng tìm kiếm ngay sau khi nhận được phản hồi từ AI. Họ không kiểm tra các nguồn khác.

Đối với các hãng tin như ANI, điều này có nghĩa là các hệ thống AI tóm tắt tin tức và khiến việc nhấp vào nguồn gốc trở nên không cần thiết có thể làm xói mòn mô hình kinh doanh của ngành theo thời gian, ngay cả khi không có hành vi vi phạm bản quyền trực tiếp.

Tòa án khu vực Munich I gần đây cũng phán quyết rằng Google phải chịu trách nhiệm trực tiếp về các tuyên bố sai lệch trong các bản tóm tắt AI của mình, vì chúng được coi là nội dung độc lập thay vì kết quả tìm kiếm. Trách nhiệm pháp lý hạn chế vốn bảo vệ các nhà điều hành công cụ tìm kiếm không áp dụng cho các bản tóm tắt do AI tạo ra.

Phán quyết đó cũng có thể trở nên liên quan đến các phản hồi dựa trên RAG của ChatGPT. Khi các hệ thống AI tóm tắt tin tức và đưa ra các tuyên bố độc lập, các nhà điều hành của chúng thực sự trở thành nhà cung cấp truyền thông, với tất cả các trách nhiệm pháp lý đi kèm. Sự thay đổi đó cũng có thể buộc các tòa án phải xem xét lại vấn đề sử dụng hợp lý. Một yếu tố then chốt trong bài kiểm tra tính công bằng là liệu sản phẩm mới có cạnh tranh với các tác phẩm mà nó được huấn luyện hay không. Nếu các bản tóm tắt AI thay thế nhu cầu truy cập các trang tin tức, các thẩm phán có thể khó đưa ra phán quyết rằng việc sử dụng này không mang tính cạnh tranh.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay

OpenAIBản quyền AIPháp lý AITin tức AIHuấn luyện mô hình
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.