Ngành
Thư viện Bodleian của Đại học Oxford bị lộ việc cung cấp dữ liệu cho OpenAI huấn luyện AI
(giờ Việt Nam)
Tóm tắt AI
Các tài liệu nội bộ tiết lộ OpenAI đã sử dụng hàng nghìn bản scan luận văn và tài liệu cổ từ thư viện Bodleian để huấn luyện mô hình, dù thông báo hợp tác trước đó không đề cập rõ ràng. Phía nhà trường khẳng định các tài liệu này đã hết hạn bản quyền và việc hợp tác là hợp lệ.
Chính văn · Bản dịch AI
IT ngày 26 tháng 9 đưa tin, theo tờ The Guardian của Anh, trong bối cảnh các công ty công nghệ lớn đang ráo riết tìm kiếm nguồn dữ liệu mới tại các cơ sở học thuật, Đại học Oxford đã cho phép OpenAI, nhà phát triển ChatGPT, sử dụng các tài liệu lịch sử từ Thư viện Bodleian để huấn luyện các mô hình trí tuệ nhân tạo của họ.
Lưu ý của IT: Thư viện Bodleian là thư viện nghiên cứu chính của Đại học Oxford, Anh, và là thư viện lớn thứ hai tại Vương quốc Anh, chỉ sau Thư viện Anh (British Library).
Một tài liệu nội bộ cho thấy các bộ sưu tập của Bodleian đã được OpenAI số hóa và sử dụng để "xây dựng tập dữ liệu huấn luyện cho OpenAI". Vào tháng 3 năm 2025, Đại học Oxford thông báo đạt được thỏa thuận hợp tác với công ty này, sử dụng phần mềm của OpenAI để số hóa các bộ sưu tập của thư viện nổi tiếng thế giới này.
Nhà trường lúc đó cho biết, động thái này sẽ giúp sinh viên và các nhà nghiên cứu tiếp cận tài liệu dễ dàng hơn. Tuy nhiên, thông báo hợp tác thời điểm đó không đề cập đến việc các tài liệu này sẽ được dùng để huấn luyện mô hình của OpenAI.
Một người phát ngôn của OpenAI cho biết, công ty rất vinh dự khi có thể góp phần giúp "các mô hình AI ngày nay bảo tồn những kho báu lịch sử và văn hóa nhân loại cho thế hệ mai sau".
Người phát ngôn này nói thêm: "Hiện nay, hơn một tỷ người trên toàn cầu đang sử dụng công nghệ này trong cuộc sống hàng ngày, vì vậy việc đảm bảo nó phản ánh đầy đủ các nền văn hóa, lịch sử và góc nhìn đa dạng là vô cùng quan trọng."
Một biên bản cuộc họp của Đại học Oxford thu thập được theo "Đạo luật Tự do Thông tin" cho thấy, các giảng viên và nhân viên, bao gồm cả thành viên Hội đồng quản trị Bodleian, đã bày tỏ lo ngại. Họ không chỉ lo lắng về rủi ro danh tiếng khi hợp tác với OpenAI, mà còn chỉ ra rằng công nghệ này tiêu tốn nhiều năng lượng, có thể gây ảnh hưởng tiêu cực đến các cam kết bảo vệ môi trường của chính trường đại học.
Trong khuôn khổ dự án mang tên "NextGenAI", OpenAI đã ký các thỏa thuận tương tự với nhiều thư viện nghiên cứu tại Mỹ, bao gồm Thư viện Công cộng Boston, Viện Công nghệ California (Caltech), Viện Công nghệ Massachusetts (MIT) và Đại học Michigan. Đại học Oxford là thành viên duy nhất tại Anh tham gia dự án này.
Tính đến tháng 6 năm 2025, Thư viện Bodleian đã cung cấp cho OpenAI 125.000 trang quét các luận án lịch sử, bao gồm các luận án tiến sĩ từ các trường đại học Âu Mỹ thế kỷ 19 đến 20. Các tài liệu đã quét khác bao gồm bộ sưu tập quý hiếm "Broadside Ballads" (nhạc dân gian đường phố) từ thế kỷ 16, với tổng cộng 10.000 bài, ghi lại lời ca và bản nhạc từng lưu truyền trên đường phố thời Tudor.
Ngoài ra, các giảng viên cũng đã thảo luận về các kế hoạch số hóa tiếp theo, liên quan đến hồ sơ quốc gia Ireland thế kỷ 18, thư từ cá nhân của tiểu thuyết gia người Ireland Maria Edgeworth, và các ghi chép thí nghiệm về nghiên cứu penicillin của Dorothy Hodgkin.
Nhà trường phủ nhận cáo buộc che giấu mục đích liên quan đến học máy với công chúng và sinh viên. Người phát ngôn cho biết, số hóa thực sự là nhu cầu cốt lõi của trường, nhưng các giảng viên luôn thừa nhận rõ ràng rằng dự án này đồng thời cung cấp dữ liệu huấn luyện cho các mô hình.
Người phát ngôn của Đại học Oxford cho biết: "Quy mô các tài liệu được số hóa thông qua hợp tác với OpenAI là có hạn và tất cả đều đã hết thời hạn bảo hộ bản quyền; hơn nữa, quyền sử dụng các tài liệu này của OpenAI là không độc quyền."
Thư viện Bodleian cũng bảo lưu quyền tự công bố các tài nguyên số hóa này. Trong vài tháng tới, thư viện sẽ dần dần cung cấp công khai bộ tài liệu này trên mạng, giống như cách chúng tôi thực hiện với các kết quả hợp tác số hóa khác. Trên thực tế, dự án này sẽ giúp Thư viện Bodleian tiếp cận được nhiều đối tượng công chúng hơn, cho phép những người vốn khó tiếp cận các tài liệu này có thể dễ dàng tra cứu.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.