The Verge AI
85

Tin ngành

Các nhà toán học yêu cầu OpenAI minh bạch về nguồn dữ liệu huấn luyện

(giờ Việt Nam)

Tóm tắt AI

Sau những tranh cãi về việc sử dụng các nghiên cứu chưa công bố, OpenAI tiếp tục đối mặt với cáo buộc thiếu minh bạch và phi đạo đức trong cách thu thập dữ liệu toán học cho các mô hình AI của mình.

Bản dịch AI

Mathematicians want proof OpenAI didn’t use their work

Một nhà nghiên cứu khác đang thách thức OpenAI về nguồn dữ liệu thúc đẩy hàng loạt khám phá toán học đầy ấn tượng của công ty này. Chỉ vài ngày sau khi một cuộc tranh cãi gay gắt nổ ra về việc liệu các mô hình của công ty có được hưởng lợi từ những công trình chưa công bố hay không, một nhà toán học thứ hai đã lên tiếng cáo buộc gã khổng lồ AI này có hành vi phi đạo đức, "thiếu trung thực" và thiếu minh bạch về nguồn gốc dữ liệu huấn luyện của họ.

Trong một loạt bài đăng trên Mastodon, nhà toán học Andreas Thom đã bày tỏ lo ngại rằng những tương tác mà ông và các đồng nghiệp đã thực hiện với chatbot ChatGPT trước khi OpenAI đưa ra thông báo đầy tự hào có thể đã góp phần vào thành công của nó trong lĩnh vực này. Một trong 10 kết quả mà OpenAI công bố rầm rộ vào tháng trước liên quan đến lĩnh vực chuyên môn của Thom, cái gọi là nhóm non-sofic, và OpenAI thừa nhận rằng kết quả của họ dựa phần lớn vào công trình trước đó của Thom và nhà toán học đồng nghiệp Gábor Kun.

Thom cho biết ông bắt đầu suy ngẫm về những tương tác của chính mình với OpenAI sau khi Tristan Buckmaster, một giáo sư toán học tại Đại học New York, công khai đặt câu hỏi liệu các mô hình AI của công ty có được hưởng lợi từ việc ông sử dụng Codex của OpenAI hay không. Sau khi OpenAI công bố kết quả về nhóm non-sofic, công ty đã bị chỉ trích rộng rãi trong giới toán học vì không ghi nhận những đóng góp gần đây của Thom và Kun, buộc công ty phải âm thầm sửa đổi bài viết của mình. Nhóm non-sofic, nói một cách đơn giản, là các cấu trúc toán học vô hạn không thể được xấp xỉ bởi các cấu trúc hữu hạn.

Thom cho biết ông cũng bị ấn tượng bởi "khả năng nắm bắt chi tiết các kỹ thuật của chúng tôi từ OpenAI", điều mà ông cho rằng không phải là con đường rõ ràng nhất hay hứa hẹn nhất để đi đến lời giải vào thời điểm đó. Ông cho biết mình đã viết email cho các nhà nghiên cứu của OpenAI là Sébastien Bubeck và Mark Sellke (cũng là một nhà thống kê tại Harvard) để hỏi liệu các tương tác của ông với ChatGPT có "nằm trong dữ liệu huấn luyện hoặc có thể truy cập được bởi quá trình suy luận" hay không và do đó có thể đã góp phần vào kết quả này.

Tuy nhiên, câu trả lời không làm Thom hài lòng. Ông cho rằng câu trả lời chỉ giải quyết vấn đề liệu các cuộc trò chuyện của ông với chatbot có thể được truy cập trực tiếp hay không, chứ không phải liệu chúng có lọt vào các kho dữ liệu huấn luyện khổng lồ mà công ty sử dụng để cải thiện mô hình của mình hay không. "Không có sự làm rõ, giải thích hay bằng chứng nào được đưa ra," ông viết. "Tôi coi đây là sự thiếu trung thực, nếu nói một cách nhẹ nhàng nhất."

Thom cho biết các nhà nghiên cứu không đủ khả năng để kỹ thuật đảo ngược (reverse-engineer) quy trình huấn luyện của OpenAI nhằm xác định xem công trình của họ có bị sử dụng hay không. "Chỉ OpenAI mới có dữ liệu liên quan cho việc đó." Nếu công ty định phủ nhận điều này, ông cho rằng trách nhiệm thuộc về họ trong việc chứng minh bằng cách công khai tất cả các tập dữ liệu cần thiết và làm rõ các cài đặt cũng như điều khoản quy định cách thức họ sử dụng dữ liệu.

Sự miễn cưỡng của OpenAI trong việc loại trừ hoàn toàn khả năng sử dụng dữ liệu người dùng phản ánh cách họ bảo vệ bước đột phá về Giải thưởng Thiên niên kỷ (Millennium Prize) gần đây, cả trong thông điệp công khai lẫn các trao đổi với Buckmaster — người đang nghiên cứu các vấn đề này cùng với nhà nghiên cứu Levent Alpöge của Anthropic với tư cách cá nhân. Trong bài đăng trên blog công bố lời giải cho bài toán Navier-Stokes liên quan đến chuyển động của chất lưu, OpenAI đã phủ nhận thẳng thừng việc sử dụng bất kỳ dữ liệu người dùng cụ thể nào: "Chúng tôi (các nhà nghiên cứu và các tác nhân AI) đã không nhìn thấy bất kỳ công trình nào của họ thông qua bất kỳ phương tiện nào cho đến khi họ công bố công khai — cụ thể là, không có dữ liệu người dùng cụ thể nào được truy cập để giải quyết vấn đề này."

Tuy nhiên, họ không loại trừ hoàn toàn ảnh hưởng gián tiếp: "Mặc dù khó xảy ra, chúng tôi không thể loại trừ khả năng dữ liệu đã được ẩn danh (de-identified) bắt nguồn từ việc họ sử dụng sản phẩm của chúng tôi đã giúp cải thiện các mô hình của chúng tôi." Thom cho biết đây chính là sự phân biệt gây nhiễu mà công ty đã sử dụng trong các trao đổi với ông. "Việc ẩn danh có thể xóa tên, nhưng nó không xóa đi nội dung trí tuệ của một ý tưởng toán học," ông nói.

Trước những sự kiện gần đây, Thom cho biết "Câu trả lời dứt khoát của Sellke, ít nhất, là quá rộng một cách vô căn cứ và gây hiểu lầm nghiêm trọng; nhìn lại thì đó rõ ràng là sự thiếu trung thực."

Thom cho biết "sẽ là không thể biện minh về mặt đạo đức" nếu các nghiên cứu không công khai do người dùng cung cấp lại giúp cải thiện các mô hình, để rồi sau đó công ty sử dụng chính các mô hình đó để chạy đua xuất bản với chính những người dùng đó mà không có sự đồng ý, công khai phù hợp hoặc ghi nhận công lao.

OpenAI đã không phản hồi ngay lập tức yêu cầu bình luận của The Verge.

Những bình luận của ông làm gia tăng sự bất an trong giới toán học đối với OpenAI vào thời điểm lẽ ra phải là khoảnh khắc vinh quang của công ty. Lời giải được công bố cho một trong những bài toán Giải thưởng Thiên niên kỷ huyền thoại của toán học là một thành tựu phi thường mà nếu được xác minh, ít ai có thể phủ nhận. Nhưng điều này trở nên phức tạp bởi những tình tiết bất thường mà OpenAI cho biết đã dẫn dắt họ theo đuổi vấn đề này ngay từ đầu: Họ nghe tin đồn trực tuyến rằng các nhà nghiên cứu khác đã đạt được tiến bộ lớn và nghĩ rằng mình cũng nên thử sức.

Sự việc đang diễn ra đã để lại dư vị không mấy tốt đẹp trong lòng các nhà toán học. Nhiều nhà nghiên cứu nói với The Verge rằng họ lo ngại hành vi như thế này sẽ đẩy lĩnh vực này vào trạng thái bí mật hơn nếu các nhà toán học biết rằng ngay cả những tin đồn về việc họ sắp đạt được bước đột phá lớn cũng có thể châm ngòi cho một cuộc chạy đua với một gã khổng lồ công nghệ giàu tài nguyên đang khao khát vinh quang.

Theo dõi các chủ đề và tác giả từ câu chuyện này để xem thêm các nội dung tương tự trên trang chủ cá nhân của bạn và nhận thông báo qua email.

Construction At The First Stargate AI Data CenterRobert Hart
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Verge AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.