Tin ngành
Hugging Face và bài học từ việc tái hiện 2.200 nghiên cứu tại ICML
(giờ Việt Nam)
Tóm tắt AI
Hugging Face chia sẻ những thách thức và bài học quan trọng sau khi nỗ lực tái hiện kết quả từ 2.200 bài báo khoa học tại hội nghị ICML, nhấn mạnh tầm quan trọng của tính minh bạch trong nghiên cứu AI.
Bản dịch AI
Quay lại các bài viết
Vào tháng 7 vừa qua, chúng tôi đã tổ chức một cuộc thi hackathon, nơi hơn 1.200 thành viên cộng đồng mang theo các coding agent của riêng họ và cố gắng tái lập các bài báo được công bố tại ICML 2026, kiểm chứng từng khẳng định một. Trong 19 ngày, những người tham gia đã xuất bản 6.816 nhật ký Trackio, tái lập thành công 2.226 bài báo, chiếm khoảng một phần ba số bài tại hội nghị 🤯
Trong bài viết này, chúng tôi chia sẻ những gì đã học được từ việc tổ chức hackathon này, và những điều đó gợi mở gì về vai trò của con người khi các agent thực hiện các thí nghiệm nghiên cứu.
Nhiều bài báo hơn mức bất kỳ ai có thể đánh giá
Những câu hỏi về việc nghiên cứu AI thực sự có thể tái lập đến mức nào đã xuất hiện từ trước làn sóng AI hiện nay. Nhưng những câu hỏi này càng trở nên trầm trọng hơn do quy mô. ICML 2026 đã nhận được 23.918 bài nộp và chấp nhận 6.352 bài, tăng gần gấp đôi so với năm trước, tiếp tục một xu hướng tăng trưởng theo cấp số nhân mà ít nhất một phần được thúc đẩy bởi các AI agent giúp tăng tốc độ thực hiện thí nghiệm và viết báo cáo.
Năng lực đánh giá không tăng theo kịp tốc độ đó. Người đánh giá tại hầu hết các hội nghị đều là tình nguyện viên, những người có thể không có đủ thời gian hoặc chuyên môn để đánh giá kỹ lưỡng một bài báo. Dưới đây là một đánh giá về một bài báo spotlight được chấp nhận tại ICML 2026, theo lời của chính người đánh giá:

"Điểm tự tin thấp của tôi là vì tôi đã không kiểm tra kỹ tất cả các chứng minh."
Lưu ý rằng bài báo này đã nhận được điểm số cao và được chọn làm spotlight. Hãy ghi nhớ điều này, vì chúng ta sẽ quay lại chính bài báo này sau trong bài viết, và xem điều gì đã xảy ra khi chúng tôi thực sự kiểm tra kỹ các chứng minh.
Tuy nhiên, điều đã thay đổi là chính công nghệ đang thúc đẩy làn sóng bài nộp cũng có thể giúp chúng ta theo kịp nó. Các coding agent như Claude Code, Codex, Cursor và Pi hiện có thể đọc một bài báo, viết mã, khởi chạy các thí nghiệm và báo cáo lại những gì chúng tìm thấy. Việc kiểm tra kỹ một bài báo trước đây từng khiến người đánh giá mất cả cuối tuần; một agent có thể thử làm điều đó trong một buổi chiều, thực hiện song song hàng nghìn lần.
Vì vậy, câu hỏi chúng tôi muốn đặt ra là: nếu chúng ta thực sự kiểm tra lại một hội nghị lớn ở quy mô rộng và cố gắng tái lập mọi bài báo, chúng ta sẽ tìm thấy điều gì?
Cuộc thi hackathon (15 tháng 7 - 2 tháng 8)
Thay vì tự mình kiểm định các bài báo, chúng tôi mở rộng cho toàn bộ cộng đồng, với tất cả sự đa dạng về khung agent, ngân sách tính toán và gu thẩm mỹ khoa học mà nó mang lại. Từ ngày 15 tháng 7 đến ngày 2 tháng 8 năm 2026, thử thách ICML 2026 Open Reproductions đã diễn ra như sau:
Những người tham gia nhận được 20 đô la tín dụng tính toán trên Hugging Face để chạy các thí nghiệm trên HF Jobs; trong suốt thử thách, người tham gia đã khởi chạy 2.962 tác vụ trên đám mây. Ở những nơi không thể tái lập hoàn toàn, ví dụ như khi tập dữ liệu của bài báo là độc quyền hoặc các checkpoint không được công bố, người tham gia đã chạy các bản tái lập mô phỏng trên dữ liệu tổng hợp bắt chước các đặc tính của dữ liệu gốc.
Đây là hình ảnh một bản tái lập hoàn chỉnh:

Xét về các con số, cuộc thi hackathon này có lẽ là nỗ lực tái lập lớn nhất đối với một hội nghị khoa học:
Những gì chúng tôi tìm thấy
Tổng hợp các kết luận ở cấp độ khẳng định cho mỗi bài báo:
51% số bài báo được kiểm tra (1.103 bài) có ít nhất một khẳng định được xác minh độc lập. Trong số đó, 266 bài báo được tái lập hoàn toàn với mọi khẳng định được trích xuất đều được xác minh, và 632 bài báo khác được tái lập một phần mà không có khẳng định nào bị bác bỏ. Tổng cộng, 3.978 khẳng định riêng lẻ đã được xác nhận bằng các thí nghiệm thực tế.
23% số bài báo được kiểm tra (496 bài) có ít nhất một khẳng định bị bác bỏ hoặc tranh cãi. Con số này bao gồm 49 bài báo mà tất cả các khẳng định đều bị bác bỏ và không có gì có thể xác minh được, và thú vị nhất có lẽ là 242 bài báo mà các nhóm tái lập độc lập đưa ra các kết luận trái ngược nhau về cùng một khẳng định. Khả năng tái lập không phải là nhị phân; nó mang tính đối kháng.
Số còn lại nằm ở giữa: 502 bài báo chỉ có bằng chứng ở quy mô mô phỏng, và 280 bài báo không thể xác lập được kết quả nào (thiếu các tệp dữ liệu/mã nguồn là nguyên nhân phổ biến nhất).
Những bản tái lập được thực hiện tốt
Một số bài báo đã vượt qua "cửa ải" một cách xuất sắc, và những nhật ký tốt nhất của cộng đồng rất đáng để đọc:
Những sự bác bỏ và điều đã xảy ra khi chúng tôi kiểm tra chúng
35 người tham gia đã chính thức tuyên bố họ đã bác bỏ được một điều gì đó. Chúng tôi đã xác minh lại một cách đối kháng mọi sự bác bỏ được tuyên bố: đọc lại bài báo, đọc lại nhật ký, và suy luận lại toán học hoặc triển khai lại thí nghiệm từ chính văn bản của bài báo.
Một vài trường hợp bác bỏ đã được xác nhận, kèm liên kết đến nhật ký tìm ra nó:
Bài báo về paging từ phần giới thiệu. Người đánh giá đã không kiểm tra kỹ các chứng minh? Bài báo "Towards Optimal Robustness in Learning-Augmented Paging" khẳng định thuật toán của họ đạt được độ bền $H_k + O(1)$. Nhật ký của một người tham gia đã đo được số hạng cộng thêm tăng theo $0.38 \ln k$ và xác định chính xác bước chứng minh bị lỗi. Việc triển khai lại của chúng tôi đã mở rộng phạm vi quét lên $k = 1.024$ và xác nhận sự tăng trưởng ở mức khoảng chín sigma. Độ bền thực sự là $H_k + \Theta(\log k)$.
Một định lý sụp đổ sau bước 224. "Attention's forward pass and Frank-Wolfe" chứng minh rằng các hạt token hội tụ về gốc tọa độ bất cứ khi nào gốc tọa độ nằm bên trong bao lồi của chúng. Ba nhóm độc lập đã tìm thấy các phản ví dụ, với các vi phạm xuất hiện lần đầu tại $t = 224, ~3.800$ và $6.416$ bước, điều này giải thích rõ ràng tại sao những người khác lại "xác minh" khẳng định đó: các kiểm tra ở phạm vi hữu hạn đã dừng lại quá sớm. Phản ví dụ rõ ràng nhất được nêu bằng số hữu tỉ chính xác, vì vậy không có sự mơ hồ nào về dấu phẩy động để ẩn nấp. Các tác giả đã xác nhận ngay trong ngày và đang tiến hành sửa lỗi.
Lý thuyết viết cho một hàm mất mát, kết quả tạo ra bởi một hàm khác. Trong "Self-Distillation Enables Continual Learning", phương trình trung tâm và toàn bộ phần lý thuyết của bài báo phân tích phân kỳ KL ngược, nhưng mã nguồn mặc định được công bố (theo các tác giả là đã tạo ra tất cả kết quả của bài báo) lại tính toán KL xuôi. Nhật ký bắt được lỗi này cũng không thể tái lập kết quả tăng +4pp như tiêu đề bài báo bằng mã và dữ liệu của chính tác giả. Các tác giả đã tải lên một phiên bản làm rõ lên arXiv.
Một đánh giá bị pha loãng bởi padding. Trong "Do Transformers Need Three Projections?", một người tham gia phát hiện ra rằng ~66% các vị trí nhãn được đánh giá là các token padding EOS, vốn được huấn luyện để đạt mức mất mát gần bằng 0, làm giảm độ phức tạp (perplexity) xuống khoảng ba lần. Kết quả "chi phí chất lượng 3,1% cho việc giảm 50% bộ nhớ đệm" trong phần tóm tắt trở thành khoảng 9,4% sau khi được hiệu chỉnh.
🚨 Bác bỏ sai. Đôi khi chúng tôi tìm thấy sai sót trong một nỗ lực tái lập. Một nhật ký tuyên bố đầy kịch tính: "phương pháp của bài báo chậm gấp 2 lần so với baseline"; hóa ra đây là một lỗi số học trong quá trình tái lập: so sánh thời gian trên mỗi quỹ đạo với thời gian trên mỗi batch 50. Khi được chuẩn hóa chính xác, dữ liệu của chính người tham gia lại xác nhận mức tăng tốc gấp 8 lần mà bài báo đã khẳng định.
Trao đổi với các tác giả
Chúng tôi đã bắt đầu viết thư cho các tác giả của mọi phát hiện đã được xác nhận, với một cách tiếp cận đơn giản: đây là những gì chúng tôi tìm thấy, đây là tất cả bằng chứng, bạn có đồng ý không hay phân tích của chúng tôi sai? Những phản hồi ban đầu rất tích cực:
Cho đến nay, các tác giả đã xác nhận các phát hiện trên nhiều bài báo, hai bản sửa lỗi trên arXiv đang được thực hiện, và trong một trường hợp, một tác giả đã âm thầm sửa lỗi trong một phiên bản arXiv mới một tháng trước khi thử thách tìm ra nó, điều mà chúng tôi coi là sự hội tụ độc lập 🤗
Vai trò của con người
Câu hỏi thú vị nhất mà cuộc thi hackathon này đặt ra là: con người còn vai trò gì trong việc đánh giá các bài báo không? Chúng tôi nghĩ là có, vì một số lý do:
Việc thực thi thuần túy bằng agent gặp phải những giới hạn thực tế. Các agent bị mắc kẹt trong các vòng lặp cục bộ, đọc sai hành vi phụ thuộc vào quy mô (một số kết luận "xác minh" trên bài báo paging đến từ các kiểm tra dừng lại trước khi sự tăng trưởng log-k trở nên rõ ràng), và đôi khi xây dựng toàn bộ sự bác bỏ dựa trên sự không khớp về đơn vị. Những kết quả đáng tin cậy nhất của thử thách đến từ các quy trình làm việc có sự điều hướng của con người: chỉ dẫn lại cho agent, đặt câu hỏi về một giả định, hoặc quyết định rằng tiền đề của một thí nghiệm là sai trước khi lãng phí cả tuần tính toán vào đó.
Một số đánh giá là không thể thay thế con người, ít nhất là lúc này. Người chiến thắng trong hạng mục "human-in-the-loop" (con người trong vòng lặp) là ví dụ rõ ràng nhất. Bài báo khẳng định khả năng tạo ảnh ổn định dưới mức lượng tử hóa cực đoan. Các chỉ số số học cho biết "không sụp đổ"; nhưng liệu các hình ảnh có thực sự sử dụng được hay không lại là một câu hỏi về cảm nhận. Agent đã xây dựng một giao diện đánh giá chuyên dụng, và con người đã đích thân đánh giá tất cả 128 cặp ảnh, với các chú thích được commit vào repo và agent xác thực tính nhất quán của chúng sau đó. Bản ghi của agent đã ghi lại toàn bộ quá trình trao đổi, từ việc người tham gia hỏi cách sử dụng công cụ đánh giá cho đến khi quay lại với câu trả lời: "Tôi đã xem qua các cặp ảnh và đưa file csv vào repo, vui lòng kiểm tra."
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.