Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Điểm AI 42/100

Hướng dẫn

Đạt 44% điểm ARC-AGI-1 với chi phí chỉ 67 cent: Cách tiếp cận tối ưu

(giờ Việt Nam)

Tóm tắt AI

Một bài viết trên Hacker News chia sẻ phương pháp đạt 44% điểm trong thử thách ARC-AGI-1 với chi phí cực thấp chỉ 67 cent, thu hút sự quan tâm lớn từ cộng đồng kỹ thuật.

Chính văn · Bản dịch AI

Tôi đã huấn luyện một mô hình transformer nhỏ từ đầu trong 1,5 giờ trên một chiếc 5090. Nó đánh bại nhiều LLM và đạt điểm số tương đương với TRM/HRM.

Đây là bản nâng cấp cho mô hình trước đó của tôi: nhanh hơn, tốt hơn, rẻ hơn và vẫn là mã nguồn mở.

Mô hình cũng đạt 7% trên ARC-2.

Thảo luận trên Twitter, mã nguồn trên github.

Đây là bài blog thứ 3 trong loạt bài về ARC-AGI. Bài trước: Blog 2, Blog 1.

Nhiều người từng nghĩ kết quả trước đó là không thể. Nó đã thu hút sự chú ý từ các nhà nghiên cứu hàng đầu và lan truyền mạnh mẽ trên X. Ví dụ: Các cuộc thảo luận của Lucas Beyer, Jeremy Howard, Rohan Anil và bình luận của nhiều người khác.

Tại sao lại thực hiện nghiên cứu này?

Tôi nghĩ hiệu quả mẫu (sample efficiency) là vấn đề quan trọng nhất trong AI hiện nay và tôi muốn giải quyết nó.

Mục đích đằng sau công trình này là (1) tìm ra giới hạn của hiệu quả mẫu khi bị giới hạn trong các transformer / các phương pháp học sâu ngày nay và (2) giảm chi phí để việc lặp lại (iteration) nhanh hơn và rẻ hơn nhiều.

ARC là một benchmark tuyệt vời để kiểm chứng điều này:

Tiếp theo, tôi sẽ làm việc với các ý tưởng nghiên cứu mới để phá vỡ những giới hạn này. Tôi sẽ cố gắng giữ chi phí thấp để bất kỳ ai trên thế giới cũng có thể tham gia nghiên cứu.

Nó hoạt động như thế nào?

Cách tiếp cận tổng thể tương tự như lần trước (chi tiết kỹ thuật đầy đủ tại đây), nhưng tôi đã thêm một loạt các nâng cấp. Dưới đây là tóm tắt nhanh về phương pháp:

Những thay đổi kể từ lần trước

Mục tiêu chính là tìm ra những cải tiến về kiến trúc / thuật toán giúp nâng cao hiệu quả mẫu của mô hình.

Những cải thiện lớn nhất về điểm số là nhờ:

Những cắt giảm lớn nhất về chi phí là nhờ:

Một thay đổi lớn là tôi không còn huấn luyện trên các input token nữa. Điều này có nghĩa là hàm mất mát (loss function) chỉ bao gồm các output token (khiến phương pháp này trở thành học có giám sát). Cách này hoạt động tốt hơn một chút, từ 40% lên 44%, nhưng tôi không hiểu tại sao. Có lẽ là do dung lượng mô hình hữu hạn.

Tôi cũng đã tăng dữ liệu huấn luyện bằng cách thêm các tác vụ không trùng lặp từ ARC-2. Tôi đã thực hiện việc này rất cẩn thận để đảm bảo không bị rò rỉ dữ liệu (leakage). Bạn có thể loại bỏ dữ liệu bổ sung nếu không thích và nó vẫn sẽ đạt khoảng 40%, nhưng sẽ cần gấp đôi tài nguyên tính toán.

Bối cảnh: ARC-2 chứa 773 câu đố từ ARC-1 và 347 câu đố mới. Hầu hết các câu đố đánh giá của ARC-1 đều bị lặp lại, vì vậy nếu bạn huấn luyện một cách ngây thơ trên ARC-2, đó sẽ là rò rỉ dữ liệu và bạn sẽ đạt 100%. Tôi tránh điều này bằng cách lọc cẩn thận 773 câu đố bị lặp lại (vì vậy không có rò rỉ!).

Có nhiều thay đổi khác mang lại những cải thiện nhỏ về hiệu suất hoặc tốc độ. Xem danh sách đầy đủ các thay đổi tại đây.

Hành vi thú vị

Vì tôi không còn huấn luyện trên input, phương pháp này hiện là học có giám sát. Điều kỳ lạ là test loss hiện tại tệ hơn, nhưng điểm số lại tốt hơn! Ngoài ra, nó ổn định hơn và ít biến động về điểm số hơn.

Nhiều người hiện nay đang nghiên cứu về hiệu quả mẫu bằng cách nhắm tới mức val loss thấp nhất trên một tập dữ liệu nhỏ. Tôi nghĩ điều đó rất tốt, nhưng điều này chỉ ra một chế độ thất bại (failure mode) trong cách tiếp cận như vậy.

Tôi thực sự nghĩ rằng kiểu huấn luyện không giám sát sẽ tốt hơn trong một số tình huống, và tôi đang đánh giá điều này.

Trước NorMuon, tôi đã thử vanilla Muon. Rõ ràng là nó huấn luyện nhanh hơn nhiều so với AdamW, nhưng loss (và điểm số) sẽ lình xình ở cuối thay vì hội tụ. Tôi thấy rằng việc giảm mạnh momentum và/hoặc LR tại thời điểm này đã giúp ích, nhưng tôi không muốn thực hiện các thay đổi thủ công như vậy. Khi tôi chuyển sang NorMuon, vấn đề đã biến mất.

Các thử nghiệm cắt bỏ (Ablations)

Đóng góp lớn nhất vào hiệu suất dường như là các biểu diễn tốt (3D RoPE + embedding theo từng tác vụ).

Những người khác có thể đóng góp như thế nào?

Mã nguồn là mã nguồn mở. Hãy thoải mái sửa đổi nó để cải thiện điểm số hoặc giảm chi phí. (Vui lòng không tăng dữ liệu huấn luyện).

Hãy thử đạt mức 65% – bạn sẽ không cần sửa đổi nhiều. Bằng chứng: Tôi đã lấy hợp của tất cả các tác vụ đã giải được từ nhiều lần chạy và đạt 55%. Ngoài ra, một loạt các tác vụ khác cũng "gần như" được giải quyết. Một vài ý tưởng:

Chi phí có thể giảm 10 lần với mã GPU viết tay. Có những thay đổi về kiến trúc cũng có thể làm được điều này.

Cuối cùng, hãy tìm cách loại bỏ các kỹ thuật tăng cường dữ liệu (data augmentation). (Tôi ghét việc mình đã sử dụng nó, hãy bỏ qua bất kỳ ai nghĩ rằng điều đó là ổn). Có một vài cách rõ ràng để làm điều đó, nhưng thách thức là giữ chi phí huấn luyện ở mức thấp.

Thông tin khác

Thành thật mà nói, tôi không ngờ mình đạt được 45% chỉ với transformer, tôi nghĩ điều này sẽ cần những ý tưởng mới. Tôi chắc chắn không ngờ mình đạt được nó với chi phí/flops thấp như vậy. Các thử nghiệm cắt bỏ cho thấy một lượng hiệu suất đáng ngạc nhiên vẫn được giữ lại ngay cả khi không có tăng cường dữ liệu hoặc dữ liệu tổng hợp. Bây giờ tôi khá chắc chắn rằng mức 65% có thể đạt được trong khuôn khổ transformer.

Tôi không hiểu tại sao những người khác không nhận ra điều này. Nó chỉ là một transformer với biểu diễn rõ ràng nhất. Benchmark này đã mở được 6 năm, là một chủ đề nổi bật và có giải thưởng một triệu đô la! Có lẽ các nhà nghiên cứu đánh giá thấp học sâu? Có lẽ chi phí thử nghiệm quá cao khiến họ không thể thực hiện các thử nghiệm cắt bỏ đúng cách? Bị che mắt bởi các LLM hoặc do sử dụng các bộ khung (harnesses) có sẵn?

Những chỉ trích/xác nhận trước đây về phương pháp của tôi từ các nhà nghiên cứu nổi tiếng.

Kết quả cũ của tôi đã lan truyền trên X và nhiều nhà nghiên cứu có kinh nghiệm đã tranh luận về nó, cả ủng hộ lẫn phản đối. Các chuỗi thảo luận của Jeremy, Lucas, Susan, Andreas, Yoav và nhiều người khác. Tôi liệt kê tất cả các chỉ trích ở đây cùng với câu trả lời của mình.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

ARC-AGITối ưu chi phíAI ResearchHacker News

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Đạt 44% điểm ARC-AGI-1 với chi phí chỉ 67 cent: Cách tiếp cận tối ưu | AIHOT.vn