Nghiên cứu
Meta FAIR giới thiệu RPMs: Mô hình AI giúp xếp hạng và tối ưu hóa chi phí chạy thực nghiệm ML
(giờ Việt Nam)
Tóm tắt AI
Meta FAIR cùng các đại học danh tiếng phát triển mô hình RPMs nhằm dự đoán và xếp hạng các thực nghiệm ML trước khi chạy, giúp tiết kiệm đáng kể tài nguyên GPU bằng cách chỉ thực thi những thí nghiệm tiềm năng nhất.
Bản dịch AI

Các tác nhân nghiên cứu AI (AI research agents) hiện đã có thể tự đề xuất, triển khai và chấm điểm các thí nghiệm học máy của riêng chúng. Việc tạo ra ý tưởng thì dễ, nhưng xác thực chúng thì không. Việc huấn luyện một ứng viên có thể tiêu tốn từ vài giờ đến vài ngày thời gian GPU, vì vậy một tác nhân thường đề xuất nhiều ứng viên hơn mức nó có thể thực hiện. Việc quyết định chọn ứng viên nào để chạy chính là đòn bẩy thực sự cho tiến trình nghiên cứu.
Một nhóm nghiên cứu từ FAIR tại Meta, Đại học Oxford và Đại học College London đã chính thức hóa đòn bẩy đó dưới dạng sở thích nghiên cứu (research preference) và giới thiệu các Mô hình Sở thích Nghiên cứu AI (AI Research Preference Models - RPMs). Một RPM sẽ xếp hạng các ứng viên chưa được thực thi và chọn ra một ứng viên để chạy. Nhóm nghiên cứu nhận thấy các mô hình ngôn ngữ không đáng tin cậy trong việc dự đoán các chỉ số hoặc kết quả thực thi, vì vậy RPM không bao giờ dự báo một điểm số tuyệt đối.
Liệu nó có thể triển khai được không? Một phần. RPM sử dụng các LLM đã được huấn luyện trước (pretrained) ở trạng thái đóng băng mà không cần tinh chỉnh (fine-tuning), khung AIRA-dojo và bộ chuẩn AIRS-Bench là mã nguồn mở, và mô hình nền tảng Qwen3.6-27B có trọng số mở.
Vị trí của RPM trong vòng lặp tác nhân
AIRA-dojo là một quá trình tìm kiếm cây tiến hóa: lựa chọn nút cha theo thuật toán tham lam (greedy), sử dụng các toán tử Draft (Nháp) / Improve (Cải thiện) / Debug (Gỡ lỗi), và trả về nút có điểm xác thực cao nhất ở cuối quy trình. RPM chỉ can thiệp vào quá trình tạo nút con. Thay vì tạo một nút con và thực thi nó, tác nhân áp dụng toán tử 15 lần song song để tạo ra 15 ứng viên chưa thực thi, sau đó so sánh chúng theo cặp trong một giải đấu loại trực tiếp. Chỉ người chiến thắng mới được thực thi. Mỗi phép so sánh đều dựa trên các nút ngữ cảnh được thu thập bằng cách duyệt theo chiều rộng (BFS) của cây đã khám phá, mỗi nút đều hiển thị điểm xác thực mà nó đạt được.
Hai biến thể, hai ngân sách tính toán
Inference-only RPM (RPM chỉ suy luận): Một LLM đóng vai trò giám khảo đánh giá các kế hoạch, mã nguồn và lịch sử tìm kiếm của ứng viên. Lời nhắc (prompt) của nó được tối ưu hóa bằng MIPROv2 từ DSPy, hội tụ về một bộ tiêu chí của nhà nghiên cứu chính (principal-investigator rubric) giúp chấp nhận các lỗi có thể sửa chữa, khen thưởng khả năng mở rộng và phạt các hướng đi dư thừa, với độ chính xác ngoại tuyến từ 57,7% đến 59,0%.
Agentic RPM (RPM tác nhân): Sử dụng cùng một giám khảo và một môi trường sandbox sao chép môi trường của tác nhân, bao gồm một GPU H200 duy nhất. Các công cụ bao gồm python, bash và submit_solution. Nó chạy các thí nghiệm thử nghiệm quy mô nhỏ, sau đó một mô hình phản hồi sẽ đề xuất thí nghiệm tiếp theo mang lại nhiều thông tin nhất hoặc kết thúc vòng lặp. Hai lựa chọn thiết kế đóng vai trò quan trọng: ngân sách còn lại được cố tình phóng đại (báo cáo 2.700 giây so với 300 giây thực tế) để tác nhân không dừng lại sớm, và các thí nghiệm thử nghiệm được giới hạn ở mức 30 với ngưỡng 60 giây. Thời gian thử nghiệm cạnh tranh với đồng hồ của chính tác nhân, vì vậy bộ chọn tác nhân chỉ chạy ở các bước Draft và Improve; bước Debug sẽ quay lại chọn ngẫu nhiên.
Kết quả trên AIRS-Bench
Thiết lập: 20 tác vụ văn bản và bảng biểu công khai, 24 giờ trên một GPU H200 cho mỗi tác vụ, 10 hạt giống (seeds), sử dụng Qwen3.6-27B làm nền tảng cho cả các toán tử và RPM, vì vậy mức tăng hiệu suất đến từ lớp lựa chọn chứ không phải từ một giám khảo mạnh hơn.
Xác suất cải thiện so với No-RPM là 0,5923 và 0,5913, với cận dưới của khoảng tin cậy 95% lần lượt là 0,5066 và 0,5018.
Hiệu quả là kết quả thực tế hơn. Biến thể Inference-only đạt mức 0,684 cuối cùng của baseline trong 14,88 giờ (1,61×), biến thể Agentic đạt trong 15,50 giờ (1,55×). Việc tự lưu trữ suy luận (self-hosted inference) tốn thêm 0,660 giờ mỗi lần chạy; sau khi điều chỉnh, kết quả vẫn đạt 0,708 trong 23,34 giờ.
Hai kết quả SOTA mới được báo cáo: WinoGrande đạt 94,1% với Agentic RPM so với SOTA tác nhân trước đó là 90,4% từ AIRA₂, và SVAMP đạt 95,7% với inference-only so với SOTA con người trước đó là 94,2%.
Những điểm chính cần lưu ý
Hãy xem Bài báo và thông báo trên LinkedIn. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC Trang Hugging Face HOẶC Ra mắt sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.