QbitAI
85

Mô hình

AI tự tối ưu hóa quy trình học tập: Kỷ nguyên MetaRSI nâng tầm mô hình ngôn ngữ

(giờ Việt Nam)

Tóm tắt AI

MetaRSI đánh dấu bước tiến mới khi các mô hình AI có khả năng tự cải thiện phương pháp học tập, giúp cả mô hình nhỏ lẫn flagship đạt hiệu suất vượt trội.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

14-09-2026 11:45:46 Nguồn: QbitAI

Mô hình nhỏ vượt ngưỡng, mô hình flagship mở ra không gian mới

Yun Zhong đưa tin từ Aofei Temple

QbitAI | Kênh chính thức QbitAI

Để mô hình tự tạo dữ liệu huấn luyện, tự viết lại prompt, tự sửa lỗi code, lộ trình này được gọi là:

Tự cải thiện đệ quy (Recursive Self-Improvement - RSI).

Tuy nhiên, hầu hết các hệ thống RSI đều có cùng một cấu trúc: một quy trình cải thiện cố định, tác động lặp đi lặp lại lên mô hình. Và thường chỉ tiếp cận từ một góc độ đơn lẻ là Harness, Data hoặc Model RSI.

Để giải quyết bài toán này, CosmosMind đã phối hợp với hơn mười trường đại học trong và ngoài nước như Stanford, Berkeley, MIT, Thanh Hoa, Bắc Đại để công bố MetaRSI-v1.

Đây là kiến trúc meta-đệ quy đầu tiên trên thế giới thống nhất Model-RSI, Data-RSI và Harness-RSI, có khả năng cải thiện chính "quá trình tự cải thiện".

RSI từ đó bước vào "kỷ nguyên bình phương".

△ Trang đầu của bài báo khoa học

Trong điều kiện không có bất kỳ mô hình giáo viên bên ngoài nào tham gia, MetaRSI-v1 giúp một mô hình nhỏ chỉ với 3 tỷ tham số kích hoạt đạt mức tự cải thiện trung bình 10,9 điểm trên bốn tiêu chuẩn; đồng thời giúp sáu mô hình flagship tiên tiến như GPT-5.6, Claude Opus 5 đạt mức tăng trung bình 7,3 điểm.

Quan trọng hơn những con số đằng sau, MetaRSI-v1 là một bộ ngôn ngữ kiến trúc nhằm thống nhất toàn bộ lĩnh vực RSI: bao gồm một nhân (kernel), hai trục điều phối, ba toán tử, toàn bộ lớp meta-RSI và năm định luật.

△ Tổng quan về MetaRSI-v1

Mô hình Loop Kernel lần đầu tiên được thống nhất

Loop Kernel là hình thức tự cải thiện thống nhất được MetaRSI-v1 đề xuất lần đầu tiên.

Lần đầu tiên, nó trừu tượng hóa "sự tiến bộ diễn ra như thế nào" thành một vòng lặp khép kín không phụ thuộc vào đối tượng: tiêu thụ tín hiệu học tập từ phản hồi, đề xuất thay đổi trên Data, Harness, Model, giao cho trình xác thực quyết định, và đưa kết quả trở lại làm tín hiệu cho vòng tiếp theo.

Từ đây, Data, Harness và Model có thể được thống nhất thành các toán tử khởi tạo khác nhau của cùng một Kernel, có khả năng kết hợp và điều phối thống nhất, giúp việc tự cải thiện lần đầu tiên sở hữu một bộ khung nền tảng thống nhất và có thể tái sử dụng.

△ Mô hình Loop Kernel

Không gian cải thiện: Data-RSI, Harness-RSI, Model-RSI

Sử dụng cùng một Loop Kernel, quá trình tự cải thiện được triển khai trên ba không gian, lần lượt được đảm nhận và phối hợp thực hiện bởi ba toán tử Data-RSI, Harness-RSI và Model-RSI.

Giữa chiều dọc và chiều ngang: Để quá trình cải thiện tự tìm ra lộ trình tối ưu

Đệ quy trên đệ quy: Ba tầng cải thiện và sự ra đời của "tầng meta"

Toàn bộ kiến trúc vận hành thông qua sự phối hợp của bốn Agent, và tất cả đều có thể được chuyên gia con người thay thế cục bộ để hình thành hệ thống human-in-the-loop.

Bốn Agent tương ứng hình thành ba cấp độ tối ưu hóa RSI: hệ thống mục tiêu cải thiện toán tử, điều phối trục kép cải thiện cách sử dụng toán tử, và tầng meta cải thiện chính chiến lược điều phối trục kép.

Thí nghiệm: Cả mô hình nhỏ và mô hình tiên tiến đều đạt được sự tự tiến hóa

Thí nghiệm được triển khai theo hai lộ trình:

Lộ trình một: Tự cải thiện của mô hình nhỏ

Mô hình mục tiêu là Qwen3.5-35B-A3B (tổng 35B tham số, 3B kích hoạt), được đánh giá trên bốn tiêu chuẩn: Terminal-Bench 2.1, SWE-bench Pro, tập con độ khó cao GPQA-Diamond và AIME.

△ MetaRSI giúp Qwen3.5-35B-A3B đạt được sự tự tiến hóa

MetaRSI-v1 đạt mức tăng trung bình 10,9 điểm, tỷ lệ giải quyết trên SWE-bench Pro gần như tăng gấp đôi, tầng Meta mang lại trần cao hơn cho RSI, mức tăng tích lũy từ việc tự tiến hóa liên tục được cải thiện đáng kể.

△ "Cải thiện người cải thiện", MetaRSI giúp mở rộng mức tăng tự tiến hóa tích lũy của mô hình nhỏ

Lộ trình hai: Tự cải thiện của các mô hình tiên tiến

AIMetaRSITự tối ưu hóaMô hình ngôn ngữCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.