QbitAI
85

Mô hình

Khi kho dữ liệu lỗi thời, AI tự tạo đề bài cho chính mình: Đội ngũ Trung Quốc hiện thực hóa phương pháp RSI

(giờ Việt Nam)

Tóm tắt AI

Thay vì phụ thuộc vào dữ liệu cũ, các mô hình AI đang tự tạo ra dữ liệu huấn luyện chất lượng cao. Đội ngũ nghiên cứu tại Trung Quốc đã thành công trong việc ứng dụng phương pháp RSI để tối ưu hóa quy trình tự học này.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

09-08-2026 11:40:25 Nguồn: QbitAI

AI tham gia kiến tạo thế hệ AI tiếp theo

Wen Le đưa tin từ trụ sở QbitAI

QbitAI | Tài khoản chính thức QbitAI

Từ khóa đắt giá nhất tại Thung lũng Silicon năm nay chính là Recursive Self-Improving (Tự cải thiện đệ quy).

Thuật ngữ này chỉ việc để AI tham gia vào quá trình lặp lại các mô hình, thuật toán, dữ liệu và quy trình nghiên cứu phát triển của chính nó.

Khái niệm này đang "hot" đến mức nào?

Discovery Loop, công ty do Jeff Dean sáng lập sau khi rời Google, cũng đi theo hướng khám phá nghiên cứu khoa học tự động hóa bằng AI.

Không chỉ riêng Jeff Dean, những tên tuổi lớn như David Silver, người tạo ra AlphaGo, cũng đang cùng tham gia vào đường đua này.

Có thể thấy, các nhà nghiên cứu AI hàng đầu đang hình thành một sự đồng thuận:

Để AI tham gia kiến tạo thế hệ AI tiếp theo, cho phép AI liên tục tự cải thiện và xây dựng nên những hệ thống AI mạnh mẽ hơn.

Dưới sự đồng thuận này, một vấn đề nan giải hơn đã xuất hiện.

Mô hình càng mạnh, số lượng người có khả năng đặt câu hỏi, giải quyết vấn đề và kiểm chứng cho AI càng ít đi, vậy dữ liệu huấn luyện chất lượng cao sẽ lấy từ đâu?

Một đội ngũ đến từ Trung Quốc đã đưa ra câu trả lời của họ.

Nhóm nghiên cứu "Endless Frontier" (Vô tận tiền duyên), bao gồm Học viện Trí tuệ Nhân tạo Đại học Giao thông Thượng Hải, Deepverse (Thâm Thế Khoa học) và Viện Nghiên cứu Đổi mới Thuật toán Thượng Hải, đã công bố BigBang-V1 —

Đây là mô hình nền tảng đầu tiên được huấn luyện theo phương thức nguyên bản recursive self-improving.

Trong quá trình huấn luyện, việc đặt câu hỏi, giải quyết vấn đề và kiểm chứng đều do AI kiểm soát. Thông qua việc liên tục tạo ra dữ liệu tổng hợp tự tiến hóa từ các nhiệm vụ tiên phong có thể kiểm chứng, toàn bộ quá trình không cần sự tham gia của con người vào từng câu hỏi.

Mô hình 35B vượt mặt mô hình 1T

Mô hình đã được mã nguồn mở và báo cáo kỹ thuật cũng được công bố đồng thời.

BigBang-V1 có quy mô tham số 35B, kích hoạt khoảng 3B tham số khi suy luận và hỗ trợ ngữ cảnh dài 262K.

Dữ liệu hậu huấn luyện (post-training) của nó được tổng hợp 100% tự động bởi AI, với trọng tâm là các nhiệm vụ khoa học tiên phong.

Trong điều kiện đó, mô hình đã giành được 10 vị trí dẫn đầu trong số tất cả các mô hình 35B ở các bài kiểm tra về tìm kiếm đường dài, lập trình, nghiên cứu khoa học và nghiên cứu AI.

Không chỉ vậy, trong nhiều nhiệm vụ nghiên cứu khoa học độ khó cao như FrontierScience Research và PaperBench, kết quả của nó thậm chí còn vượt qua DeepSeek V4 Pro Preview ở cấp độ 1T.

Ngoài điểm số chuẩn, hiệu suất trong các nhiệm vụ cụ thể còn minh chứng rõ hơn cho khả năng giải quyết các vấn đề phức tạp của BigBang-V1.

Hãy xem xét một nhiệm vụ tin sinh học độ khó cao.

Việc định vị transposon yêu cầu xác định vị trí chèn transposon 47bp trong dữ liệu giải trình tự toàn bộ hệ gen. Mô hình không chỉ phải nhận diện các trình tự liên quan mà còn phải tuân thủ quy ước đặt tên nhiễm sắc thể RefSeq và tọa độ 1-based.

BigBang không hề đoán tọa độ, mà sử dụng bằng chứng kết nối giữa transposon và nhiễm sắc thể để thực hiện ánh xạ ràng buộc:

Một điểm nối (junction) tương ứng với một tọa độ, cuối cùng khóa điểm đứt gãy tại 4144431, mọi bước bằng chứng đều có thể truy xuất.

Trong nhiệm vụ tái hiện bài báo khoa học, hiệu suất của BigBang lại giống như một kỹ sư biết tự sửa lỗi.

Nhiệm vụ yêu cầu tái hiện bài báo LBCS thành một kho lưu trữ mã có thể chạy được. Sau khi đọc kỹ bài báo, nó không vội vàng nộp kết quả mà phát hiện trong quá trình kiểm thử (smoke test) rằng cách triển khai của mình vi phạm các luận điểm cốt lõi của bài báo:

Kích thước mẫu bị cố định, tập hợp cốt lõi (core set) hoàn toàn không thể thu nhỏ.

Nó tính toán quy mô nhiễu loạn, phát hiện không thể vượt qua ngưỡng kích hoạt, vì vậy đã bác bỏ liên tiếp ba phương án sửa lỗi dự kiến, cuối cùng thay đổi nhiễu loạn liên tục thành lật mặt nạ nhị phân (binary mask flipping), vấn đề mới thực sự được giải quyết.

Ở vòng thứ hai, nó lại phát hiện một hạng tử gradient bị tách khỏi đồ thị tính toán, chủ động khôi phục luồng gradient, cuối cùng đạt điểm tái hiện 0,7657, vượt qua 331 trên tổng số 485 điểm đánh giá.

AIDữ liệu tổng hợpRSIHuấn luyện mô hìnhCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.