Mô hình
Kimi K3 ra mắt: Đội ngũ 18 AI tự nghiên cứu, thách thức vị thế của Claude 3 Opus
(giờ Việt Nam)
Tóm tắt AI
Kimi K3 tạo bước ngoặt lớn khi sử dụng hệ thống 18 Agent tự chủ nghiên cứu thông qua cơ chế Harness, giúp hiệu suất tiệm cận với mô hình Opus 5 đình đám.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
20:46:23, 20/08/2026 Nguồn: QbitAI
Kịch bản RSI kinh điển bắt đầu lung lay
henry đưa tin từ Aofei Temple
QbitAI | Kênh chính thức QbitAI
Vừa mới đây, "người cha nghiêm khắc" được chỉ định của RSI đóng nguồn đã xuất hiện!
Công ty cơ sở hạ tầng AI mã nguồn mở Prime Intellect đã đề xuất trong một nghiên cứu mới nhất:
Nhờ vào Harness đa tác nhân (multi-agent), chúng ta có thể giao việc giám sát và thực thi cụ thể cho các mô hình mã nguồn mở nhỏ hơn, rẻ hơn, từ đó giúp việc "AI phát triển AI" trở nên tiết kiệm hơn và thậm chí đạt hiệu quả tốt hơn.

Trong thử nghiệm, họ đã đưa 18 mô hình tiên tiến bao gồm Fable 5, Opus 5, GPT-5.6 Sol, Kimi K3... vào một cuộc đua "speedrun" tối ưu hóa nanoGPT.
Kết quả là, mô hình trọng số mã nguồn mở Kimi K3 khi kết hợp với Prime Agent Harness đã đạt thành tích 2930 bước trong trang kết quả gốc.
Con số này không chỉ vượt qua 3042 bước của GPT-5.6 Sol, mà còn chỉ kém mô hình flagship Opus 5 của Claude đúng 10 bước.

Nói cách khác, trong lĩnh vực nghiên cứu AI, một hệ thống gồm các mô hình mã nguồn mở và Harness đã có thể vượt qua một số mô hình đóng nguồn hàng đầu, thậm chí tiệm cận nhóm dẫn đầu.
Điều này bắt đầu làm lung lay kịch bản RSI kinh điển nhất từ trước đến nay:
Một mô hình đóng nguồn mạnh nhất sẽ là bên đầu tiên vượt qua điểm tới hạn của "AI phát triển AI", sau đó liên tục tự lặp lại, bỏ xa các đối thủ khác và cuối cùng là "người thắng cuộc giành lấy tất cả".
Mặt khác, Prime Intellect cũng đã cho thấy một khả năng khác:
Mô hình không nhất thiết phải là mạnh nhất, chỉ cần bộ máy nghiên cứu khoa học bên dưới đủ hiệu quả, các mô hình mã nguồn mở vẫn có thể bắt kịp nhờ lưu lượng thử sai (throughput) cao hơn.
Và điều này càng làm nổi bật tiềm năng của các khung điều phối tác nhân (Agent orchestration framework) như Harness trong lĩnh vực AI4AI và AutoResearch.
Điều này đã được thực hiện như thế nào?
Speedrun tối ưu hóa nanoGPT
Nói một cách đơn giản, thí nghiệm lần này của Prime Intellect là để hơn mười mô hình ngôn ngữ lớn tiên tiến thực hiện "speedrun" nhiệm vụ huấn luyện nanoGPT nổi tiếng của Karpathy.

Tuy nhiên, cần làm rõ một điểm.
Lần này không phải là so sánh xem ai có thể phát minh ra một thuật toán mới độc đáo từ hư không.
Những gì Prime Intellect thực hiện là trực tiếp đưa AI vào một nhiệm vụ huấn luyện thực tế với mục tiêu rõ ràng và phản hồi nhanh chóng, để xem liệu nó có thể giống như một nhà nghiên cứu con người, liên tục đưa ra giả thuyết, chạy thử nghiệm, xem kết quả và tiếp tục cải tiến hay không.
Ban đầu, Agent sẽ nhận được một kịch bản huấn luyện với các siêu tham số baseline, kèm theo một chỉ dẫn duy nhất: Giải pháp hiện tại vẫn chưa đủ tốt.
Còn việc cải thiện ở đâu, cải thiện như thế nào thì không ai nói cho nó biết:
Liệu có nên thay đổi phương pháp tiền điều kiện (preconditioning) tốt hơn, đặt giới hạn trên và dưới cho trọng số và biên độ cập nhật, điều chỉnh lịch trình tốc độ học (learning rate schedule) để duy trì tốc độ học cao lâu hơn, hay thêm tính năng trung bình hóa trọng số (weight averaging) vào giai đoạn sau của quá trình huấn luyện, tất cả đều phải dựa vào chính Agent để thử nghiệm từng chút một.
Vì vậy, cuối cùng các thí nghiệm này chỉ xét trên một chỉ số duy nhất:
Sử dụng ít bước huấn luyện (training steps) nhất có thể để giảm loss của tập kiểm chứng (validation set) của một mô hình GPT 124 triệu tham số xuống dưới 3.28.
Để đảm bảo mọi người xuất phát từ cùng một vạch đích, Prime Intellect đã đặt baseline ở mức 3290 bước.
Để tham khảo, kỷ lục tốt nhất hiện nay được công khai của con người là 2600 bước.
Do đó, toàn bộ cuộc thi đã trở thành cuộc đua từ vạch xuất phát 3290 bước, xem ai có thể ép con số này xuống thấp hơn.
Ép càng thấp, chứng tỏ công thức huấn luyện (recipe) mà nó tìm ra càng hiệu quả, và càng tiệm cận với trình độ mà các nhà nghiên cứu hàng đầu của con người đã đạt được.

Cụ thể, các mô hình tham gia thử nghiệm bao gồm tổng cộng 18 mô hình tiên tiến như Fable 5, Opus 5, GPT-5.6 Sol, Kimi K3, Grok 4.5, GLM 5.2, Muse Spark 1.1, DeepSeek V4 Pro, Grok 4.6, Muse Spark 1.2, Qwen 3.8, v.v.
Sau mỗi lần khởi động, Agent sẽ nhận được ba thứ: kho lưu trữ mã nguồn, sổ tay quy tắc và một chỉ dẫn mục tiêu.
Thí nghiệm được chạy đồng nhất trên 8 card H200, và từ đây, con người gần như rút lui hoàn toàn.
Thay đổi bộ tối ưu hóa, viết mã, khởi động huấn luyện, so sánh loss, đánh giá kết quả có phải là nhiễu hay không, quyết định vòng thử nghiệm tiếp theo sẽ làm gì, tất cả đều do chính Agent tự hoàn thành.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.