QbitAI
85

Sản phẩm

Han Kai (Base Rhythm): Từ điều phối đa mô hình đến vòng lặp phản hồi, thúc đẩy sự tiến hóa của AI Agent

(giờ Việt Nam)

Tóm tắt AI

Tại Hội nghị Vân Tê 2026, CTO Han Kai của Base Rhythm đã chia sẻ về chiến lược tối ưu hóa AI Agent thông qua mô hình 'Harness' và vòng lặp phản hồi RSI, giúp hệ thống tự tiến hóa bền vững.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

22/09/2026 18:06:34 Nguồn: QbitAI

Ngày 22 tháng 9, tại Hội nghị thượng đỉnh thực tiễn Agent cấp doanh nghiệp trong khuôn khổ Hội nghị Vân Tê Hàng Châu 2026, Han Kai, đồng sáng lập kiêm CTO của Jiyuan Ludong (Base Rhythm), đã có bài phát biểu với chủ đề "Từ Harness đến vòng lặp RSI".

Ngày 22 tháng 9, tại Hội nghị thượng đỉnh thực tiễn Agent cấp doanh nghiệp trong khuôn khổ Hội nghị Vân Tê Hàng Châu 2026, Han Kai, đồng sáng lập kiêm CTO của Jiyuan Ludong, đã có bài phát biểu với chủ đề "Từ Harness đến vòng lặp RSI". Ông cho rằng sự tồn tại song song lâu dài của các mô hình không đồng nhất và nguồn cung cấp tài nguyên tính toán đa dạng sẽ trở thành cấu trúc dài hạn của ngành công nghiệp mô hình lớn. Khi các Agent đảm nhận những nhiệm vụ ngày càng phức tạp, việc tổ chức các mô hình khác nhau và chuyển hóa phản hồi từ ứng dụng thành cơ sở để cải tiến mô hình đang trở thành một chủ đề kỹ thuật mới.

Theo số liệu từ Cục Dữ liệu Quốc gia, vào tháng 3 năm 2026, lưu lượng gọi Token trung bình hàng ngày tại Trung Quốc đã vượt quá 140 nghìn tỷ, tăng hơn một nghìn lần so với đầu năm 2024. Trong phần chia sẻ của mình, Han Kai chỉ ra rằng một nhiệm vụ Agent phức tạp thường liên quan đến hàng chục lần gọi mô hình. Hiệu suất nhiệm vụ không chỉ phụ thuộc vào bản thân mô hình mà còn phụ thuộc vào năng lực hệ thống hỗ trợ thực thi nhiệm vụ, bao gồm lựa chọn mô hình, gọi công cụ và quản lý ngữ cảnh.

Harness là khung vận hành hỗ trợ Agent thực thi nhiệm vụ, trong đó định tuyến mô hình (model routing) là một năng lực then chốt. Theo quan điểm của Han Kai, mỗi mô hình đều có những đặc điểm riêng về năng lực, chi phí và tốc độ phản hồi; các nhiệm vụ phức tạp đòi hỏi phải chọn đúng mô hình phù hợp cho từng bước thực hiện. Việc thích ứng mô hình không đồng nhất và điều phối tính toán không đồng nhất cũng cần sự hỗ trợ của các năng lực chuyên môn tương ứng.

Jiyuan Ludong đang khám phá hướng đi này thông qua dự án mã nguồn mở OpenSquilla. Theo kết quả đánh giá Agent đầu cuối (end-to-end) do công ty công bố, trong một cấu hình thử nghiệm cụ thể, OpenSquilla giữ lại 99,96% chất lượng nhiệm vụ so với mô hình flagship cơ sở, đồng thời giảm chi phí xuống 88,9%. Trong một bài kiểm tra nghiên cứu chuyên sâu khác của DRACO, cấu hình phối hợp đa mô hình đạt điểm số vượt qua mô hình đơn lẻ mạnh nhất trong nhóm thí nghiệm, với chi phí chỉ bằng khoảng một phần ba. Những kết quả này cho thấy ưu thế về chi phí và hiệu quả của việc điều phối mô hình trong các nhiệm vụ cụ thể.

"Giá trị của tầng định tuyến nằm ở việc giúp mỗi bước nhiệm vụ sử dụng đúng mô hình và đủ khả năng chi trả cho mô hình đó", Han Kai cho biết.

Ngoài việc điều phối mô hình, Han Kai còn giới thiệu sâu hơn về vòng lặp phản hồi hướng tới RSI (Recursive Self-Improvement - Tự cải tiến đệ quy): lấy nhu cầu năng lực trong các kịch bản làm kim chỉ nam, thông qua đánh giá để xác định hướng cải tiến cho mô hình và chiến lược điều phối, thực hiện tối ưu hóa có mục tiêu, sau đó áp dụng các năng lực đã nâng cấp vào kịch bản để kiểm chứng hiệu quả. Cơ chế này kết nối việc ứng dụng mô hình, đánh giá năng lực và lặp lại sau đó, nhằm khám phá lộ trình giúp Agent nâng cao hiệu suất nhiệm vụ thông qua quá trình kiểm chứng và tối ưu hóa liên tục.

NeoHorse-1 ra mắt vào tháng 9 là bước kiểm chứng sơ bộ cho lộ trình này. Dòng mô hình này được huấn luyện hậu kỳ (post-training) dựa trên nền tảng Qwen3.5 của Tongyi. Theo báo cáo kỹ thuật phiên bản đầu tiên, trong mười bài kiểm tra tiêu chuẩn, điểm trung bình cộng (macro-average) của phiên bản 4B tăng từ 58,94 lên 64,87, phiên bản 9B tăng từ 65,60 lên 69,04. Trong đó, phiên bản 4B sau huấn luyện đã vượt qua mô hình cơ sở Qwen3.5-9B trong năm bài kiểm tra gồm VitaBench, τ²-Bench, PinchBench, QwenClawBench và HumanEval, điểm trung bình tổng thể cũng tiến gần hơn đến mô hình cơ sở 9B. Kết quả này bước đầu cho thấy tính khả thi của việc sử dụng kinh nghiệm vận hành Agent để cải tiến mô hình.

Về khía cạnh hợp tác, theo Han Kai, Jiyuan Ludong và Alibaba Cloud đã phối hợp thực hiện kiểm thử kịch bản, đánh giá và xác thực ứng dụng xoay quanh dòng Qwen, liên tục sử dụng mô hình trong các sản phẩm Harness và Agent của chính mình, tích lũy phản hồi và thúc đẩy việc kết nối các phiên bản mới vào nền tảng định tuyến TokenRhythm. Đồng thời, về mặt cơ sở hạ tầng, Alibaba Cloud cung cấp hỗ trợ dịch vụ đám mây cho các hoạt động kinh doanh liên quan, còn Wuwen Xinqiong (Enflame) cung cấp hỗ trợ tính toán và tối ưu hóa cơ sở hạ tầng cho việc huấn luyện và suy luận của NeoHorse-1.

Từ Harness đến RSI, Jiyuan Ludong hy vọng sẽ kết nối được việc điều phối mô hình với quá trình lặp lại mô hình. Một mặt, để các mô hình hiện có phát huy năng lực trong các nhiệm vụ phù hợp; mặt khác, để những kinh nghiệm tích lũy được trong quá trình thực thi nhiệm vụ đi vào các giai đoạn huấn luyện và đánh giá tiếp theo, dần dần khám phá lộ trình tiến hóa liên tục của Agent.

Bài viết này do Jiyuan Ludong cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.

Bản quyền thuộc về tác giả, không được phép sao chép hoặc sử dụng dưới mọi hình thức khi chưa được ủy quyền, mọi hành vi vi phạm sẽ bị xử lý theo quy định.

量子位的朋友们
AI AgentDoanh nghiệpVòng lặp phản hồiHội nghị Vân TêTối ưu hóa AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.