Nghiên cứu
Orchard: Khung mã nguồn mở giúp tối ưu hóa và mở rộng các tác nhân AI
(giờ Việt Nam)
Tóm tắt AI
Orchard là khung làm việc mã nguồn mở từ Microsoft Research, giúp cộng đồng nghiên cứu huấn luyện và đánh giá các tác nhân AI một cách đồng bộ, đồng thời tối ưu hiệu suất cho các mô hình nhỏ.
Bản dịch AI


Sơ lược
Bên cạnh các mô hình và quy trình làm việc, dự án còn công bố dữ liệu huấn luyện và các phương pháp đánh giá nhằm hỗ trợ cộng đồng nghiên cứu rộng lớn hơn trong việc xây dựng và nghiên cứu các hệ thống tác tử (agentic systems) mở. Trí tuệ nhân tạo đang nhanh chóng chuyển dịch từ việc trả lời câu hỏi tĩnh sang các tác tử tự hành có khả năng lập kế hoạch, suy luận và hành động trong các môi trường phức tạp, đa bước. Những hệ thống này có thể sửa lỗi trong các cơ sở mã nguồn phức tạp, điều hướng web thay cho người dùng và quản lý các quy trình làm việc liên quan đến lịch và email.
Mặc dù có nhiều sự hào hứng xung quanh khả năng của AI tác tử, cộng đồng nghiên cứu vẫn đang đối mặt với một nút thắt cổ chai dai dẳng. Việc xây dựng các hệ thống tác tử hiện đại thường đòi hỏi cơ sở hạ tầng độc quyền, bao gồm các sandbox tùy chỉnh, các quy trình huấn luyện khép kín và các tập dữ liệu độc quyền mà hầu hết các nhà nghiên cứu và thực hành không thể truy cập hoặc tái tạo.
Để giải quyết khoảng cách này, chúng tôi giới thiệu Orchard (mở trong tab mới), một khung làm việc mã nguồn mở dành cho mô hình hóa tác tử có khả năng mở rộng. Trung tâm của Orchard là Orchard Env, một môi trường Kubernetes nhẹ, cung cấp các thành phần cô lập có thể tái sử dụng để chạy và xây dựng các tác tử ở quy mô lớn—từ thu thập dữ liệu huấn luyện đến triển khai học tăng cường và đánh giá.
Không giống như nhiều khung làm việc hiện có, Orchard Env được thiết kế để hỗ trợ các hệ thống tác tử và loại tác vụ khác nhau mà không cần sửa đổi. Cùng một dịch vụ có thể hỗ trợ các tác tử kỹ thuật phần mềm, tác tử duyệt web và tác tử trợ lý cá nhân trên nhiều lĩnh vực.
Để minh họa phương pháp này, chúng tôi phát hành ba công thức huấn luyện chuyên biệt theo lĩnh vực—Orchard-SWE, Orchard-GUI và Orchard-Claw (mở trong tab mới). Chúng tôi cũng phát hành dữ liệu huấn luyện và các phương pháp đánh giá được sử dụng để xây dựng chúng.
Tiêu điểm: TRẢI NGHIỆM ĐƯỢC HỖ TRỢ BỞI AI

Trải nghiệm Microsoft research copilot
Khám phá thêm về nghiên cứu tại Microsoft thông qua trải nghiệm được hỗ trợ bởi AI của chúng tôi
Lớp môi trường có khả năng mở rộng trên nhiều loại tác vụ
Ý tưởng cốt lõi đằng sau Orchard là môi trường thực thi phải là một dịch vụ độc lập, có thể tái sử dụng thay vì cơ sở hạ tầng được nhúng bên trong một khung huấn luyện cụ thể. Nền tảng Kubernetes của Orchard Env cho phép nó tạo, quản lý và loại bỏ hàng ngàn thành phần cô lập song song.
Hệ thống được thiết kế để hoạt động trên các tác vụ như lập trình, duyệt web, sử dụng công cụ. Nó cũng được thiết kế để hoạt động trên các hệ thống tác tử khác nhau, cùng với các giai đoạn của quy trình huấn luyện và đánh giá, bao gồm chưng cất dữ liệu (data distillation) và triển khai học tăng cường.
Sự linh hoạt này làm cho Orchard trở nên thực tiễn ở quy mô nghiên cứu. Các nhóm có thể giới thiệu các tiêu chuẩn (benchmark), hệ thống tác tử hoặc thuật toán huấn luyện mới mà không cần xây dựng lại cơ sở hạ tầng nền tảng từ đầu.
Orchard cũng cho phép huấn luyện các tác tử bên trong bất kỳ bộ khung (harness) nào. Các tác tử có năng lực nhất hiện nay hiếm khi chạy như một mô hình trần. Chúng hoạt động thông qua các bộ khung tinh vi—như Claude Code, Codex và OpenClaw—giúp quản lý việc suy luận đa lượt, sử dụng công cụ và kết nối với các hệ thống bên ngoài. Các công cụ huấn luyện mở thường không thể xử lý các bộ khung có trạng thái, đa tiến trình này, buộc các nhà nghiên cứu phải huấn luyện trên một mô hình thay thế đơn giản hóa rồi mới triển khai trong môi trường thực tế, điều này tạo ra sự sai lệch. Orchard xóa bỏ khoảng cách này: một proxy nhẹ ghi lại các lệnh gọi mô hình của chính bộ khung dưới dạng dữ liệu huấn luyện trong khi mỗi lần triển khai chạy trong container riêng của nó, vì vậy một tác tử có thể được huấn luyện từ đầu đến cuối trực tiếp trong bộ khung mà nó sẽ được triển khai—OpenClaw, Codex, ZeroClaw hoặc các bộ khung khác—và trên nhiều bộ khung khác nhau.
Orchard-SWE: Thúc đẩy các tác tử kỹ thuật phần mềm mã nguồn mở
Kỹ thuật phần mềm là một trong những môi trường đòi hỏi khắt khe nhất đối với các tác tử tự hành. Nó đòi hỏi khả năng suy luận đa bước trên các cơ sở mã nguồn thực tế, sử dụng công cụ và khả năng phục hồi sau lỗi. Orchard-SWE là quy trình huấn luyện của chúng tôi cho lĩnh vực này. Nó được xây dựng bằng khung Mini-SWE-Agent, được thiết kế để tự động giải quyết các tác vụ kỹ thuật phần mềm và được đánh giá trên tiêu chuẩn SWE-bench Verified phổ biến, vốn kiểm tra khả năng điều hướng, chẩn đoán và sửa chữa các cơ sở mã nguồn thực tế của mô hình.
Để huấn luyện hệ thống, chúng tôi đã chưng cất 107.000 tương tác tác tử từ hai mô hình trọng số mở tiên tiến (MiniMax-M2.5 và Qwen3.5-397B) bao phủ phạm vi rộng các GitHub Issues. Quy trình huấn luyện sử dụng phương pháp tinh chỉnh có giám sát phân bổ tín dụng (credit-assignment supervised fine-tuning): thay vì loại bỏ các nỗ lực mà tác tử không giải quyết triệt để vấn đề, hệ thống học hỏi từ các phần hiệu quả của những nỗ lực một phần đó, mở rộng lượng dữ liệu huấn luyện hữu ích có sẵn cho mô hình.
Học tăng cường là bước tiếp theo, nhưng phản hồi của nó rất thưa thớt—một tác tử thường chỉ học được liệu bản vá cuối cùng của nó có vượt qua các bài kiểm tra ẩn hay không. Chúng tôi bắt đầu với Balanced Adaptive Rollout, được thiết kế để tận dụng tối đa các tín hiệu thành công không thường xuyên này, sau đó thêm hai kỹ thuật "phần thưởng dày đặc" (dense reward) để hướng dẫn phong phú hơn: chưng cất theo chính sách (on-policy distillation), trong đó một mô hình giáo viên mạnh hơn chấm điểm các quyết định của tác tử từng bước một, và mô hình phần thưởng quy trình (process reward model), trong đó một AI đóng vai trò giám khảo sẽ thưởng cho quy trình giải quyết vấn đề hợp lý—viết các bài kiểm tra tái tạo lỗi, xác minh bản sửa lỗi và kiểm tra xem hành vi hiện tại vẫn hoạt động—độc lập với việc liệu các bài kiểm tra cuối cùng có vượt qua hay không.
Cuối cùng, chúng tôi huấn luyện một mô hình giá trị (value model) trên các lần triển khai trước đó để xếp hạng lại các giải pháp ứng viên. Học tăng cường tạo ra nhiều quỹ đạo thực hành thường bị loại bỏ; thay vào đó, các quỹ đạo từ 20 thí nghiệm trước đó huấn luyện một mô hình giá trị nhỏ gọn 4 tỷ tham số có khả năng nhận diện các giải pháp chất lượng cao, và tại thời điểm giải quyết vấn đề, nó chấm điểm một vài câu trả lời ứng viên và chọn ra câu trả lời tốt nhất. Tổng hợp lại, các kỹ thuật này đưa Orchard-SWE từ mức cơ sở 61,4% trên SWE-bench Verified lên 69,1% với Balanced Adaptive Rollout và 69,7% với các kỹ thuật phần thưởng dày đặc—một trạng thái kỹ thuật mới (state of the art) trong số các mô hình mã nguồn mở có kích thước tương đương (khoảng 3 tỷ tham số hoạt động)—và tăng lên 73% với việc xếp hạng lại bằng mô hình giá trị, tiệm cận với các hệ thống tiên phong lớn hơn gấp 10 lần, như được hiển thị trong Hình 1.
Orchard-GUI: Tác tử trình duyệt nhẹ cho các tác vụ web thực tế
Điều hướng web đặt ra một loạt thách thức khác. Các tác tử phải diễn giải bố cục hình ảnh, tương tác với các giao diện động và hoàn thành các tác vụ mở chỉ được mô tả bằng ngôn ngữ tự nhiên.
Orchard-GUI huấn luyện một mô hình ngôn ngữ-hình ảnh 4 tỷ tham số làm tác tử trình duyệt bằng cách sử dụng lượng giám sát tương đối nhỏ: 400 bản trình diễn được chưng cất kết hợp với 2.200 tác vụ huấn luyện mở. Mặc dù dữ liệu huấn luyện hạn chế, mô hình thu được đạt kết quả mạnh mẽ trên một số tiêu chuẩn điều hướng web: 74,1% trên WebVoyager, 67,0% trên Online-Mind2Web và 64,0% trên DeepShop, với mức trung bình là 68,4%, như được hiển thị trong Hình 1.

Những kết quả này đưa Orchard-GUI trở thành một trong những tác tử web mã nguồn mở mạnh mẽ nhất cho đến nay trong khi vẫn duy trì khả năng cạnh tranh với các mô hình độc quyền lớn hơn. Kết quả cũng cho thấy rằng với phương pháp huấn luyện và môi trường phù hợp, các mô hình mở nhỏ có thể hoạt động tốt trên các tác vụ web thực tế.
Orchard-Claw: Tác tử trợ lý cá nhân cho năng suất hàng ngày
Nhiều ứng dụng tác tử có tác động lớn nhất liên quan đến các tác vụ năng suất hàng ngày, bao gồm đọc và soạn thảo email, quản lý lịch, tìm kiếm thông tin và phối hợp giữa các công cụ. Orchard-Claw tập trung vào các tác vụ trợ lý cá nhân bằng cách huấn luyện một tác tử chỉ trên 200 tác vụ tổng hợp. Được đánh giá trên Claw-Eval, một tiêu chuẩn bao gồm các quy trình làm việc năng suất thực tế, nó hoàn thành thành công 59,6% các tác vụ khi được cho phép tối đa ba lần thử. Con số đó tăng lên 73,9% khi kết hợp với hệ thống tác tử ZeroClaw mạnh mẽ hơn.
Vì Orchard có thể huấn luyện các tác tử trực tiếp bên trong các bộ khung triển khai thực tế, Orchard-Claw được huấn luyện trên một số bộ khung trong số đó—bao gồm ReACT, ZeroClaw, OpenClaw và Codex—thay vì một vòng lặp đơn giản hóa duy nhất. Việc huấn luyện bên trong các bộ khung thực tế này cải thiện đáng kể độ tin cậy của tác tử; ví dụ, dưới bộ khung Codex, tỷ lệ thành công của nó tăng từ 18,6% đối với mô hình chưa được huấn luyện lên 51,5% sau khi huấn luyện với Orchard.

Ý nghĩa và chặng đường phía trước
Kết quả của Orchard củng cố một điểm rộng hơn: lớp môi trường rất quan trọng. Bằng cách làm cho cơ sở hạ tầng nền tảng trở nên mở, nhẹ và có thể tái sử dụng, Orchard giảm chi phí nghiên cứu AI tác tử. Các nhóm không còn cần phải xây dựng các môi trường cô lập tùy chỉnh từ đầu hoặc phụ thuộc vào các dịch vụ đám mây độc quyền. Cùng một Orchard Env có thể được sử dụng để tạo dữ liệu huấn luyện, chạy triển khai học tăng cường và đánh giá các mô hình cuối cùng mà không cần xây dựng lại hệ thống mỗi lần.
Nhìn về phía trước, chúng tôi coi việc tái sử dụng kinh nghiệm huấn luyện là một hướng đi đầy hứa hẹn hướng tới việc học tập tác tử tích lũy. Thay vì loại bỏ các quỹ đạo sau khi quá trình huấn luyện kết thúc, chúng tôi coi chúng là các tài sản bền vững—ví dụ, chưng cất chúng thành các mô hình giá trị có thể tái sử dụng. Điều này cho phép kinh nghiệm tác tử tích lũy theo thời gian, cho phép mỗi thế hệ tác tử mới kế thừa và mở rộng kiến thức thu được từ các thế hệ trước, thay vì bắt đầu từ con số không.
Hiệu quả dữ liệu được thể hiện bởi Orchard-GUI cho thấy các tác tử web quy mô lớn hơn có thể được huấn luyện mà không cần một lượng lớn dữ liệu huấn luyện được tạo thủ công. Bằng cách phát hành toàn bộ hệ sinh thái Orchard, bao gồm dịch vụ môi trường, quy trình huấn luyện và tập dữ liệu huấn luyện, chúng tôi hy vọng sẽ giúp cộng đồng nghiên cứu rộng lớn hơn xây dựng các tác tử mở có năng lực hơn một cách nhanh chóng hơn.
Lời cảm ơn
Chúng tôi cảm ơn các nhóm tại Microsoft Research và các tổ chức cộng tác vì những đóng góp của họ cho Orchard, cũng như cộng đồng mã nguồn mở mà các tiêu chuẩn và công cụ của họ đã làm cho nghiên cứu này trở nên khả thi.
Bài viết được AI dịch và tổng hợp tự động từ Microsoft Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.