MarkTechPost
85

Nghiên cứu

SkillOpt: Đột phá mới giúp kỹ năng của AI Agent có thể chuyển đổi linh hoạt giữa các mô hình

(giờ Việt Nam)

Tóm tắt AI

Microsoft và các đại học hàng đầu giới thiệu SkillOpt, phương pháp tối ưu hóa kỹ năng AI giúp các 'artifact' kỹ năng có thể vận hành hiệu quả trên nhiều quy mô mô hình và công cụ khác nhau như Codex hay Claude Code mà không cần huấn luyện lại.

Bản dịch AI

Microsoft’s SkillOpt Shows Optimized Agent Skill Artifacts Transfer Across Model Scales and Between Codex and Claude Code Harnesses

SkillOpt là một trình tối ưu hóa không gian văn bản (text-space optimizer) được phát triển bởi một nhóm các nhà nghiên cứu từ Microsoft, Đại học Giao thông Thượng Hải, Đại học Đồng Tế và Đại học Phúc Đán.

SkillOpt huấn luyện một tài liệu kỹ năng ngôn ngữ tự nhiên duy nhất trong khi mô hình mục tiêu vẫn ở trạng thái đóng băng (frozen). Một mô hình tối ưu hóa sẽ đọc các kết quả triển khai (rollouts) đã được chấm điểm và đề xuất các chỉnh sửa thêm/xóa/thay thế có giới hạn. Một tập dữ liệu chọn lọc riêng biệt (held-out selection split) chỉ chấp nhận chỉnh sửa khi điểm số cải thiện rõ rệt. Sản phẩm xuất ra là một tệp duy nhất, best_skill.md.

Các bảng chuyển đổi (transfer tables) báo cáo ba cột. Baseline là điểm số của mục tiêu khi không có kỹ năng. Direct là SkillOpt được huấn luyện trong cùng miền (in-domain) trên chính mục tiêu đó. Transferred là áp dụng một kỹ năng được huấn luyện ở nơi khác mà không cần tối ưu hóa thêm.

Sự so sánh hữu ích không nằm ở transferred so với direct. Mà là bao nhiêu phần trăm mức tăng trưởng trong miền (in-domain gain) được giữ lại sau khi chuyển đổi.

Chuyển đổi giữa các mô hình (Cross-model transfer): trong cùng họ, khả năng duy trì hỗn hợp.

Các kỹ năng được huấn luyện trên GPT-5.4 và triển khai trên các biến thể nhỏ hơn.

Hai hàng cần được chú ý. SpreadsheetBench trên GPT-5.4-mini giữ lại 82% mức tăng trưởng trong miền. Đó gần như là sự tái sử dụng miễn phí. Hàng LiveMath trên GPT-5.4-nano thì lạ hơn: kỹ năng được chuyển đổi đạt 28,8 điểm so với kết quả 27,2 điểm của SkillOpt trong miền. Bài báo coi đây là bằng chứng cho thấy một số quy trình đã học là không phụ thuộc vào mô hình mục tiêu (target-model agnostic).

Hàng SpreadsheetBench của GPT-5.4-nano là hàng yếu nhất với 16%. Khả năng duy trì không đồng đều, và bài báo cũng không khẳng định điều đó. Giới hạn được nêu ra hẹp hơn: không có hàng nào rơi xuống dưới mức baseline không-kỹ năng của mục tiêu.

Lưu ý về phạm vi. Cả bốn hàng đều nằm trong một họ GPT. Việc chuyển đổi giữa các họ, chẳng hạn như từ GPT sang Qwen, chưa được kiểm tra.

Chuyển đổi giữa các môi trường thực thi (Cross-harness transfer): kết quả mạnh mẽ nhất.

Đây là phần quan trọng nhất đối với việc triển khai. Tất cả các hàng đều sử dụng GPT-5.5.

Hàng đầu tiên là tiêu đề chính. Một kỹ năng được tối ưu hóa bên trong Codex đã nâng Claude Code từ 22,1 lên 81,8. Con số đó vượt nhẹ mức 80,4 mà Claude Code đạt được khi tự huấn luyện kỹ năng của riêng mình từ đầu.

Hai môi trường thực thi (harnesses) này sử dụng các API công cụ và tệp khác nhau cũng như các bề mặt lệnh khác nhau. Một kỹ năng tồn tại được sau sự thay đổi đó không phải là đang mã hóa các công thức lệnh. Bài báo nghiên cứu cho rằng khả năng di động của SpreadsheetBench là nhờ các quy trình ở cấp độ bảng tính: kiểm tra cấu trúc trước, xác minh nhận thức công thức và hiện thực hóa giá trị tĩnh. Những quy trình này vẫn giữ nguyên bất kể CLI nào chạy Python.

LiveMath kể một câu chuyện ngược lại. Codex → Claude Code chỉ giữ lại 10% mức tăng trưởng trong miền. Sự bất đối xứng này rất đáng để suy ngẫm. Các kỹ năng quy trình — cách kiểm tra, xác minh và định dạng — dường như là nhóm có khả năng di động. Các kỹ năng thiên về suy luận dường như gắn liền với môi trường huấn luyện của chúng hơn.

Chuyển đổi giữa các benchmark (Cross-benchmark transfer): có thực nhưng nhỏ.

Không có cột Direct ở đây. Không có lượt chạy SkillOpt trong miền nào trên Omni-MATH được báo cáo, vì vậy sự so sánh chỉ dựa trên mức không-kỹ năng. Mức tăng là dương trên cả ba quy mô mô hình nhưng nhỏ. Cách hiểu của bài báo nghiên cứu là kỹ năng này đã giữ lại được quy trình toán học có thể tái sử dụng sau khi cả các trường hợp kiểm tra và quy ước định dạng câu trả lời đều thay đổi.

Tại sao sản phẩm lại có thể di chuyển được

Cơ chế này được nêu rõ ràng trong bài báo nghiên cứu. Cả ba chế độ thực thi: trò chuyện trực tiếp, Codex, Claude Code – đều sử dụng cùng một định dạng tệp best_skill.md. Hợp đồng chung đó chính là thứ làm cho thử nghiệm chuyển đổi giữa các môi trường thực thi trở nên khả thi ngay từ đầu.

Môi trường thực thi Codex hiển thị kỹ năng hiện tại thành một tệp SKILL.md cho mỗi tác vụ bên cạnh các tệp tác vụ, sau đó đọc lại một dấu vết thực thi (execution trace) nhỏ gọn. Môi trường thực thi Claude Code phản chiếu cùng một hợp đồng không gian làm việc thông qua claude CLI. Không môi trường nào sử dụng định dạng kỹ năng tùy chỉnh riêng.

Hình dạng của sản phẩm cũng hỗ trợ tính di động. Các kỹ năng cuối cùng chạy từ 379 đến 1.995 token trên sáu benchmark, với giá trị trung bình gần 920. Chúng được lắp ráp từ 1 đến 4 chỉnh sửa được chấp nhận. Hình 4 của bài báo lấy mẫu một quy tắc đã học cho mỗi benchmark, và tất cả đều mang tính quy trình thay vì cụ thể cho từng trường hợp. Quy tắc SpreadsheetBench, nguyên văn: kiểm tra cấu trúc và công thức bảng tính, sau đó viết các giá trị tĩnh đã được đánh giá trên toàn bộ phạm vi mục tiêu được yêu cầu thay vì dựa vào việc tính toán lại của Excel.

Điều này ngụ ý gì về tính di động

Chi phí huấn luyện được trả một lần, ngoại tuyến và được đo lường. Bài báo nghiên cứu báo cáo từ 0,6 triệu đến 46,4 triệu token huấn luyện cho mỗi điểm kiểm tra tuyệt đối, tùy thuộc vào benchmark. SpreadsheetBench ở mức 0,6 triệu mỗi điểm; DocVQA ở mức 46,4 triệu. Mô hình tối ưu hóa chỉ chạy trong quá trình huấn luyện và không thêm bất kỳ lệnh gọi suy luận nào khi triển khai.

Nếu một kỹ năng được huấn luyện trong một môi trường thực thi có thể duy trì trong môi trường khác, thì chi phí một lần đó sẽ được phân bổ trên các môi trường. Kết quả SpreadsheetBench từ Codex → Claude Code là bằng chứng cho sự tồn tại này. Nó cũng ngụ ý rằng bạn có thể tối ưu hóa ở nơi có công cụ rẻ nhất và triển khai ở nơi sản phẩm thực sự hoạt động.

Góc độ kiểm toán là một khía cạnh riêng biệt và bị đánh giá thấp. Sản phẩm được triển khai là một tệp văn bản mà một chuyên gia trong lĩnh vực có thể đọc trong vài phút. Mọi thay đổi đối với nó đều có thể truy xuất nguồn gốc: mỗi bước ghi lại một tệp edit_apply_report.json với trạng thái chấp nhận và bỏ qua cho từng chỉnh sửa. Tính di động cộng với khả năng kiểm tra là một tư thế vận hành khác biệt so với việc vận chuyển các trọng số đã được tinh chỉnh (fine-tuned weights).

Các điểm chính cần ghi nhớ

Tài nguyên: Bài báo, GitHub, Trang dự án, Tài liệu, PyPI và Video demo

Các baseline được tham chiếu: GEPA, TextGrad, EvoSkill và Trace2Skill

Các benchmark được tham chiếu: SearchQA, SpreadsheetBench, DocVQA, LiveMathematicianBench và ALFWorld

Asif Razzaq là Giám đốc điều hành của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.

AI AgentMicrosoftTối ưu hóa AINghiên cứu AITự động hóa
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.