Sản phẩm
Anthropic ra mắt quy trình đánh giá Plugin cho Claude Code: Kiểm soát chất lượng tự động
(giờ Việt Nam)
Tóm tắt AI
Anthropic giới thiệu quy trình đánh giá mới cho Claude Code, cho phép nhà phát triển kiểm tra hiệu quả của plugin thông qua 6 loại bộ chấm điểm và so sánh với kết quả không dùng plugin, giúp tối ưu hóa kỹ năng cho AI.
Bản dịch AI

Anthropic vừa công bố quy trình đánh giá (evals workflow) plugin mới cho Claude Code. Lệnh `claude plugin eval` sẽ chạy một plugin dựa trên các câu lệnh (prompt) thực tế, chấm điểm kết quả mà Claude tạo ra, và so sánh với kết quả khi không tải plugin đó. Lệnh này giải đáp 3 câu hỏi mà trước đây các nhà phát triển plugin không thể đo lường được: kỹ năng (skill) có được kích hoạt không, nó có hoạt động ổn định sau khi chỉnh sửa hoặc cập nhật mô hình mới không, và nó có vượt trội hơn so với mô hình cơ bản (bare model) hay không.
Khả năng triển khai: Có. Công cụ này chạy trên Claude Code v2.1.269 trở lên đối với bất kỳ thư mục nào có tệp manifest `plugin.json` hoặc `.claude-plugin/plugin.json`, hoặc plugin dạng thư mục kỹ năng (skills-directory). Mỗi lần chạy đánh giá và chấm điểm đều là một lệnh gọi mô hình thực tế và sẽ được tính phí vào gói dịch vụ hoặc tài khoản API của bạn.
Cấu trúc của một trường hợp thử nghiệm (case)
Một bộ đánh giá (eval suite) nằm trong thư mục `evals/` bên trong plugin. Mỗi trường hợp là một thư mục con chứa tệp `prompt.md` và thư mục `graders/`. Nội dung của prompt sẽ được gửi đến Claude chính xác như văn bản gốc, và các tham chiếu `@path` sẽ không được mở rộng. Phần Frontmatter trong `prompt.md` có thể thiết lập `max_turns` (mặc định là 10), `timeout_seconds` (mặc định là 300), `model`, `tags` và `allowed_tools`.
Grader là các tệp markdown có phần frontmatter thiết lập loại (type), trọng số tùy chọn (optional weight) và nhánh tùy chọn (optional arm). Có 6 loại grader. Bốn loại không tốn phí vì được tính toán từ bản ghi (transcript) và các tệp trên ổ đĩa: `regex`, `tool_used`, `tool_order` và `file_exists`. Hai loại còn lại yêu cầu gọi mô hình giám khảo (judge model) và sẽ tính phí: `llm` (chấm điểm phản hồi dựa trên các tiêu chí văn bản bạn viết) và `baseline` (so sánh phản hồi với câu trả lời tham chiếu).
Lệnh `claude plugin eval init` sẽ đọc plugin, hỏi xem kết quả như thế nào là tốt, đề xuất các trường hợp và grader, chạy thử chúng và tạo các tệp tương ứng. Trong môi trường CI, tham số `--bare <name>` sẽ tạo ra một mẫu trống thay vì tự động đề xuất.
Con số quan trọng nhất là Δ
Theo mặc định, mỗi trường hợp sẽ chạy hai lần: một lần có tải plugin (with-arm) và một lần không tải (without-arm). Sự khác biệt giữa chúng, Δ, chính là giá trị mà plugin đóng góp. Nếu một trường hợp đạt điểm 1.0 ở cả hai lần chạy, thì plugin không phải là lý do dẫn đến thành công đó. Ví dụ trong tài liệu cho thấy một trường hợp đơn lẻ có kết quả: WITH 1.00, W/OUT 0.33, Δ +0.67 sau 6 lần chạy, với chi phí ước tính là 0,41 USD và mất 74 giây. Một grader được đánh dấu `with-only` (thường là `tool_used: Skill`) sẽ được báo cáo như một chỉ số và loại khỏi điểm số tổng, vì nhánh không tải plugin (without-arm) không có kỹ năng để kích hoạt.
Anthropic chỉ ra phát hiện phổ biến nhất: Δ gần bằng 0 trong khi grader `tool_used: Skill` thất bại, điều này có nghĩa là Claude không chọn kỹ năng đó khi sử dụng ngôn ngữ tự nhiên. Đây là lỗi mà `claude plugin validate` không thể phát hiện được, vì nó chỉ kiểm tra cú pháp và schema của manifest thay vì hành vi thực tế.
Kết quả được lưu tại `evals/results/<timestamp>/report.html` kèm theo phán quyết của từng grader và phiếu bầu của mô hình giám khảo. Nếu tài khoản hỗ trợ, báo cáo cũng sẽ được xuất bản lên claude.ai trừ khi tham số `--no-publish` được thiết lập.
Chi phí và CI
Một bộ đánh giá tiêu tốn khoảng (số trường hợp × số lần chạy × số nhánh) lượt chạy tác nhân (agent runs), cộng thêm 3 lệnh gọi giám khảo ngắn cho mỗi grader loại `llm` hoặc `baseline` trên mỗi lần chạy, và kết quả có thể thay đổi giữa các lần chạy. Lệnh gọi CI được ghi lại trong tài liệu là:
Trình chạy (runner) cần cài đặt Claude Code và các thông tin xác thực như `ANTHROPIC_API_KEY`. Nếu không có `--trust-plugin`, một bản checkout không đáng tin cậy sẽ bị từ chối với mã thoát 1 khi không có terminal. Các vấn đề trong báo cáo không bao giờ làm thay đổi mã thoát, và `--json` sẽ ẩn các thông báo tiến trình.
Giải thích tương tác
Những điểm chính cần lưu ý
Hãy xem qua các chi tiết kỹ thuật (Technical details). Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter, đừng quên tham gia SubReddit 150k+ ML của chúng tôi và đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến (Webinar), v.v.? Hãy kết nối với chúng tôi.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.