Sản phẩm
Google chính thức ra mắt dịch vụ đánh giá Agent và mô hình trên nền tảng Gemini Enterprise
(giờ Việt Nam)
Tóm tắt AI
Google vừa đưa dịch vụ đánh giá của Gemini Enterprise Agent Platform vào vận hành chính thức, cung cấp công cụ thống nhất giúp nhà phát triển đo lường chất lượng AI Agent từ giai đoạn thử nghiệm đến khi triển khai thực tế.
Bản dịch AI

31 THÁNG 7, 2026
Chất lượng của agent phải được đo lường trong quá trình phát triển dựa trên các trường hợp (cases) bạn đã viết, và sau khi ra mắt dựa trên các tác vụ mà agent thực tế đã thực hiện. Các tính năng đánh giá agent và mô hình trong Agent Platform hiện đã chính thức khả dụng (generally available), cho phép bạn đo lường và so sánh các agent và mô hình ở cả hai giai đoạn trên cùng một công cụ với các chỉ số nhất quán. Khi bạn sử dụng phương pháp chấm điểm chất lượng nhất quán cho cả thử nghiệm cục bộ (local experiments) và lưu lượng truy cập thực tế (live traffic), sự sai lệch (drift) trong môi trường sản xuất sẽ chỉ ra vấn đề nằm ở agent thay vì cách thức đo lường.
Những tính năng đã chính thức khả dụng
Bạn có thể truy cập các tính năng đánh giá từ Agent Platform SDK, agents-cli, phần Evaluation trong bảng điều khiển Google Cloud của Agent Platform và trực tiếp từ ADK.
Thử nghiệm (Experiments)
Đơn vị công việc chính trong đánh giá là thử nghiệm (experiment), bao gồm một tập dữ liệu các trường hợp đánh giá (eval cases) cùng một bộ chỉ số và điểm số để chạy và xem xét khi bạn lặp lại quy trình. Dịch vụ đánh giá đi kèm với giao diện người dùng linh hoạt để xác định các chỉ số, khởi chạy các lượt chạy mới và xem xét kết quả, đi sâu đến từng lỗi cụ thể, nơi bạn có thể mở toàn bộ trace và nhật ký phiên (session log) của agent để xem chính xác điều gì đã xảy ra.
Rất tiếc, trình duyệt của bạn không hỗ trợ phát video này.
Evals Worksheet — xem xét và chạy các đánh giá agent.
Bạn có thể chạy thử nghiệm cục bộ để lặp lại nhanh chóng, hoặc nếu agent của bạn đã được triển khai trên Agent Platform với tính năng đo từ xa (telemetry) được bật, bạn có thể chấm điểm các phiên và trace hiện có, hoặc chạy agent với trình mô phỏng người dùng (user simulator) được bật để tạo các trace trước khi người dùng thực tế tạo ra chúng. Mọi artifact của thử nghiệm đều được lưu trữ minh bạch trong Cloud Storage, vì vậy bạn có thể quản lý phiên bản và kiểm tra các lượt chạy của mình để đảm bảo tính tuân thủ và lưu trữ lâu dài.
Đối với các công việc đánh giá quy mô lớn, hệ thống hỗ trợ phân cụm vấn đề (issue clustering): nó nhóm các lỗi đánh giá thành các cụm có thể hiểu và xử lý được dựa trên phân loại lý do lỗi của riêng bạn. Nếu bạn chưa xây dựng hệ thống phân loại, bạn có thể sử dụng hệ thống có sẵn của chúng tôi cho các rubric thích ứng (adaptive rubrics), bao gồm các cách phổ biến mà agent thường gặp lỗi.
Chỉ số đánh giá (Evaluation metrics)
Hơn 20 chỉ số có sẵn được tích hợp trong dịch vụ. Các chỉ số dựa trên tính toán sẽ chấm điểm một cách xác định dựa trên tham chiếu thực tế (ground-truth): ROUGE cho tóm tắt, BLEU, MetricX và COMET cho dịch thuật, và khớp chính xác (exact match) cho QA trích xuất.
Ngoài ra, rubric thích ứng là một quy trình chỉ số LLM-judge nâng cao được đồng phát triển với các đối tác nghiên cứu của chúng tôi tại Google DeepMind. Nó tạo ra các bài kiểm tra đạt/không đạt (rubrics) cụ thể cho từng trường hợp từ định nghĩa trường hợp đánh giá, hướng dẫn của nhà phát triển và các khai báo công cụ. Sau đó, nó chấm điểm các trace dựa trên các rubric này, đưa ra phán quyết và lý do cho từng rubric.

Rubric thích ứng với các tiêu chí được tạo cho từng trường hợp đánh giá.
Chúng tôi đã thiết kế và hiệu chỉnh các biến thể cho những gì bạn thường muốn biết về một agent. Task Success chấm điểm việc hoàn thành mục tiêu trong suốt cuộc hội thoại dựa trên kết quả quan sát được và các xác nhận trong phản hồi của agent. Tool Use Quality đánh giá việc lựa chọn công cụ, tính chính xác của đối số và sự tuân thủ lược đồ (schema). Safety chấm điểm phản hồi dựa trên các chính sách nội dung bao gồm ngôn từ thù ghét, quấy rối, nội dung nguy hiểm, tài liệu khiêu dâm và PII, đồng thời trả về các chính sách bị vi phạm. Các chỉ số về Trajectory Quality, Final Response Quality, Hallucination, Grounding, cùng chất lượng hình ảnh và video cũng được cung cấp. Các hướng dẫn bằng ngôn ngữ tự nhiên giúp điều hướng việc tạo rubric theo các tiêu chí bạn chỉ định, với nhóm rubric kết quả có thể xem xét và tái sử dụng trên các agent khác nhau.
Khi các chỉ số có sẵn không phù hợp, bạn có thể tự tạo chỉ số riêng. Một chỉ số dựa trên mã nguồn (code-based metric) là một hàm Python, bao gồm khớp văn bản chính xác, kiểm tra cấu trúc JSON và bất kỳ thứ gì có thể biểu diễn bằng mã. Một chỉ số LLM-as-a-judge mang theo các tiêu chí, thang đo và mô hình đánh giá của riêng bạn. Khi chạy cục bộ, bạn có thể sử dụng bất kỳ mô hình nào từ bất kỳ nhà cung cấp nào, và các lượt chạy đánh giá phía máy chủ (server-side) hỗ trợ bất kỳ mô hình nào trong Model Garden, bao gồm tất cả các mô hình Gemini và Anthropic.
Dù chỉ số được định nghĩa như thế nào, nó đều nằm trong cùng một registry được quản lý phiên bản trên toàn tổ chức, chạy không thay đổi trong các thử nghiệm ngoại tuyến (offline) và giám sát trực tuyến (online). Chúng tôi đang tích cực mở rộng phạm vi sang các tác vụ chuyên biệt hơn và các phương thức đầu vào khác, và chúng tôi rất hoan nghênh phản hồi của bạn.
Giám sát trực tuyến và tích hợp đo từ xa
Một agent đạt kết quả tốt trên toàn bộ bộ kiểm thử vẫn có thể bị sai lệch (drift) một tuần sau khi ra mắt khi đối mặt với các đầu vào mà chưa ai viết trường hợp kiểm thử cho nó. Đó không hẳn là lỗi kiểm thử mà là thực tế của môi trường sản xuất, nơi các tác vụ thực tế lớn hơn và lạ lẫm hơn bất kỳ bộ kiểm thử nào bạn có thể viết trước.
Các chỉ số bạn đã xây dựng khi phát triển agent nên tiếp tục chạy sau khi agent ra mắt. Nếu bạn đã thu thập trace và phiên thông qua Cloud Trace, bạn có thể đánh giá chúng trực tiếp chỉ với một cú nhấp chuột trong giao diện người dùng trace. Tốt hơn nữa là thiết lập giám sát trực tuyến (online monitor) để chấm điểm lưu lượng truy cập thực tế ngay khi nó đến. Để tránh chấm điểm mọi yêu cầu và giữ chi phí ở mức hợp lý, bạn có thể sử dụng tính năng lấy mẫu (sampling) và bộ lọc mục tiêu tích hợp sẵn. Khi các trình giám sát hoạt động, bạn có thể xem điểm số theo thời gian trên các bảng điều khiển tích hợp và thậm chí thiết lập cảnh báo sai lệch qua email, Slack hoặc các kênh khác.

Các trình giám sát trực tuyến hiển thị điểm đánh giá trên các trace trong môi trường sản xuất.
Tạo trường hợp kiểm thử và mô phỏng
Mỗi đánh giá đều cần các trường hợp kiểm thử để chạy, và việc viết thủ công tất cả chúng rất chậm và dễ bỏ sót những trường hợp không rõ ràng. Dịch vụ đánh giá có thể tạo chúng cho bạn với trình tạo trường hợp (case generator), trình mô phỏng người dùng (user simulator) và trình mô phỏng môi trường (environment simulator).
Trình tạo trường hợp tạo ra các trường hợp đánh giá tổng hợp từ hướng dẫn và công cụ của agent, vì vậy bạn không cần bắt đầu từ con số không hoặc giới hạn phạm vi kiểm thử trong những gì bạn nghĩ ra. Đối với các agent ADK, nó có thể kết hợp với trình mô phỏng người dùng để đạt được các kịch bản khó tạo thủ công: bạn xác định một persona và một kế hoạch hội thoại ngắn, trình mô phỏng sẽ đóng vai người dùng đó trong suốt quá trình trao đổi nhiều lượt, giúp bạn đánh giá các tương tác qua lại thực tế mà không cần viết kịch bản cho từng phản hồi.
Trình mô phỏng môi trường đóng vai trò thay thế cho các hệ thống mà agent của bạn gọi. Hãy trỏ nó vào một công cụ, cung cấp phản hồi bạn muốn — dữ liệu giả (mocked data), lỗi ép buộc, độ trễ bổ sung — và nó sẽ chặn cuộc gọi đó trong quá trình chạy, giúp bạn kiểm tra cách agent xử lý backend bị lỗi hoặc chậm mà không cần chạm vào môi trường sản xuất.
Giá cả và tính khả dụng
Các tính năng đánh giá agent và mô hình hiện đã chính thức khả dụng. Để biết các khu vực được hỗ trợ và các tính năng bảo mật doanh nghiệp, hãy xem bảng khu vực và tính năng bảo mật. Bạn trả phí theo mức giá tiêu chuẩn cho các lệnh gọi mô hình phía sau LLM-as-a-judge và các chỉ số dựa trên mô hình khác – cộng với phí Cloud Storage cho các artifact mà lượt chạy phía máy chủ lưu giữ. Các chỉ số dựa trên mã nguồn và tính toán không phát sinh thêm chi phí. Tập dữ liệu và trace của bạn luôn nằm trong dự án của bạn.
Bắt đầu
Đánh giá đồng hành cùng bạn trong bất kỳ công cụ nào bạn đang dùng để xây dựng agent. Nó là một phần của Agent Platform SDK, với các thao tác tương tự có sẵn qua REST API cho các ngôn ngữ và quy trình mà SDK chưa hỗ trợ.
Nếu bạn làm việc từ dòng lệnh, agents-cli biến đánh giá thành một lệnh hạng nhất bên cạnh các lệnh bạn đã sử dụng để triển khai agent và kiểm tra đo từ xa (hiện tại là các agent ADK-Python). Bạn thậm chí có thể chạy vòng lặp trực tiếp từ agent lập trình của mình: một kỹ năng có thể tái sử dụng sẽ hướng dẫn Claude Code và các công cụ tương tự thông qua toàn bộ quy trình chất lượng agent. Đối với các nhóm xây dựng trên ADK, đánh giá được tích hợp sẵn trong framework — xác định các bộ đánh giá và chạy chúng cục bộ với agent của bạn trong khi phát triển, bao gồm cả bên trong pytest cho CI. Và khi bạn muốn xem xét một lượt chạy mà không cần viết mã, Evals Worksheet web UI chính là lưới dữ liệu được đề cập ở trên.
Chúng tôi rất nóng lòng được thấy những gì bạn sẽ ra mắt.
Trước
Tiếp theo
Bài viết được AI dịch và tổng hợp tự động từ Google Developers Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.