Google Developers Blog
85

Thủ thuật

Cách Google đánh giá các tác nhân AI đàm thoại thời gian thực bằng ADK

(giờ Việt Nam)

Tóm tắt AI

Google tích hợp khả năng đánh giá thời gian thực vào ADK, cho phép mô phỏng người dùng bằng âm thanh để kiểm thử và chấm điểm các tác nhân AI giọng nói trong quy trình làm việc tự động.

Bản dịch AI

How to Evaluate Live & Voice Agents in ADK

24 THÁNG 8, 2026

Stephen Allen, Kiến trúc sư Giải pháp, Các ứng dụng và Nền tảng AI

Việc đưa một tác nhân (agent) trực tiếp vào môi trường sản xuất không chỉ đơn thuần là một bản demo tốt. Nó phải thực hiện đúng các hành động xuyên suốt cuộc hội thoại bằng lời nói, qua từng lượt phản hồi, nơi mà thời điểm và khả năng phục hồi cũng quan trọng như nội dung. Hành vi nghe có vẻ hoàn hảo ngày hôm qua có thể âm thầm thay đổi chỉ sau một tinh chỉnh prompt hoặc một lần lặp mô hình. Các công cụ ngừng hoạt động. Ngữ cảnh bị mất giữa các lượt. Các câu ngắt lời bị bỏ qua. Để tự tin phát hành sản phẩm, bạn cần có bằng chứng lặp lại được rằng tác nhân đó duy trì ổn định trong các cuộc hội thoại thực tế mà người dùng sẽ trải nghiệm.

Đó là lý do tại sao chúng tôi mang tính năng đánh giá trực tiếp (live evaluation) vào ADK. Giờ đây, bạn có thể điều khiển một tác nhân giọng nói trực tiếp với một người dùng giả lập (simulated user) – người sẽ nói các lượt của mình dưới dạng âm thanh, chấm điểm các phản hồi bằng lời nói và thực hiện tất cả những điều đó ngay trong cùng một vòng lặp đánh giá mà bạn vẫn thường chạy cho các tác nhân văn bản. Bài viết này sẽ giúp bạn đưa một tác nhân trực tiếp từ trạng thái "chạy tốt trong bản demo" đến "được đo lường và đáng tin cậy" mà không cần rời khỏi ADK.

Đánh giá tác nhân trực tiếp đầu tiên của bạn

Để thấy tính năng này hoạt động, chúng ta sẽ xây dựng một vòng lặp đánh giá trực tiếp hoàn chỉnh: tạo tác nhân, soạn thảo bộ đánh giá (eval case), chạy đánh giá và kiểm tra các kết quả đã ghi lại.

Bước 1: Tác nhân cần kiểm thử

Ví dụ của chúng tôi sử dụng quy trình làm việc dựa trên đồ thị (graph-based workflow): ba tác nhân trực tiếp với mục đích đơn lẻ được sắp xếp theo trình tự, với mỗi giai đoạn chạy trên gemini-live-2.5-flash-native-audio.

Python

Đã sao chép

Mỗi giai đoạn là một tác nhân trực tiếp thông thường, với quy trình làm việc đóng vai trò điều phối và chuyển tiếp đầu ra từ giai đoạn này sang giai đoạn tiếp theo. Luồng này đi qua ba bước với một lệnh gọi công cụ (tool call) ở giữa, nhờ đó nó tạo ra một quỹ đạo đa lượt phong phú đáng để chấm điểm. Khi quyền điều khiển chuyển giữa các tác nhân, người dùng sẽ không nhận ra sự chuyển giao. Luồng âm thanh vẫn mở trong suốt quá trình tương tác, và ADK sẽ duy trì trạng thái phiên (session state) tích lũy cùng lịch sử hội thoại để mỗi tác nhân tiếp nối ngữ cảnh thay vì bắt đầu lại từ đầu.

Bước 2: Soạn thảo bộ đánh giá (eval set)

Một bộ đánh giá là tệp JSON chứa các trường hợp kiểm thử (test cases) của bạn. Các trường hợp kiểm thử được tách biệt khỏi cách chúng chạy, vì vậy bạn có thể kết hợp hai phong cách riêng biệt: kịch bản hội thoại và hội thoại cố định.

Đầu tiên là kịch bản hội thoại: bạn mô tả một mục tiêu và một nhân vật (persona), sau đó trình giả lập người dùng sẽ ứng biến các lượt hội thoại.

JSON

Đã sao chép

user_persona định hình cách người dùng giả lập giao tiếp. ADK đi kèm với một vài nhân vật tích hợp sẵn, và NOVICE yêu cầu trình giả lập chỉ chia sẻ các mục tiêu cấp cao và chờ tác nhân hỏi chi tiết, qua đó kiểm tra khả năng dẫn dắt cuộc hội thoại của tác nhân. Các nhân vật được điều khiển bằng prompt thay vì mã hóa cứng, vì vậy bạn có thể mở rộng bộ nhân vật với các lựa chọn của riêng mình. Trình giả lập tự kết thúc kịch bản khi conversation_plan được đáp ứng, vì vậy bạn chỉ cần viết kịch bản mục tiêu và để nó tự quyết định khi nào cuộc gọi kết thúc. Để bảo vệ khỏi các cuộc hội thoại kéo dài vô tận, max_allowed_invocations sẽ giới hạn tổng số lượt, giúp mọi trường hợp động đều có một giới hạn trên có thể dự đoán được.

Bạn cũng có thể soạn thảo một hội thoại cố định và viết kịch bản các lượt của người dùng nguyên văn. Một trường hợp tĩnh cũng là đầu vào hợp lệ cho một lần chạy trực tiếp giống như người dùng giả lập.

JSON

Đã sao chép

Bước 3: Bật chế độ trực tiếp và âm thanh

Trong tệp test_config.json, hãy thêm live_model_config và trỏ ADK vào trình giả lập người dùng llm_audio. Mỗi lượt của người dùng từ các trường hợp trên sẽ được tổng hợp thành giọng nói với giọng Gemini TTS mà bạn chọn và truyền trực tiếp đến tác nhân.

JSON

Đã sao chép

Một vài điểm cần lưu ý:

Một phản hồi bằng lời nói có thể đúng với hàng trăm cách diễn đạt khác nhau. Các tiêu chí đánh giá bằng ngôn ngữ tự nhiên (natural-language rubrics) sẽ đánh giá ý định giống như cách một người đánh giá thực hiện, được ghi lại một lần và áp dụng tự động cho mọi cuộc hội thoại trong bộ kiểm thử của bạn.

Bước 4: Chạy đánh giá

Với tác nhân, bộ đánh giá và cấu hình đã sẵn sàng, hãy chạy đánh giá từ CLI:

Shell

Đã sao chép

Lưu ý: Đảm bảo bạn đã cài đặt các gói bổ sung cho đánh giá (uv pip install -e ".[eval]") và đã cấu hình thông tin xác thực API cho cả Live API và Gemini TTS.

Quy trình này có thể được gọi theo chương trình thông qua AgentEvaluator, giúp dễ dàng tích hợp các đánh giá giọng nói trực tiếp vào quy trình CI/CD của bạn để phát hiện lỗi hồi quy trước khi phát hành.

Bước 5: Kiểm tra kết quả trong ADK Web

Để gỡ lỗi tương tác, ADK Web hiện hỗ trợ đánh giá trực tiếp một cách nguyên bản. Hộp thoại thiết lập chạy bao gồm nút chuyển đổi chế độ Standard | Live. Việc chọn Live sẽ hiển thị các tùy chọn phương thức đầu vào (Âm thanh hoặc Văn bản) cùng với các cài đặt giọng nói và ngôn ngữ cho người dùng giả lập.

evaluating_live_agents_img_1

Sau khi quá trình chạy hoàn tất, ADK sẽ tái tạo luồng âm thanh trực tiếp thành một bản ghi sạch. Mỗi lượt hội thoại hiển thị trong một khung tin nhắn chuyên dụng, hoàn chỉnh với văn bản ghi chép và đoạn clip âm thanh có thể phát trực tiếp, giúp bạn đánh giá tác nhân của mình nghe như thế nào, chứ không chỉ là nó đã nói gì.

evaluating_live_agents_img_2

Bắt đầu

Sẵn sàng kiểm thử tác nhân trực tiếp của bạn chưa? Hãy sao chép mẫu live_workflow, chạy lệnh adk eval và xem kết quả của bạn trong ADK Web.

AI giọng nóiADKKiểm thử AIGeminiPhát triển ứng dụng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google Developers Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.