LangChain: Blog
85

Thủ thuật

Hướng dẫn đánh giá Voice Agent với LangSmith: Từ hiệu năng đến trải nghiệm người dùng

(giờ Việt Nam)

Tóm tắt AI

Bài viết từ LangChain hướng dẫn cách hệ thống hóa việc kiểm thử Voice Agent thông qua LangSmith, tập trung vào ba khía cạnh: thực thi, kết quả và trải nghiệm người gọi bằng các công cụ như LLM judges và đánh giá thủ công.

Bản dịch AI

How to Evaluate Voice Agents with LangSmith

Xây dựng các voice agent (tác nhân giọng nói) là một việc khó khăn vì một agent tốt phải mang lại cảm giác tự nhiên khi trò chuyện, có khả năng giải quyết vấn đề của người dùng và đạt được kết quả kinh doanh như mục tiêu thiết kế ban đầu.

Một cuộc gọi có thể bao gồm những khoảng lặng dài từ phía agent gây cảm giác gượng gạo nhưng vẫn giải quyết được vấn đề của người dùng. Hoặc, một agent có thể tuân thủ chính xác các hướng dẫn nhưng vẫn làm khách hàng thất vọng vì thiếu ngữ cảnh cần thiết để trả lời yêu cầu của họ.

Cả hai kịch bản trên đều cho thấy cần phải cải thiện. Việc đánh giá giúp các đội ngũ xác định những điểm yếu đó và đo lường xem các thay đổi có thực sự làm cho agent tốt hơn hay không.

Đó là lý do tại sao chúng tôi khuyến nghị đánh giá các voice agent dựa trên ba khía cạnh:

Các khía cạnh này có liên quan với nhau nhưng không thể thay thế cho nhau. Và để đánh giá chúng hiệu quả, bạn cần nhiều hơn là chỉ một bản ghi chép (transcript). Trong LangSmith, bạn có thể theo dõi toàn bộ tương tác, chấm điểm bằng nhiều trình đánh giá (evaluator), kiểm tra bản ghi âm và hoạt động của công cụ, cũng như so sánh các thay đổi theo thời gian.

Thực thi (Execution): Agent có tuân thủ các hướng dẫn của nó không?

Khía cạnh Thực thi đo lường xem agent có bám sát thiết kế của nó hay không.

Thực thi bao gồm cả phản hồi cuối cùng và lộ trình mà agent đã thực hiện để tạo ra phản hồi đó. Một voice agent có thể đưa ra câu trả lời đúng nhưng lại gọi các công cụ không cần thiết, bỏ qua bước xác nhận bắt buộc hoặc truy cập vào thông tin mà lẽ ra nó không được phép sử dụng. Đối với một lần gọi đơn lẻ, điều này có thể chấp nhận được, nhưng với các tương tác lặp đi lặp lại, những sai sót này có thể tạo ra trải nghiệm người dùng tồi tệ.

Sử dụng các trình đánh giá tất định (deterministic evaluators) cho các yêu cầu rõ ràng.

Một số yêu cầu về thực thi có thể được đánh giá bằng các quy tắc đơn giản. Đối với một agent đặt lịch hẹn, bạn có thể kiểm tra xem:

Các kiểm tra này hoạt động hiệu quả khi hành vi đúng đắn có thể được xác định một cách rõ ràng. Chúng cũng nhanh chóng và ít tốn kém vì không yêu cầu thêm một lệnh gọi mô hình (model call) nào khác.

Trong LangSmith, đây là nơi các trình đánh giá bằng mã (code evaluators) đặc biệt hữu ích. Bạn có thể theo dõi lệnh gọi và sau đó kiểm tra các quy tắc tất định dựa trên dấu vết (trace) đó.

Sử dụng LLM judge cho các yêu cầu về ngữ nghĩa.

Các yêu cầu khác phụ thuộc vào ý nghĩa thay vì các giá trị chính xác. Một LLM judge có thể đánh giá xem agent có:

LLM judge hoạt động tốt nhất khi nhiệm vụ hẹp và các tiêu chí được xác định rõ ràng. Một câu hỏi chung chung như “Phản hồi này có tốt không?” sẽ tạo ra kết quả nhiễu. Một bộ tiêu chí (rubric) cụ thể sẽ mang tính lặp lại cao hơn:

Trong LangSmith, đây là nơi một LLM judge có thể chấm điểm một cuộc hội thoại dựa trên một bộ tiêu chí chính xác. Ví dụ, bạn có thể chấm điểm xem agent có hỏi về múi giờ còn thiếu trước khi tiếp tục hay không, hoặc liệu nó có xử lý đúng một yêu cầu nhạy cảm về chính sách hay không.

LLM judge hoạt động hiệu quả vì các nhiệm vụ đánh giá hẹp dễ thực hiện hơn so với việc tạo ra phản hồi gốc, đặc biệt là khi trình đánh giá nhận được một bộ tiêu chí rõ ràng và toàn bộ dấu vết tương tác.

Kết quả (Outcome): Tương tác có đạt được mục tiêu hay không?

Giả sử một agent đặt lịch được hướng dẫn thu thập ngày giờ, kiểm tra tình trạng sẵn sàng và đặt lịch hẹn. Nó hoàn thành cả ba bước. Nhưng quy trình làm việc không yêu cầu nó xác nhận múi giờ của người gọi, dẫn đến việc cuộc hẹn bị đặt sai giờ. Trong trường hợp này, agent đã tuân thủ hướng dẫn chính xác nhưng vẫn làm người dùng thất bại. Sự khác biệt này tách biệt giữa việc tuân thủ hướng dẫn và hiệu quả đạt được, và nó cực kỳ quan trọng để đánh giá xem một voice agent có đang hoạt động hiệu quả hay không.

Đánh giá các kết quả định tính bằng LLM judge.

Một LLM judge có thể giúp xác định xem tương tác có đạt được mục tiêu dự định hay không:

Những đánh giá này chỉ ra sự can thiệp phù hợp. Một thất bại có thể đòi hỏi việc cập nhật cơ sở tri thức, thêm công cụ, làm rõ hướng dẫn hoặc xác định hành vi cho một kịch bản mà các nhà phát triển chưa lường trước được.

Ví dụ, trong LangSmith, bạn có thể chấm điểm một cuộc hội thoại đặt lịch dựa trên việc liệu người dùng gọi đến để đặt lịch có kết thúc cuộc gọi với một lịch hẹn đã được xác nhận hay không.

Các cuộc gọi thực tế cũng có thể bộc lộ những thất bại một cách gián tiếp. Một người gọi có thể nói: “Tôi đã gọi trước đó, nhưng cuộc hẹn bị đặt sai giờ.” Tín hiệu đó có thể tiết lộ một thất bại về kết quả mà ban đầu không rõ ràng trong cuộc hội thoại.

Đo lường các kết quả kinh doanh hạ nguồn (downstream business outcomes).

Bất cứ khi nào có thể, hãy đo lường kết quả hạ nguồn thay vì chỉ suy luận sự thành công từ cuộc hội thoại. Một agent đặt lịch nên được đánh giá dựa trên hồ sơ cuộc hẹn, một agent hỗ trợ dựa trên tỷ lệ giải quyết và dữ liệu mở lại ticket, và một agent chuyển tiếp dựa trên việc người gọi có đến được đúng bộ phận cần thiết hay không.

Ví dụ:

Các chỉ số kết quả hữu ích có thể bao gồm tỷ lệ đặt lịch thành công, tỷ lệ giải quyết, tỷ lệ chuyển tiếp, tỷ lệ chuyển tiếp thành công, tỷ lệ vấn đề bị mở lại, tỷ lệ chuyển đổi hoặc tỷ lệ bỏ cuộc. Chỉ số phù hợp phụ thuộc vào quy trình làm việc.

Trong LangSmith, bạn có thể kết nối các tín hiệu kinh doanh này trở lại dấu vết gốc và chấm điểm cuộc hội thoại dựa trên kết quả thực tế. Điều đó giúp dễ dàng nhận thấy liệu một prompt mới có cải thiện luồng hội thoại đồng thời cải thiện kết quả kinh doanh thực tế hay không.

Trải nghiệm (Experience): Cuộc hội thoại có diễn ra tốt đẹp đối với người gọi không?

Một voice agent đại diện cho doanh nghiệp của bạn trước khách hàng. Người gọi không chỉ trải nghiệm những gì agent nói, mà còn cả tốc độ phản hồi, độ rõ ràng của giọng nói và sự tự nhiên khi tham gia vào cuộc hội thoại. Một agent chính xác và hiệu quả vẫn có thể là một voice agent kém.

Đo lường khả năng phản hồi.

Độ trễ (Latency) là một trong những đặc điểm dễ nhận thấy nhất của tương tác giọng nói. Chỉ số chính mà người dùng cảm nhận được thường là độ trễ cuối lượt (end-of-turn latency): khoảng thời gian từ khi người gọi kết thúc lượt nói đến khi agent bắt đầu phản hồi.

Một quy trình giọng nói điển hình bao gồm phát hiện hoạt động giọng nói, chuyển đổi giọng nói thành văn bản (speech-to-text), suy luận mô hình, gọi công cụ và chuyển đổi văn bản thành giọng nói (text-to-speech). Việc đo lường từng thành phần riêng biệt giúp xác định xem độ trễ đến từ khâu phiên âm, suy luận, hệ thống bên ngoài hay tạo âm thanh.

Các phép đo hữu ích bao gồm:

Cùng một khoảng lặng gượng gạo có thể do nhiều nguyên nhân khác nhau. Mô hình có thể chậm, một công cụ có thể đang bị chặn hoặc quá trình tạo giọng nói có thể phải đợi cho đến khi toàn bộ phản hồi được tạo xong. Các dấu vết trong LangSmith giúp xác định thành phần nào gây ra độ trễ thay vì coi độ trễ là một con số "hộp đen" duy nhất.

Đánh giá tính tự nhiên và độ rõ ràng.

Tính tự nhiên bao gồm nhiều yếu tố hơn là việc giọng nói được tạo ra có giống người hay không. Nó có thể bao gồm:

Những đặc tính này có thể được chấm điểm bởi một mô hình có khả năng xử lý âm thanh. Một trình đánh giá chỉ dựa trên văn bản có thể đánh giá xem cách diễn đạt có rõ ràng hay thân thiện hay không, nhưng nó không thể xác định một cách đáng tin cậy liệu giọng nói của agent có rõ ràng hay thân thiện hay không. Các khẳng định về cách truyền đạt bằng giọng nói đòi hỏi phải truy cập vào dữ liệu âm thanh.

LangSmithVoice AgentĐánh giá AILangChainPhát triển AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.