Sản phẩm
LangSmith ra mắt Tuned Evaluators: Đánh giá chất lượng AI trực tiếp trên môi trường thực tế
(giờ Việt Nam)
Tóm tắt AI
LangSmith giới thiệu tính năng Tuned Evaluators, cho phép gắn phản hồi chất lượng trực tiếp vào các trace trong môi trường thực tế, bắt đầu với khả năng phát hiện lỗi (Perceived Error) giúp đội ngũ tối ưu hóa AI hiệu quả hơn.
Bản dịch AI

Mọi tác nhân hội thoại (conversational agent) trong môi trường thực tế đều cần được đánh giá về Perceived Error (Lỗi cảm nhận). Đây là một trong những tín hiệu rõ ràng nhất cho thấy tác nhân của bạn đang mang lại trải nghiệm hữu ích cho người dùng.
Cho đến nay, việc đánh giá Perceived Error vẫn rất tốn kém và khó mở rộng. Các đội ngũ thường phải dựa vào các lệnh gọi mô hình frontier (frontier model), chỉ lấy mẫu một phần nhỏ các dấu vết (traces) và mất thời gian tinh chỉnh thủ công bộ đánh giá.
Hôm nay, chúng tôi giới thiệu Tuned Evaluators, công cụ tự động gắn phản hồi chất lượng vào các dấu vết và luồng hội thoại trong môi trường thực tế. Các đội ngũ có thể sử dụng phản hồi đó để tìm ra những hành vi cần chú ý, hiểu rõ nguyên nhân sai sót và thực hiện các hành động cải thiện tác nhân của mình.
Mỗi Tuned Evaluator là một bộ đánh giá hoàn chỉnh, được đánh phiên bản cho một mục tiêu cụ thể. LangChain đã thực hiện công việc chuyển đổi mục tiêu đó thành một "giám khảo" sẵn sàng cho môi trường thực tế. Các đội ngũ chỉ cần chọn bộ đánh giá họ cần và gắn nó vào một dự án tracing.
Bộ giám khảo chất lượng cao, chi phí thấp chạy trên mọi cuộc hội thoại
Việc áp dụng đánh giá chất lượng cao trên các dấu vết thực tế từ trước đến nay buộc các đội ngũ phải lựa chọn giữa độ chính xác và phạm vi bao phủ.
Các mô hình frontier có thể đưa ra những đánh giá mạnh mẽ, nhưng việc áp dụng chúng trên nhiều cuộc hội thoại thực tế lại rất đắt đỏ. Các mô hình nhỏ hơn có chi phí thấp hơn, nhưng độ chính xác thấp hơn khiến việc tin tưởng vào các dấu vết cần chú ý trở nên khó khăn. Kết quả là, nhiều đội ngũ chỉ đánh giá một mẫu nhỏ các luồng hội thoại, dẫn đến nguy cơ bỏ lỡ những tín hiệu quan trọng cho thấy tác nhân đang mang lại trải nghiệm tồi tệ cho khách hàng.
Chi phí suy luận (inference cost) chỉ là một phần của công việc. Việc xây dựng một bộ đánh giá đáng tin cậy còn đòi hỏi phải xác định hành vi, giải quyết các trường hợp mơ hồ, tạo nhãn, lựa chọn và kiểm chuẩn (benchmark) bộ giám khảo, cũng như duy trì nó khi các mô hình và hành vi thực tế thay đổi. Tuned Evaluators đóng gói công việc đó thành một sản phẩm mà các đội ngũ có thể gắn vào và sử dụng ngay lập tức.
Tuned Evaluators cũng giải quyết sự đánh đổi giữa chi phí và chất lượng bằng các mô hình chuyên biệt được huấn luyện bổ sung (post-trained) cho các mục tiêu đánh giá hẹp, vượt qua hiệu suất của các mô hình frontier với chi phí chỉ bằng một phần nhỏ. Khi chạy Tuned Evaluators, bạn nhận được nhiều tín hiệu hơn để định hướng cải thiện tác nhân, đồng thời tiết kiệm đáng kể thời gian kỹ thuật và chi phí suy luận.
Cách thức hoạt động của Tuned Evaluators
LangChain viết, kiểm thử, đánh phiên bản và duy trì prompt của bộ đánh giá. Chúng tôi cũng quản lý mô hình giám khảo, thực hiện kiểm chuẩn so với các mô hình frontier, thông tin xác thực của nhà cung cấp và cơ sở hạ tầng suy luận.
Sử dụng kết quả của Tuned Evaluator trong quy trình cải thiện của bạn
Các đội ngũ có thể sử dụng các dấu vết đã được làm giàu (enriched traces) trong các quy trình phân tích, tác nhân lập trình (coding-agent), CI, đánh giá bởi con người và quy trình đánh giá của riêng họ. Tuned Evaluators hỗ trợ:
Bắt đầu với Perceived Error
Perceived Error phát hiện các cuộc hội thoại chứa bằng chứng cho thấy tác nhân đã mắc lỗi, hiểu sai yêu cầu hoặc đưa tương tác đi sai hướng.
Bằng chứng đó có thể rõ ràng, chẳng hạn như sự đính chính từ người dùng, yêu cầu lặp lại hoặc hành động bị từ chối. Mô hình cũng có thể suy luận từ các phản hồi mâu thuẫn, lỗi đã được thừa nhận, sự hiểu lầm dai dẳng hoặc các kết quả chưa được giải quyết.
Perceived Error là một chỉ số đại diện (proxy) hữu ích để biết liệu một tác nhân có đang đáp ứng nhu cầu của người dùng hay không. Hầu hết người dùng không bao giờ gửi đánh giá rõ ràng, vì vậy bằng chứng thường phải được suy luận từ chính cuộc hội thoại.
LangChain đã huấn luyện bổ sung một mô hình chuyên biệt trên các dấu vết được dán nhãn của các tác nhân hội thoại. Nó đã vượt qua mọi mô hình frontier trong bài kiểm chuẩn của chúng tôi trong khi giảm chi phí đánh giá xuống 82%. Trong một số khối lượng công việc của đối tác sớm, mức tiết kiệm lên tới 98%, với sự biến động chi phí phụ thuộc vào thành phần của luồng hội thoại.
Trải nghiệm của Vanta với tư cách là đối tác sớm cho thấy một lợi ích khác: các đội ngũ có thể thiết lập phạm vi bao phủ chất lượng ngay lập tức trong khi vẫn đang phát triển các bộ đánh giá dành riêng cho doanh nghiệp của họ.

Điều kiện và thời gian
Một luồng hội thoại trở nên đủ điều kiện cho bộ đánh giá Perceived Error sau khi nó chứa ít nhất hai cặp tin nhắn người-AI và đạt đến khoảng thời gian chờ (idle period) đã cấu hình. Việc đánh giá hoàn tất trong vòng 12 giờ sau khi luồng hội thoại đủ điều kiện.
Tính khả dụng và giá cả
Tuned Evaluator cho Perceived Error hiện đã khả dụng cho tất cả các gói Plus và Cloud Enterprise tại Hoa Kỳ. Mỗi lần đánh giá thành công sẽ phát sinh phí đánh giá đã tinh chỉnh. Các lần đánh giá bị bỏ qua hoặc thất bại sẽ không bị tính phí. Để biết thông tin chung về sử dụng và thanh toán, hãy xem trang giá của chúng tôi.
Bắt đầu
Bạn có thể dùng thử bộ đánh giá Perceived Error ngay hôm nay bằng cách đăng nhập hoặc đăng ký LangSmith và truy cập tài liệu để biết thêm chi tiết.
Nếu bạn có một Tuned Evaluator mà bạn muốn chúng tôi xây dựng, hãy cho chúng tôi biết về trường hợp sử dụng của bạn.
Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.