LangChain: Blog
85

Sản phẩm

LangSmith ra mắt Align Evals: Tinh chỉnh bộ đánh giá LLM theo tiêu chuẩn con người

(giờ Việt Nam)

Tóm tắt AI

LangSmith giới thiệu tính năng Align Evals giúp đồng bộ hóa các bộ đánh giá LLM tự động với đánh giá của con người, từ đó giảm thiểu sai lệch và nâng cao độ tin cậy cho quy trình kiểm thử mô hình.

Bản dịch AI

Introducing Align Evals: Streamlining LLM Application Evaluation

Đánh giá (evaluations) là kỹ thuật then chốt để cải thiện ứng dụng của bạn — cho dù bạn đang làm việc với một prompt đơn lẻ hay một agent phức tạp. Khi bạn so sánh các mô hình, cập nhật logic hoặc lặp lại kiến trúc của mình, đánh giá là cách đáng tin cậy để chấm điểm đầu ra và hiểu rõ tác động từ những thay đổi của bạn.

Tuy nhiên, một thách thức lớn mà chúng tôi liên tục nhận được từ các đội ngũ là: "Điểm đánh giá của chúng tôi không khớp với những gì mà con người trong nhóm mong đợi." Sự sai lệch này dẫn đến các so sánh thiếu chính xác và gây lãng phí thời gian khi phải chạy theo những tín hiệu sai lệch.

Đó là lý do chúng tôi giới thiệu Align Evals, một tính năng mới trong LangSmith giúp bạn hiệu chỉnh các trình đánh giá (evaluators) để khớp hơn với sở thích của con người. Tính năng này được lấy cảm hứng từ bài viết của Eugene Yan về việc xây dựng các trình đánh giá LLM-as-a-judge.

Tính năng này hiện đã khả dụng cho tất cả người dùng LangSmith Cloud và sẽ được phát hành cho LangSmith Self-Hosted vào cuối tuần này. Hãy xem video hướng dẫn hoặc đọc tài liệu dành cho nhà phát triển của chúng tôi để bắt đầu.

Việc tạo ra các trình đánh giá LLM-as-a-judge chất lượng cao giờ đây đã trở nên dễ dàng hơn

Cho đến nay, việc lặp lại các trình đánh giá thường bao gồm rất nhiều sự phỏng đoán. Rất khó để phát hiện các xu hướng hoặc sự không nhất quán trong hành vi của trình đánh giá, và sau khi thay đổi prompt của trình đánh giá, bạn có thể không rõ điểm dữ liệu nào đã khiến điểm số thay đổi hoặc tại sao lại như vậy.

Với tính năng LLM-as-a-Judge Alignment mới này, bạn sẽ nhận được:

Cách thức hoạt động

Dưới đây là quy trình căn chỉnh (alignment flow) hoạt động:

1. Chọn tiêu chí đánh giá

Bước đầu tiên là xác định các tiêu chí đánh giá phù hợp. Tiêu chí đánh giá của bạn nên bao gồm những điều mà ứng dụng của bạn cần thực hiện tốt. Ví dụ, nếu bạn đang xây dựng một ứng dụng trò chuyện, tính chính xác là rất quan trọng — nhưng sự ngắn gọn cũng vậy. Một câu trả lời chính xác về mặt kỹ thuật nhưng phải mất nhiều đoạn văn mới đi vào trọng tâm vẫn sẽ khiến người dùng cảm thấy khó chịu.

2. Chọn dữ liệu để con người đánh giá

Tạo một tập hợp các ví dụ tiêu biểu từ ứng dụng của bạn. Những ví dụ này nên bao gồm cả trường hợp tốt và xấu — mục tiêu là bao quát được phạm vi đầu ra mà ứng dụng của bạn thực sự sẽ tạo ra. Ví dụ, nếu bạn đang thêm một sản phẩm mới mà trợ lý hỗ trợ khách hàng của bạn có thể trả lời các câu hỏi về nó, hãy bao gồm cả các phản hồi đúng và sai.

3. Chấm điểm dữ liệu với các điểm số kỳ vọng

Đối với mỗi tiêu chí đánh giá, hãy gán thủ công một điểm số cho từng ví dụ. Những điểm số này trở thành "bộ tiêu chuẩn" (golden set) của bạn, đóng vai trò là điểm chuẩn để đánh giá các phản hồi của trình đánh giá.

4. Tạo prompt cho trình đánh giá và kiểm thử dựa trên kết quả chấm điểm của con người

Tạo một prompt ban đầu cho trình đánh giá LLM của bạn và sử dụng kết quả căn chỉnh để lặp lại. Với mỗi phiên bản prompt, bạn sẽ kiểm thử nó dựa trên các ví dụ đã được con người chấm điểm để xem điểm số của LLM khớp với điểm số của bạn như thế nào.

Ví dụ, nếu LLM của bạn liên tục chấm điểm quá cao cho một số phản hồi nhất định, hãy thử thêm các tiêu chí phủ định rõ ràng hơn. Việc cải thiện điểm số của trình đánh giá là một quá trình lặp đi lặp lại. Tìm hiểu thêm về các phương pháp hay nhất để lặp lại prompt trong tài liệu của chúng tôi.

Tiếp theo là gì?

Chúng tôi chỉ mới bắt đầu. Đây là bước đầu tiên giúp bạn xây dựng các trình đánh giá tốt hơn. Trong tương lai, bạn có thể mong đợi:

Hãy thử ngay! Bắt đầu bằng cách truy cập tài liệu dành cho nhà phát triển hoặc xem video hướng dẫn của chúng tôi. Hãy cho chúng tôi biết suy nghĩ của bạn bằng cách gửi phản hồi trong diễn đàn LangChain Community.

LangSmithLLMĐánh giá AICông cụ AIPhát triển AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.