Google AI: DEV
92

Thủ thuật

Google chia sẻ cách viết tiêu chí đánh giá chuẩn xác cho mô hình LLM-as-a-Judge

(giờ Việt Nam)

Tóm tắt AI

Google hướng dẫn cách xây dựng bộ tiêu chí đánh giá (rubric) cho LLM-as-a-Judge, giúp giảm thiểu sự mơ hồ và lãng phí token. Bài viết nhấn mạnh việc chia nhỏ câu hỏi, tập trung vào dữ kiện khách quan và sử dụng bộ dữ liệu chuẩn để hiệu chỉnh mô hình đạt độ chính xác tương đương con người.

Bản dịch AI

How to Write Reliable Rubrics for LLM-as-a-Judge EvaluationsCover image for How to Write Reliable Rubrics for LLM-as-a-Judge EvaluationsGoogle AI profile imageJan-Felix Schmakeit

Tiếp nối Phần 1: Cách thiết kế các bài đánh giá AI mà bạn thực sự có thể tin tưởng

Tại Google, chúng tôi đang xuất bản một bộ Agent Skills (Kỹ năng tác nhân) cho các sản phẩm và công nghệ của Google trên GitHub. Nhóm của tôi quan tâm đến việc đo lường hiệu suất của chúng để hiểu cách chúng vận hành. Các bài kiểm tra mang tính xác định (deterministic tests), chẳng hạn như kiểm tra xem mã được tạo ra có biên dịch được hay không, là lý tưởng nhất. Thật không may, chúng không thể dễ dàng tạo ra ở quy mô lớn cho các phản hồi mang tính tạo sinh, nhiều sắc thái, chẳng hạn như câu trả lời cho các câu hỏi mở hoặc các tác vụ truy xuất thông tin.

Trong bài viết trước, chúng ta đã xem xét những gì bạn cần kiểm tra, nghĩa là các bài đánh giá chính là những hành động mà bạn yêu cầu tác nhân thực hiện. Bước tiếp theo là xem xét cách bạn khẳng định liệu tác nhân đó có thành công hay không. Điều này có nghĩa là tạo ra các đánh giá đáng tin cậy và chính xác về phản hồi của tác nhân.

Để đánh giá các đầu ra phức tạp ở quy mô lớn, đặc biệt là khi các chủ đề bao phủ những lĩnh vực rộng với nhiều phần mang sắc thái riêng, chúng tôi sử dụng phương pháp "LLM-as-a-judge" (LLM đóng vai trò giám khảo). Các phản hồi được đánh giá dựa trên một bộ tiêu chí có cấu trúc bằng cách sử dụng một bộ chấm điểm dựa trên mô hình. Giám khảo sẽ đánh giá từng phản hồi bằng cách sử dụng một tập hợp các câu hỏi đúng/sai. Khi được tổng hợp lại, các câu trả lời này sẽ cung cấp điểm chính xác cho một phản hồi.

Việc đưa cho LLM một câu lệnh (prompt) mơ hồ hoặc các câu hỏi mang tính chủ quan sẽ dẫn đến sự mơ hồ trong phản hồi của nó. Sự mơ hồ này tạo ra dữ liệu nhiễu và gây ra các đánh giá không nhất quán. Cuối cùng, nó làm lãng phí ngân sách token của bạn vào các số liệu không hữu ích.

Để làm cho các đánh giá này đáng tin cậy hơn, bạn phải coi các bộ tiêu chí của mình như những đặc tả kỹ thuật chính thức. Bằng cách giới hạn giám khảo chỉ đánh giá các sự thật boolean nghiêm ngặt, khách quan, bạn sẽ giảm thiểu khả năng xảy ra ảo giác (hallucinations). Vì việc đánh giá các sự thật boolean nghiêm ngặt là một tác vụ ít phức tạp hơn, bạn thậm chí có thể sử dụng các mô hình nhỏ hơn, nhanh hơn để chấm điểm.

Dưới đây là bốn bài học chúng tôi rút ra để giúp bạn viết các câu hỏi tiêu chí mạnh mẽ cho bộ chấm điểm LLM-as-a-judge của mình.

Giữ cho các câu hỏi mang tính nguyên tử và riêng biệt

Việc đánh giá nhiều yêu cầu trong một câu hỏi duy nhất, chẳng hạn như "Phản hồi có chứa thuộc tính siêu dữ liệu và định dạng đầu ra dưới dạng JSON không?", buộc giám khảo LLM phải đoán xem mệnh đề nào quan trọng hơn. Sự mơ hồ này dẫn đến việc chấm điểm không nhất quán và lãng phí token.

Giới hạn giám khảo: Ưu tiên sự thật khách quan hơn lý luận chủ quan

Phương pháp dựa trên tiêu chí tồn tại vì việc đưa cho giám khảo LLM một câu lệnh văn xuôi đầy đủ để đánh giá một phản hồi phức tạp sẽ dẫn đến các con số không nhất quán. Nếu bạn hỏi giám khảo những câu hỏi chủ quan như "Đây có phải là một câu trả lời toàn diện không?" hoặc yêu cầu nó giải thích "Tại sao tác nhân lại làm điều này?", bạn sẽ tạo ra sự mơ hồ dẫn đến dữ liệu nhiễu và không thể lặp lại.

Chỉ chấm điểm những gì bạn đã yêu cầu

Khi xây dựng các bộ tiêu chí, rất dễ vô tình đánh giá một tác nhân dựa trên các yêu cầu chưa từng được nêu trong câu lệnh. Làm như vậy sẽ tạo ra các kết quả âm tính giả và làm giảm độ chính xác trong phép đo của bạn.

Hiệu chuẩn giám khảo của bạn

Ngay cả khi bạn tuân thủ các quy tắc này và viết các câu hỏi khách quan, mang tính nguyên tử hoàn hảo, giám khảo LLM của bạn vẫn có thể hiểu sai các hướng dẫn chấm điểm và tiêu chí của bạn. Để đảm bảo quy trình của bạn tạo ra các xếp hạng nhất quán và tín hiệu đáng tin cậy, bạn phải chứng minh rằng việc chấm điểm của giám khảo phù hợp với cách một chuyên gia con người đánh giá cùng một phản hồi đó thông qua quá trình hiệu chuẩn.

Tóm tắt

Khi bạn đã có dữ liệu đáng tin cậy này, bước tiếp theo là làm cho nó trở nên trực quan. Trong bài "AI Evals at a Glance: Heatmaps for Stakeholders", Joe Spiro giải thích cách lấy các phép đo thô này và trực quan hóa các đánh giá.

Khi xây dựng các kỹ năng tác nhân, chúng tôi nhận thấy rằng các bộ tiêu chí đánh giá mơ hồ không cung cấp các tín hiệu và phản hồi hữu ích. Việc buộc giám khảo LLM của bạn đánh giá các sự thật boolean, nghiêm ngặt sẽ loại bỏ nhiễu này. Nó giúp các bài kiểm tra của bạn có thể lặp lại, tối ưu hóa chi phí token và cho phép bạn tự tin đo lường xem công cụ AI của mình có thực sự cải thiện hay không.

Ảnh của William Warby trên Unsplash

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google AI: DEV. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.