Google AI: DEV
85

Thủ thuật

5 nguyên tắc vàng để thiết kế quy trình đánh giá AI đáng tin cậy từ chuyên gia Google

(giờ Việt Nam)

Tóm tắt AI

Chuyên gia từ Google chia sẻ cách xây dựng quy trình đánh giá AI tự động và có cấu trúc như unit test, thay vì chỉ kiểm thử cảm tính thủ công.

Bản dịch AI

How to Design AI Evaluations You Can Actually TrustCover image for How to Design AI Evaluations You Can Actually TrustGoogle AI profile imageJan-Felix Schmakeit

Là một phần trong công việc của tôi tại Google, chúng tôi đang xuất bản một bộ Agent Skills (Kỹ năng tác nhân) cho các sản phẩm và công nghệ của Google trên GitHub. Những kỹ năng tác nhân này được thiết kế để giúp các AI agent tương tác với công nghệ của chúng tôi. Nhưng làm thế nào để kiểm tra xem các kỹ năng này có hữu ích và hoạt động như mong đợi hay không? Nhóm Quan hệ Nhà phát triển (Developer Relations) của tôi đã tập trung vào câu hỏi này, bởi vì việc có được các tín hiệu đáng tin cậy về hiệu suất của chúng là rất quan trọng để giúp chúng tôi cải thiện chúng theo thời gian.

Cũng giống như việc bạn sẽ không triển khai một API thực tế mà không viết unit test, bạn nên áp dụng tiêu chuẩn tương tự cho các AI agent của mình. Như Joe Spiro đã trình bày trong loạt bài viết Designing AI Evals, việc mở rộng quy mô các công cụ AI đồng nghĩa với việc vượt ra khỏi cách "kiểm thử theo cảm tính" (vibe testing) trong terminal. Thay vào đó, bạn nên thiết lập một quy trình đánh giá tự động, có cấu trúc để đo lường khả năng tích hợp của mình. Các đánh giá (evals) là những hành động mà bạn yêu cầu agent thực hiện, được chấm điểm bằng các bộ chấm điểm (ví dụ: rubrics) để xác nhận xem agent đó có thành công hay không. Chúng tôi sẽ tập trung vào các đánh giá trong bài viết này và giải quyết các mẹo cho rubrics chấm điểm trong bài viết tiếp theo.

Tuy nhiên, các đánh giá AI tiêu tốn token thực tế. Bạn cần đảm bảo rằng mình sử dụng các token này một cách hiệu quả nhất có thể. Chúng cần mang lại giá trị thực giúp bạn xây dựng các công cụ tốt hơn. Việc viết các đánh giá chất lượng là rất quan trọng. Những đánh giá kém sẽ cung cấp tín hiệu sai lệch, lãng phí ngân sách token của bạn và tạo ra nhiễu trong các số liệu đo lường.

Dưới đây là năm quy tắc chúng tôi đã rút ra để thiết kế các đánh giá tốt hơn mà bạn có thể tin tưởng. Hãy tuân theo chúng để đảm bảo rằng mọi token bạn chi tiêu đều tạo ra một số liệu hữu ích.

Hiểu rõ môi trường đánh giá của bạn

Trước khi viết các đánh giá, bạn cần hiểu thiết lập và các hạn chế của framework mà bạn đã chọn. Điều này bao gồm các hệ thống như Harbor, Inspect AI, hoặc các tích hợp trong các công cụ phát triển như trong Agent Development Kit. Nó có sử dụng sandbox tạm thời (ephemeral sandbox) không? Những công cụ nào khả dụng? Đầu ra được thu thập như thế nào?

Tránh hiệu ứng trần (Ceiling Effect)

Nếu các đánh giá của bạn cho thấy độ chính xác cơ sở cao (tức là không cần công cụ agent của bạn), điều đó có thể không chứng minh được giá trị của nó, hoặc các câu lệnh (prompt) đánh giá quá dễ.

Sự không khớp giữa Prompt và Grader

Bạn không thể chấm điểm một agent dựa trên điều mà bạn không yêu cầu nó thực hiện một cách rõ ràng. Các prompt đánh giá và bộ chấm điểm (grader) của bạn phải bổ trợ cho nhau. Điều này có nghĩa là chúng chỉ nên kiểm tra những gì đã được bao gồm trong prompt.

Chấm điểm đích đến, không phải hành trình

Các agent sở hữu kiến thức mô hình vốn có và có thể bỏ qua hoàn toàn các công cụ tùy chỉnh của bạn để đưa ra câu trả lời đúng. (Bản thân điều đó đã là một phản hồi hữu ích!)

Tuyển chọn bộ dữ liệu đánh giá của bạn

Một bộ đánh giá mạnh mẽ sẽ kiểm tra các trường hợp sử dụng thực tế và đa dạng. Nhưng việc kiểm tra đi kiểm tra lại cùng một khả năng sẽ gây ra hiện tượng quá khớp (overfitting) và tạo ra các số liệu nhiễu.

Tóm tắt

Bạn không thể cải thiện các công cụ AI nếu không thể đo lường chúng một cách chính xác. Nếu bạn đối xử với các đánh giá AI bằng sự tập trung tương tự như các unit test truyền thống, bạn sẽ cải thiện chất lượng số liệu và nhận được các tín hiệu mạnh mẽ hơn.

Bằng cách áp dụng năm quy tắc này, bạn loại bỏ được các tín hiệu sai lệch gây lãng phí ngân sách token. Thay vì tạo ra nhiễu, bộ kiểm thử của bạn sẽ cung cấp cho bạn phản hồi có thể hành động được, giúp bạn định hướng các quyết định kỹ thuật và cải thiện công cụ của mình.

Tìm ra những gì cần kiểm tra chỉ là bước đầu tiên. Một đánh giá được thiết kế tốt chỉ hữu ích nếu bộ chấm điểm (scorer) đánh giá câu trả lời đáng tin cậy và trả về kết quả có ý nghĩa. Trong bài viết tiếp theo, chúng ta sẽ xem xét cách kiểm tra. Bạn sẽ học cách viết các rubrics tinh gọn, nguyên tử (atomic) giúp giảm thiểu sự mơ hồ cho bộ chấm điểm LLM và làm cho mỗi token đều có giá trị.

Ảnh của William Warby trên Unsplash

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google AI: DEV. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.