Thủ thuật
Smevals: Bộ công cụ đánh giá mô hình, prompt và framework hiệu quả
(giờ Việt Nam)
Tóm tắt AI
Smevals là công cụ mới từ Simon Willison giúp chạy các bộ đánh giá nhỏ trên nhiều cấu hình mô hình khác nhau, hỗ trợ tách biệt quá trình thực thi và chấm điểm để xuất báo cáo HTML trực quan.
Bản dịch AI

31 tháng 7 năm 2026 - Link Blog
smevals - một bộ công cụ đánh giá nhỏ gọn dùng để kiểm thử các mô hình, câu lệnh (prompt) và các hệ thống khai thác (harness). Tôi đã làm việc cùng phòng thí nghiệm nghiên cứu AI ứng dụng Prime Radiant của Jesse Vincent để xây dựng khung đánh giá này nhằm giúp giải đáp các câu hỏi về năng lực của những mô hình khác nhau.
Kết quả là smevals, một công cụ mới dùng để chạy các bộ đánh giá nhỏ trên nhiều cấu hình mô hình khác nhau và chấm điểm kết quả.
Bài viết trên blog này mô tả chi tiết về công cụ đó. Dưới đây là phiên bản tóm tắt trong 10 giây:
Sau khi đã tạo một bài đánh giá - dưới dạng một thư mục chứa các tệp YAML - bạn có thể chạy nó với các mô hình như sau:
Các lượt chạy (runs) được xử lý tách biệt với các thao tác chấm điểm - bạn có thể chấm điểm các lượt chạy của mình (dựa trên bộ kiểm tra đã xác định) bằng cách sử dụng:
Sau đó, bạn có thể chạy một máy chủ web localhost để khám phá các kết quả:
Hoặc chạy lệnh build của smevals để tạo báo cáo đó dưới dạng HTML tĩnh, sau đó bạn có thể lưu trữ ở bất kỳ đâu. Đây là một ví dụ minh họa bộ đánh giá mà tôi đã xây dựng để kiểm tra khả năng viết thơ haiku của các mô hình.
Tôi đã cố gắng tìm ra một phương pháp đánh giá ưng ý trong vài năm nay. smevals là phiên bản thứ ba của tôi về ý tưởng này và tôi cảm thấy nó rất phù hợp. Tôi rất mong chờ được mở rộng công cụ này hơn nữa trong tương lai, cũng như áp dụng nó vào một số dự án cá nhân của mình.
Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.