Thủ thuật
Đánh giá mô hình thị giác đa phương thức với PerceptionBench: Quy trình chuẩn hóa từ A-Z
(giờ Việt Nam)
Tóm tắt AI
Bài viết giới thiệu quy trình đánh giá toàn diện cho PerceptionBench, hỗ trợ kiểm tra khả năng nhận diện, suy luận và phát hiện ảo giác của các mô hình đa phương thức thông qua cơ chế tự động hóa linh hoạt.
Bản dịch AI

Trong bài hướng dẫn này, chúng tôi thiết kế một quy trình đánh giá toàn diện (end-to-end) cho PerceptionBench. Bộ benchmark đa phương thức này đo lường các khả năng nhận diện thị giác chi tiết trên nhiều tác vụ như OCR, đếm, định vị, suy luận theo ngữ cảnh, so sánh, hiểu chiều sâu và phát hiện ảo giác (hallucination). Chúng tôi bắt đầu bằng việc cấu hình môi trường tương thích với Colab, cài đặt các thư viện cần thiết và tải một tập hợp con cân bằng của bộ dữ liệu thông qua chiến lược truyền tải và tải xuống đa giai đoạn mạnh mẽ. Sau đó, chúng tôi giải mã các hình ảnh được mã hóa base64, phân tích các trình giữ chỗ (placeholder) hình ảnh xen kẽ, chuẩn hóa từng ví dụ thành định dạng bản ghi nhất quán, đồng thời phân tích sự phân bổ khả năng, yêu cầu về hình ảnh, loại câu trả lời và các bộ benchmark nguồn của tập dữ liệu. Từ đó, chúng tôi xây dựng một bộ công cụ đánh giá thống nhất hỗ trợ baseline blind-prior, các API đa phương thức tương thích với OpenAI và các mô hình thị giác-ngôn ngữ (vision-language models) cục bộ của Hugging Face. Chúng tôi cũng triển khai cơ chế đánh giá dựa trên quy tắc và tùy chọn hỗ trợ bởi LLM, tính toán khoảng tin cậy bootstrap, kiểm tra hiệu suất trên các lát cắt độ khó, so sánh hồ sơ năng lực với bảng xếp hạng đi kèm và xuất các kết quả dự đoán cũng như báo cáo có thể tái lập.
Chúng tôi cấu hình môi trường PerceptionBench, xác định tập dữ liệu, backend, xử lý hình ảnh, cài đặt đánh giá và đầu ra, đồng thời khởi tạo hành vi ngẫu nhiên có thể tái lập. Chúng tôi cài đặt các thư viện cần thiết để tải tập dữ liệu, phân tích số liệu, trực quan hóa, giao tiếp HTTP và xử lý hình ảnh. Chúng tôi cũng cấu hình Matplotlib và chuẩn bị thư mục đầu ra để quy trình đánh giá còn lại chạy nhất quán trong Google Colab hoặc môi trường cục bộ.
Chúng tôi triển khai một trình tải tập dữ liệu linh hoạt, ưu tiên thử nghiệm truyền tải Parquet đã chuyển đổi, sau đó chuyển sang truyền tải các tệp gốc và cuối cùng thực hiện tải xuống toàn bộ khi cần thiết. Chúng tôi quét tập dữ liệu trong khi giới hạn số lượng hàng được xử lý và sắp xếp các ví dụ vào các nhóm theo khả năng cụ thể bằng cách sử dụng trường error_category. Sau đó, chúng tôi tạo một tập hợp con cân bằng và đã xáo trộn để mỗi khả năng thị giác đóng góp một số lượng câu hỏi đánh giá tương đương.
Chúng tôi giải mã hình ảnh từ các URI dữ liệu, chuỗi base64 thô, mảng byte, đối tượng PIL và từ điển hình ảnh Hugging Face thành định dạng RGB nhất quán. Chúng tôi chuẩn hóa mọi hàng dữ liệu thành một bản ghi có cấu trúc bao gồm văn bản câu hỏi, câu trả lời, hình ảnh, nhãn khả năng, kích thước, số lượng trình giữ chỗ và thông tin nguồn. Sau đó, chúng tôi phân tích phạm vi khả năng, định dạng câu trả lời, số lượng hình ảnh, đặc điểm độ phân giải và các bộ benchmark nguồn trong khi trực quan hóa hồ sơ tập dữ liệu thu được.
Chúng tôi hiển thị các ví dụ benchmark tiêu biểu bằng cách sắp xếp các hình ảnh liên quan vào các lưới dễ đọc và trình bày từng câu hỏi cùng với khả năng, câu trả lời tham chiếu và nguồn của nó. Chúng tôi xác định một prompt hệ thống đa phương thức nghiêm ngặt, hướng dẫn mô hình được đánh giá kiểm tra tất cả hình ảnh và trả về câu trả lời cuối cùng ngắn gọn theo định dạng nhất quán. Chúng tôi cũng thay đổi kích thước hình ảnh, bảo toàn vị trí của chúng so với các trình giữ chỗ câu hỏi và chuyển đổi nội dung thu được thành các tin nhắn đa phương thức tương thích với OpenAI.
Chúng tôi tạo một giao diện backend dùng chung và triển khai các backend cho blind-prior, API tương thích với OpenAI và mô hình thị giác-ngôn ngữ cục bộ của Hugging Face. Chúng tôi xây dựng các tiện ích trích xuất và chuẩn hóa câu trả lời để xử lý số, từ ngữ chỉ số, dấu câu, phản hồi được định dạng, câu trả lời Boolean và các cụm từ ngắn. Sau đó, chúng tôi áp dụng đánh giá dựa trên quy tắc hoặc tùy chọn hỗ trợ bởi LLM và chạy các bài kiểm tra tự động ngoại tuyến để xác minh rằng trình đánh giá xử lý chính xác các biến thể phản hồi phổ biến.
Chúng tôi thực thi backend đã chọn trên tất cả các bản ghi đã chuẩn bị, đánh giá mọi dự đoán và lưu trữ kết quả vào một DataFrame có cấu trúc để phân tích. Chúng tôi tính toán độ chính xác tổng thể và theo từng khả năng, khoảng tin cậy bootstrap, các lát cắt độ khó, các ví dụ thất bại và so sánh với bảng xếp hạng benchmark đi kèm. Cuối cùng, chúng tôi tạo các hình ảnh trực quan về khả năng và xuất các dự đoán, báo cáo khả năng, siêu dữ liệu cấu hình, thống kê độ chính xác và chi tiết về khả năng tái lập dưới dạng tệp JSONL, CSV và JSON.
Tóm lại, chúng tôi đã thiết lập một khung làm việc mô-đun và có thể tái lập để đánh giá các mô hình đa phương thức trên PerceptionBench. Chúng tôi đã xử lý toàn bộ quy trình từ việc nhập dữ liệu linh hoạt và tiền xử lý hình ảnh đến xây dựng prompt, thực thi backend, trích xuất câu trả lời, đánh giá tự động, phân tích thống kê, trực quan hóa và xuất kết quả. Chúng tôi có thể chạy pipeline mà không cần API key hoặc GPU bằng cách sử dụng baseline blind-prior, và có thể chuyển sang mô hình thị giác-ngôn ngữ cục bộ hoặc được lưu trữ qua API bằng cách thay đổi cấu hình backend. Các báo cáo thu được cho phép chúng tôi vượt ra ngoài điểm số độ chính xác tổng thể đơn thuần và kiểm tra cách mỗi mô hình thực hiện trên từng khả năng thị giác riêng lẻ, các câu hỏi đa hình ảnh, độ phân giải hình ảnh và định dạng câu trả lời. Chúng tôi cũng đã tạo nền tảng cho các thử nghiệm sâu hơn liên quan đến biến thể prompt, quét độ phân giải hình ảnh, chiến lược cắt ảnh, so sánh trình đánh giá và đánh giá toàn bộ tập dữ liệu.
Xem mã nguồn đầy đủ tại đây. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, ra mắt sản phẩm hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.
Sana Hassan, thực tập sinh tư vấn tại Marktechpost và là sinh viên bằng kép tại IIT Madras, rất đam mê việc ứng dụng công nghệ và AI để giải quyết các thách thức trong thế giới thực. Với sự quan tâm sâu sắc đến việc giải quyết các vấn đề thực tiễn, anh mang đến một góc nhìn mới mẻ cho sự giao thoa giữa AI và các giải pháp đời sống.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.