Tin ngành
Google DeepMind tiên phong triển khai đánh giá mù đôi cho các mô hình AI tiên tiến
(giờ Việt Nam)
Tóm tắt AI
Google DeepMind hợp tác cùng các tổ chức quốc tế ra mắt phương pháp đánh giá mù đôi trong môi trường bảo mật, giúp kiểm chứng năng lực thực tế của mô hình AI mà không lo bị rò rỉ dữ liệu kiểm thử.
Bản dịch AI
27 tháng 8, 2026 Trách nhiệm & An toàn
William Isaac, Sol Messing và Kristian Lum
Xây dựng niềm tin vào các bộ tiêu chuẩn đánh giá mô hình độc quyền bằng môi trường bảo mật bằng mật mã
Hãy tưởng tượng một học sinh chuẩn bị tham gia một kỳ thi quan trọng. Nếu vô tình xem trước các câu hỏi, việc đạt điểm tuyệt đối sẽ bị ảnh hưởng bởi thông tin này, khiến thành tích đó trở nên vô nghĩa. Để thực sự đo lường kiến thức của học sinh, họ không được phép nhìn thấy đề thi cho đến khi bắt đầu làm bài. Đây chính xác là thách thức mà ngành công nghiệp đang đối mặt khi đánh giá các mô hình AI tiên tiến. Nếu một mô hình đã từng "nhìn thấy" các câu hỏi kiểm tra – một vấn đề được gọi là ô nhiễm bộ tiêu chuẩn đánh giá (benchmark contamination) – thì kết quả thu được chỉ có thể được tin tưởng ở một mức độ nhất định.
Hôm nay, chúng tôi giới thiệu phương pháp đánh giá mù đôi (double-blind) đầu tiên trên thế giới dành cho một mô hình AI độc quyền thuộc phân khúc tiên phong (frontier class). Phương pháp này giữ cho các đánh giá bên ngoài nằm trong một "chiếc hộp" mật mã, nơi các câu hỏi không thể bị mô hình sử dụng để tối ưu hóa hiệu suất trước khi kiểm tra. Chúng tôi đang hợp tác với Singapore AI Safety Institute, OpenMined, AVERI và MLCommons để kiểm tra mô hình Gemini Flash Lite dựa trên các bộ tiêu chuẩn đánh giá bảo mật trong một môi trường bảo vệ quyền riêng tư, từ đó nâng cao tính toàn vẹn của quá trình đánh giá.
Tại Google, chúng tôi đánh giá các hệ thống AI của mình bằng nhiều phương pháp đa dạng trong suốt quá trình phát triển và triển khai mô hình, nhưng chúng tôi không chỉ dựa vào kiểm thử nội bộ. Để xác định các điểm mù tiềm ẩn, chúng tôi làm việc với một nhóm đối tác bên ngoài đa dạng, bao gồm các phòng thí nghiệm nghiên cứu chuyên biệt, các tổ chức xã hội dân sự và các Viện An toàn và An ninh AI (AISI) quốc gia, tận dụng chuyên môn độc đáo của họ để kiểm thử áp lực (stress-test) các mô hình của chúng tôi.
Khi các mô hình AI ngày càng trở nên mạnh mẽ hơn, việc đảm bảo mô hình chưa từng nhìn thấy trước các câu hỏi hoặc câu lệnh (prompt) kiểm tra là vô cùng quan trọng, vì điều này có thể làm sai lệch kết quả. Các nhà hoạch định chính sách, nhà nghiên cứu và doanh nghiệp cần tin tưởng rằng các bộ tiêu chuẩn đánh giá AI phản ánh chính xác năng lực và độ an toàn thực sự của mô hình. Tuy nhiên, nếu các mô hình có thể "xem lén" câu hỏi đánh giá trước, điều đó có thể làm tăng điểm số một cách giả tạo và làm suy giảm niềm tin này.
Mặc dù các giao thức không ghi nhật ký (zero-logging) và các biện pháp bảo vệ theo hợp đồng nghiêm ngặt từ lâu đã giữ bí mật cho các câu lệnh kiểm tra bên ngoài, việc kết hợp các biện pháp bảo vệ kỹ thuật và mật mã đánh dấu một bước tiến lớn trong việc đánh giá mô hình an toàn.
Cách thức hoạt động của đánh giá mù đôi
Bài viết được AI dịch và tổng hợp tự động từ Google DeepMind: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.