Hugging Face: Blog
85

Tin ngành

Viện An toàn AI Anh (AISI) chuẩn hóa quy trình đánh giá mô hình với nền tảng EvalEval

(giờ Việt Nam)

Tóm tắt AI

Viện An toàn AI Anh (AISI) áp dụng khung tiêu chuẩn Every Eval Ever và Evaluation Cards của EvalEval nhằm minh bạch hóa và đảm bảo tính tái lập cho các kết quả kiểm định mô hình AI.

Bản dịch AI

How UK AISI and EvalEval Are Making Benchmark Results Reproducible

EvalEval Coalition rất vui mừng được chia sẻ rằng Viện An toàn AI Vương quốc Anh (AISI) đang sử dụng cơ sở hạ tầng của EvalEval để công khai kết quả đánh giá, qua đó hỗ trợ khoa học đánh giá trở nên dễ tái lập và có thể kiểm chứng hơn.

AISI và EvalEval trước đây đã từng hợp tác nghiên cứu bắt đầu từ một hội thảo chung bên lề sự kiện NeurIPS 2025, và những phản hồi từ Viện đã góp phần định hình lược đồ Every Eval Ever (EEE). Giai đoạn tiếp theo của sự hợp tác này sẽ đưa cơ sở hạ tầng chung đó vào thực tiễn.

Tại sao việc báo cáo đánh giá có khả năng tái lập lại quan trọng

Khi việc triển khai AI tăng tốc, các đánh giá đang trở thành nguồn bằng chứng ngày càng quan trọng về hiệu suất của mô hình và hệ thống. Tuy nhiên, kết quả lại được báo cáo trên nhiều định dạng, nền tảng và kênh khác nhau, thường thiếu thông tin cần thiết để tái lập chúng. Việc chạy lại các đánh giá đôi khi cũng gây tốn kém quá mức.

Sứ mệnh của EvalEval là cải thiện hệ sinh thái này thông qua một lược đồ báo cáo chung, Every Eval Ever, và một nền tảng mở, Evaluation Cards, giúp đưa các kết quả đánh giá cùng thông tin cần thiết để diễn giải chúng vào một cấu trúc chung.

Điều này được xây dựng một cách tự nhiên dựa trên công việc của AISI nhằm làm cho việc đánh giá trở nên hiệu quả hơn thông qua OptStop, chặt chẽ hơn về mặt thống kê thông qua HiBayES, và chuẩn hóa hơn trong các lĩnh vực bao gồm phân tích bản ghi (transcript analysis) và khơi gợi năng lực (capability elicitation). Cùng nhau, AISI và EvalEval đang nỗ lực chẩn đoán các lỗ hổng trong báo cáo đánh giá và xây dựng cơ sở hạ tầng chung để khắc phục chúng.

Những gì AISI đang chia sẻ

Tính minh bạch ở cấp độ bản ghi (transcript-level) không chỉ quan trọng đối với khả năng tái lập mà còn cho cả việc phân tích và chẩn đoán. Trong giai đoạn hợp tác mới này, AISI đang cung cấp công khai các phương pháp và kết quả đánh giá thông qua Evaluation Cards khi phù hợp. Bản phát hành bao gồm các kết quả đã được xác minh, bối cảnh và thông tin cấu hình cho năm bộ tiêu chuẩn (benchmark) trong thí nghiệm chính của bài báo:

Các kết quả này bao gồm sáu mô hình tiên phong: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 và GPT-5.4. Bản phát hành cũng bao gồm kết quả từ hai đánh giá an ninh mạng liên quan—Cyber CTFs và The Last Ones—vốn sử dụng một tập hợp mô hình khác có sự chồng lấp một phần. Dữ liệu đi kèm với bài báo của AISI, "How Inference Compute Shapes Frontier LLM Evaluation", nghiên cứu cách hiệu suất của bộ tiêu chuẩn phụ thuộc vào tài nguyên tính toán khi suy luận (inference-time compute) và giao thức đánh giá.

Hiệu suất trong bài kiểm tra "Humanity's Last Exam" thay đổi theo giao thức đánh giá và tài nguyên tính toán khi suy luận. Mỗi đường cong hiển thị tỷ lệ tích lũy các tác vụ đã giải quyết được trong một số lượng token nhất định, sử dụng lần thành công sớm nhất được ghi nhận cho mỗi tác vụ. Khi các mô hình nhận được phản hồi về tính đúng đắn từ một oracle sau mỗi lần thử, chúng tiếp tục giải quyết thêm các tác vụ khi lượng token sử dụng tăng lên.

Khi kết quả được công khai cùng với thông tin thiết lập, các nhà nghiên cứu và chuyên gia có thể xem xét các nghiên cứu riêng lẻ kỹ lưỡng hơn và so sánh các phát hiện trên toàn hệ sinh thái rộng lớn hơn. Ở những nơi mà các báo cáo khác thiếu những chi tiết này, các bản phát hành như của AISI cung cấp các điểm tham chiếu đã được xác minh để diễn giải các đánh giá trong bối cảnh cụ thể—ví dụ, bằng cách giúp các nhà nghiên cứu hiểu cách các lựa chọn thiết lập có thể ảnh hưởng đến hiệu suất được báo cáo. Khi ngày càng có nhiều đơn vị đánh giá áp dụng EEE, các so sánh mở như thế này có thể hỗ trợ các nghiên cứu tổng hợp (meta-research) rộng rãi và đáng tin cậy hơn.

Kết quả Terminal-Bench 2.0 của AISI bên cạnh các đánh giá khác được báo cáo cho cùng các mô hình, dưới các thiết lập đánh giá khác nhau.

Chúng tôi rất hào hứng với việc áp dụng này và mong muốn tiếp tục chuẩn hóa cũng như chia sẻ các đánh giá với AISI và các tổ chức đánh giá AI khác.

Đóng góp cho sứ mệnh chung

Về EvalEval Coalition

EvalEval Coalition là một cộng đồng nghiên cứu đang phát triển các nghiên cứu có cơ sở khoa học và cơ sở hạ tầng triển khai mạnh mẽ cho hệ sinh thái đánh giá. Mục tiêu của cộng đồng là cải thiện khoa học đánh giá, giải quyết sự thiếu đồng thuận xung quanh việc ghi chép tính ứng dụng và hữu ích của đánh giá, đồng thời mở rộng phạm vi bao phủ các tác động quan trọng đối với nghiên cứu khoa học và phân tích chính sách.

Các dự án tiêu biểu của liên minh bao gồm Every Eval Ever, một lược đồ và kho lưu trữ chung cho các kết quả đánh giá, và Evaluation Cards, kết hợp siêu dữ liệu bộ tiêu chuẩn, dữ liệu chạy đánh giá và siêu dữ liệu mô hình thành các bản ghi có thể diễn giải được. Cùng với nhau, chúng giúp việc hiểu rõ thời điểm các điểm số có vẻ tương đồng được tạo ra trong các điều kiện khác biệt đáng kể trở nên dễ dàng hơn.

Về Viện An toàn AI Vương quốc Anh

Viện An toàn AI Vương quốc Anh là một tổ chức nghiên cứu thuộc Bộ Khoa học, Đổi mới và Công nghệ của chính phủ Anh. Sứ mệnh của viện là trang bị cho chính phủ sự hiểu biết khoa học về các rủi ro do AI tiên tiến gây ra. AISI thực hiện nghiên cứu và xây dựng cơ sở hạ tầng để hiểu các năng lực và tác động của AI tiên tiến, phát triển và thử nghiệm các biện pháp giảm thiểu, cũng như cung cấp thông tin cho việc hoạch định chính sách.

Đọc thêm

An toàn AIKiểm định AIAISIĐánh giá mô hìnhTiêu chuẩn AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.