Thủ thuật
Fortune: OpenAI nhiều lần chỉnh sửa dữ liệu benchmark của GPT-6 Astra
(giờ Việt Nam)
Tóm tắt AI
Theo Fortune, OpenAI đã liên tục thay đổi số liệu đánh giá GPT-6 Astra kể từ khi công bố, bao gồm việc điều chỉnh tỷ lệ ảo tưởng từ 4,2% xuống 2% rồi lại thay đổi ngược lại, làm dấy lên nghi vấn về tính minh bạch.
Bản dịch AI
Cảm ơn bạn đọc của IT đã gửi tin!
Theo tin từ IT ngày 6 tháng 9, tờ Fortune đưa tin kể từ khi OpenAI công bố mô hình GPT-6 Astra vào chiều ngày 3 tháng 9 (giờ địa phương), hãng đã nhiều lần sửa đổi dữ liệu đánh giá chuẩn (benchmark) trong thông báo. Một số dữ liệu sau khi cập nhật cho thấy hiệu suất của Astra đã được cải thiện, trong khi một số kết quả của các mô hình từ đối thủ cạnh tranh lớn nhất của OpenAI là Anthropic lại bị hạ thấp.

Những thay đổi này diễn ra trong một quá trình công bố khá bất thường.
Theo tìm hiểu của IT, OpenAI ban đầu dự định đăng bài blog vào lúc 2 giờ chiều ngày 3 tháng 9 (giờ miền Đông Hoa Kỳ), nhưng phải mất gần hai tiếng sau đó, hầu hết người dùng mới có thể truy cập bình thường vào bài viết trên mạng.
Vào lúc 3 giờ 32 phút chiều (giờ địa phương), tài khoản X chính thức của OpenAI đã đăng liên kết bài blog, nhưng trang web không thể mở được và người truy cập chỉ thấy thông báo lỗi. Đến 3 giờ 50 phút chiều, CEO Sam Altman của OpenAI cũng đăng liên kết này kèm dòng trạng thái: "Chúng tôi gặp một chút vấn đề nhỏ khi triển khai bài blog, nhưng nó thực sự rất tuyệt vời."
Tuy nhiên, vào thời điểm đó, nhiều người dùng vẫn cho biết họ không thể mở được trang web. Phải mất khoảng một giờ sau, trang web mới có thể truy cập bình thường.
Thực tế cho thấy, OpenAI đã đăng bài blog này ngay sau 2 giờ chiều nhưng sau đó lại gỡ xuống. OpenAI cho biết không thể tiết lộ lý do cụ thể của việc gỡ bài, nhưng nhấn mạnh rằng sự việc này không liên quan đến kết quả kiểm tra chuẩn.
OpenAI ban đầu giải thích rằng vấn đề xuất phát từ lỗi hệ thống quản lý nội dung, sau đó lại cho biết là do gián đoạn internet.
Tuy nhiên, khi bài blog được đăng tải trở lại, nhiều dữ liệu đánh giá trong đó đã thay đổi, và một số dữ liệu vẫn tiếp tục được điều chỉnh sau đó. Một số chỉ số được cập nhật dường như làm cho hiệu suất của Astra trở nên nổi bật hơn.
Sự việc này diễn ra trong bối cảnh ngành công nghiệp trí tuệ nhân tạo đang cạnh tranh vô cùng khốc liệt. Các công ty cập nhật các mô hình ngôn ngữ lớn (LLM) với tốc độ cực nhanh, đều hy vọng dẫn đầu đối thủ về năng lực. Những tranh cãi xoay quanh các chỉ số này một lần nữa làm nổi bật một vấn đề tồn tại lâu nay: làm thế nào để sử dụng các bài kiểm tra chuẩn hóa nhằm đo lường chính xác năng lực của LLM, và liệu các kết quả kiểm tra này có dễ bị tối ưu hóa nhân tạo hay thậm chí là "gian lận điểm số" hay không.
Người phát ngôn của OpenAI cho biết: "Chúng tôi rất coi trọng tính chính xác của kết quả đánh giá. Do sự khác biệt về điểm kiểm tra mô hình (model checkpoint), khung kiểm tra và cách thức vận hành đánh giá, hầu hết các kết quả đánh giá tự thân nó đều tồn tại sự biến động trong phạm vi vài phần trăm. Đối với các dữ liệu trong thông báo, chúng tôi đã thực hiện hiệu chỉnh để đảm bảo những con số này đại diện cho ước tính tốt nhất về hiệu suất khả dụng của mô hình, giúp người dùng có thể so sánh một cách có ý nghĩa."
Có sự khác biệt giữa dữ liệu bản đầu và bản cuối, và một số con số vẫn đang thay đổi.
Một trong những thay đổi đáng chú ý nhất là tỷ lệ ảo giác (hallucination rate) của Astra.
Theo một bản lưu trang web được lưu trữ trên Internet Archive, trong phiên bản đầu tiên được đăng lúc 2 giờ 23 phút chiều ngày 3 tháng 9 (giờ miền Đông Hoa Kỳ), tỷ lệ ảo giác của Astra là 4,2%. Trong nhiều bản lưu trang web sau đó, con số này không thay đổi, cho đến bản lưu thứ năm lúc 3 giờ 11 phút chiều vẫn như vậy.
Khoảng 10 phút sau, OpenAI mới đăng liên kết bài blog phiên bản cuối cùng lên X.
Nhưng trong bản lưu trang web thứ sáu được lưu lúc 5 giờ 20 phút chiều, tức là sau khi trang web cơ bản đã có thể truy cập bình thường với công chúng, tỷ lệ ảo giác của Astra cùng bốn chỉ số khác đã thay đổi. Tỷ lệ ảo giác của Astra giảm từ 4,2% xuống còn 2%, gần như giảm một nửa.
Đồng thời, tỷ lệ ảo giác của mô hình tiền nhiệm GPT-5.6 Sol cũng giảm từ 12,2% xuống 9,4%.
Tuy nhiên, OpenAI sau đó vẫn tiếp tục sửa đổi chỉ số này. Tính đến thời điểm viết bài, tỷ lệ ảo giác của Astra và GPT-5.6 Sol đã quay trở lại mức ban đầu lần lượt là 4,2% và 12,2%.
OpenAI dường như cũng đã tăng đáng kể điểm số của GPT-5.6 Sol trong bài kiểm tra an ninh mạng nội bộ ExploitBench, từ 5,5% ở phiên bản đầu lên 11,5% ở các phiên bản sau.
OpenAI cho biết công ty hiện đang nghiên cứu xem có nên khôi phục con số này về 5,5% hay không, vì kết quả 11,5% tương ứng với cấp độ năng lực suy luận mà GPT-5.6 Sol hiện chưa cung cấp cho người dùng thương mại.
Ở phần đầu thông báo, OpenAI nhấn mạnh rằng Astra thể hiện đặc biệt xuất sắc về năng lực toán học.
Theo các bản lưu trang web, điểm số của Astra trong bài kiểm tra FrontierMath Tier 4 (v2) luôn duy trì ở mức 97,6% và không thay đổi. Nhưng OpenAI đã từng sửa đổi ngắn hạn điểm số của GPT-5.6 Sol và mô hình mới nhất Fable 5.1 của Anthropic.
Những điều chỉnh này đã có lúc khiến Astra trông như vượt trội rõ rệt so với hai mô hình còn lại.
Trong bản lưu trang web đầu tiên lúc 2 giờ 23 phút chiều ngày 3 tháng 9, điểm số của Anthropic Fable 5.1 trong bài kiểm tra toán học này là 87,8%. Đến 5 giờ 17 phút chiều, kết quả này giảm gần 10 điểm phần trăm xuống còn 78%. Tính đến hiện tại, kết quả này đã tăng trở lại mức 83%.
Điểm số của GPT-5.6 Sol cũng trải qua thay đổi tương tự, từ 83% giảm xuống 80,5%, sau đó khôi phục về mức 83% như hiện tại.
Những điều chỉnh dữ liệu này thậm chí còn diễn ra trước khi OpenAI đăng bài blog lần đầu vào lúc 2 giờ chiều.
Một bản thảo tiền phát hành mà OpenAI cung cấp cho truyền thông trước đó (với lệnh cấm đăng tải) cho thấy điểm số của Astra trong bài kiểm tra ARC-AGI-3 là 98,6%. Trong khi đó, ở bài blog công khai hiện tại, con số này đã trở thành 99,99%.
OpenAI khi đó phản hồi rằng: "Chúng tôi luôn xác minh kết quả đánh giá trước khi công bố chính thức, vì vậy việc có sự điều chỉnh giữa bản thảo và phiên bản cuối cùng là bình thường."
OpenAI cũng chỉ ra rằng đơn vị tạo ra bài kiểm tra chuẩn này là Arc Prize Foundation đã phát hiện trong quá trình đánh giá độc lập rằng, nếu trang bị cho Astra một bộ khung công cụ kiểm tra đặc biệt mạnh mẽ, tức là cho phép mô hình gọi nhiều công cụ hơn để hoàn thành nhiệm vụ, thì điểm số của Astra có thể đạt tới 99,9%.
Còn khi sử dụng bộ khung công cụ tiêu chuẩn của bài kiểm tra này, điểm số của Astra là 63%. Mặc dù vậy, kết quả này vẫn vượt trội rõ rệt so với tất cả các mô hình AI khác hiện đang được công bố rộng rãi.
OpenAI cho biết khung công cụ kiểm tra, cấp độ suy luận và các yếu tố khác đều sẽ ảnh hưởng đến kết quả đánh giá cuối cùng.

Là đang cải thiện độ chính xác, hay là đang "cày điểm"?
Bên trong OpenAI, các nhóm nghiên cứu khác nhau chịu trách nhiệm cho các chỉ số đánh giá khác nhau. Các nhóm này chịu trách nhiệm tính toán và báo cáo kết quả, sau đó một nhóm trung tâm sẽ thống nhất công bố.
OpenAI cũng công khai thừa nhận rằng những con số này đạt được trong điều kiện tối ưu, do đó có thể có sự khác biệt nhất định so với hiệu suất thực tế mà người dùng phổ thông có thể sử dụng thông qua phiên bản ChatGPT chính thức.
Tuyên bố miễn trừ trách nhiệm trong bài blog viết: "Điểm số đánh giá là kết quả cao nhất có thể đạt được với bất kỳ nguồn lực tính toán nào được đầu tư."
Ngoài ra, OpenAI còn bổ sung thêm các giải thích và điều kiện hạn chế trong phần chú thích của mỗi chỉ số đánh giá.
Vấn đề nằm ở chỗ, "độ chính xác" của kết quả đánh giá không phải lúc nào cũng là duy nhất. Do điều kiện kiểm tra khác nhau, nhiều kết quả khác nhau đều có thể là hợp lý.
Tuy nhiên, một số chuyên gia AI cho rằng, trong đó có thể còn tồn tại hiện tượng được gọi là "Benchmaxxing", tức là thông qua việc điều chỉnh liên tục các điều kiện kiểm tra, chạy lại đánh giá để nâng cao điểm số kiểm tra chuẩn nhiều nhất có thể.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.