Simon Willison Blog
98

Mô hình

OpenAI ra mắt GPT-6 Astra: Đạt 99,9% điểm ARC-AGI, chính thức mở quyền truy cập

(giờ Việt Nam)

Tóm tắt AI

OpenAI vừa giới thiệu GPT-6 Astra với khả năng suy luận vượt trội, đạt 99,9% điểm ARC-AGI. Mô hình hiện đã bắt đầu triển khai cho các tổ chức và sẽ sớm có mặt trên ChatGPT Plus cùng API với mức giá cạnh tranh.

Bản dịch AI

Ngày 3 tháng 9 năm 2026 - Link Blog

GPT‑6 Astra (via) GPT-6 Astra đang "được triển khai từ hôm nay cho một nhóm tổ chức giới hạn và trong vài ngày tới sẽ khả dụng cho tất cả người dùng ChatGPT Plus, Pro, Business và Enterprise, cũng như thông qua OpenAI API và AWS" - Tôi vẫn chưa tự mình trải nghiệm nên chưa có nhiều điều để nói về nó.

Mức giá API của nó sẽ tương đương với Claude Fable 5 và 5.1: 10 USD/triệu token đầu vào và 50 USD/triệu token đầu ra. Đây rõ ràng là đối thủ cạnh tranh của OpenAI với Fable, và có vẻ như đạt điểm số cao hơn Fable trong hầu hết các bài kiểm tra đánh giá (benchmark) do chính OpenAI công bố.

Ấn tượng nhất là Astra đạt 99,9% trong bài kiểm tra ARC-AGI 3 gần đây (phát hành vào tháng 3) - mặc dù đáng chú ý là Fable 5 vẫn chưa có kết quả được công bố, và blog ARC-AGI lưu ý rằng điểm số 99,9% đạt được với chi phí 19.000 USD nhờ sử dụng "Provider Adapter harness" tùy chỉnh của OpenAI, trong khi harness mặc định của ARC-AGI chỉ đạt 62,7% với chi phí 26.000 USD.

Provider Adapter harness giúp bảo toàn trạng thái suy luận không minh bạch (opaque reasoning state) giữa các yêu cầu và sử dụng tính năng nén cho các cuộc hội thoại dài hơn, cho phép mô hình tái sử dụng công việc trước đó.

Không có gì ngạc nhiên, sau sự cố Hugging Face gần đây, Astra là một "con quái vật" trong các tác vụ bảo mật. Nó đạt 100% trên ExploitBench (GPT-5.6 Sol đạt 78,5%), 42,4% trên ExploitGym (Sol đạt 30,3%) và 99,2% trong bốn lần thử trên SRE-Bench về kỹ thuật dịch ngược nhị phân (binary reverse engineering) so với 68,7% của Sol.

Nó cũng xử lý ngữ cảnh dài tốt hơn: trong bài kiểm tra eight-needle của OpenAI, nó đạt 100% ở mức 256K–512K token và 96,3% ở mức 512K–1M token. OpenAI có lẽ đã giải quyết được một trong những thách thức dai dẳng đối với việc xử lý ngữ cảnh dài.

Tuy nhiên, nó không thắng ở mọi mặt. Artificial Analysis lưu ý rằng Astra vẫn bị Fable đánh bại trên Intelligence Index của họ:

Đứng ngang hàng với GPT-5.6 Sol về trí tuệ: GPT-6 Astra đạt điểm số bằng với GPT-5.6 Sol trong Index ở mức 61. Điểm số này thấp hơn 5 điểm so với Claude Fable 5.1 (tối đa với fallback). Mô hình này cũng xếp sau Muse Spark 1.3 (tối đa) mới được Meta phát hành.

Nó thể hiện tốt hơn trên Coding Agent Index của họ:

Dẫn đầu về hiệu quả chi phí trên Coding Agent Index: Ở mức nỗ lực tối đa, GPT-6 Astra có chi phí tương đương với GPT-5.6 Sol (tối đa) trong khi đạt điểm số cao hơn 2 điểm trên Index. Trên mỗi tác vụ, mô hình này có chi phí chưa bằng một nửa so với Claude Fable 5 cho cùng một mức điểm.

Tôi sẽ viết thêm về Astra sau khi có quyền truy cập. Nhãn mô hình API khi được triển khai sẽ là gpt-6-astra.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.