The Decoder: AI News
98

Mô hình

OpenAI ra mắt GPT-6 Astra: Cột mốc quan trọng đánh dấu kỷ nguyên AGI

(giờ Việt Nam)

Tóm tắt AI

OpenAI chính thức trình làng GPT-6 Astra, mô hình mạnh mẽ nhất được xếp vào nhóm an ninh mạng trọng yếu, đánh dấu bước tiến gần hơn tới trí tuệ nhân tạo tổng quát (AGI).

Bản dịch AI

OpenAI đã phát hành GPT-6 Astra, mô hình mạnh mẽ nhất của họ cho đến nay. Chủ tịch Greg Brockman cho biết nó có thể đã đủ tiêu chuẩn là "AGI" hoặc ít nhất là đang ở rất gần, nghĩa là một hệ thống AI vượt trội hơn con người trong hầu hết các công việc có giá trị kinh tế theo định nghĩa của chính OpenAI.

GPT-6 Astra đang được triển khai trước tiên cho một số tổ chức chọn lọc thông qua chương trình Daybreak của OpenAI. Trong những ngày tới, nó sẽ khả dụng cho các khách hàng ChatGPT Plus, Pro, Business và Enterprise, cũng như thông qua API và các nền tảng đám mây như AWS Bedrock và Microsoft Azure.

Astra đã được huấn luyện trước trên hơn 100.000 GPU tại cơ sở Stargate ở Texas. Nhà nghiên cứu Aidan Clark của OpenAI gọi đây là đợt huấn luyện lớn nhất từ trước đến nay của công ty. Clark cho biết bước nhảy vọt từ Sol lên Astra thể hiện sự gia tăng năng lực lớn hơn so với bước nhảy từ các mô hình trước đó lên Sol, một phần vì các mô hình AI tiền nhiệm đã đóng vai trò hỗ trợ giám sát quá trình huấn luyện.

Trong các bài kiểm tra đánh giá (benchmark) mà OpenAI công bố, Astra đạt điểm cao hơn nhiều so với người tiền nhiệm GPT-5.6 Sol và các mô hình Fable của Anthropic. Astra đạt điểm tối đa trong hàng loạt lĩnh vực: suy luận logic (98,6% trên ARC-AGI-3, dù trong điều kiện thử nghiệm riêng), toán học (97,6% trên FrontierMath Tier 4 v2), kỹ thuật phần mềm (74,1% trên DeepSWE v1.1), kiến thức chuyên gia (96% trên GPQA Diamond), kỹ thuật (95,9% trên BenchCAD) và an ninh mạng (100% trên ExploitBench).

Sử dụng máy tính

Chuyên nghiệp

Chi phí BenchCAD: thấp hơn ~43% so với Sol, thấp hơn ~86% so với Fable 5.1.

Lập trình

Chi phí Terminal-Bench 4.0: thấp hơn ~9% so với Sol, thấp hơn ~63% so với Fable 5.1.

Học thuật

Các thiết lập chi phí thấp hơn: Terminal-Bench Science đạt 61,1% với chi phí thấp hơn ~27%; GPQA Diamond đạt 94,9% với chi phí thấp hơn ~37%. Khoảng cách số nguyên tố (prime gaps) được cải thiện từ 240 xuống 186, và một giới hạn khoảng cách lớn (large-gap bound term) đã được cải thiện lần đầu tiên sau hơn 80 năm.

Khoa học và Sức khỏe

Fable 5 và 5.1 không được đưa vào LifeSciBench, GeneBench Pro và MedChemBench vì chúng từ chối hầu hết các câu hỏi.

An ninh mạng

SRE-Bench trong vòng bốn lần thử: 99,2% so với 68,7% của Sol. Astra đã tìm thấy hai lỗ hổng zero-day chưa từng được biết đến trong quá trình đánh giá.

Căn chỉnh (thấp hơn là tốt hơn, ngoại trừ Impossible ExploitGym)

Kiểm tra phạm vi tác vụ không thể (Impossible-task scope test): Sol vượt quá mục tiêu được ủy quyền 48% thời gian, Astra là 0%. Astra ít có khả năng trình bày sai năng lực của chính mình hơn gấp 3 lần.

Ngữ cảnh dài

Suy luận trừu tượng

Trong công việc khoa học, mô hình này được báo cáo là đã cải thiện một kết quả toán học về khoảng cách số nguyên tố và thiết lập các kỷ lục mới trong các đánh giá về sinh học, hóa học, y học và vật lý. OpenAI cũng định vị Astra là một mô hình có thể vận hành máy tính một cách đáng tin cậy giống như con người, và trên OSWorld 2.0, nền tảng đo lường khả năng đó, Astra đạt 72,6% với khoảng 40 phút mỗi tác vụ so với 65,7% của Sol trong khoảng 75 phút.

Đắt hơn Sol, nhưng OpenAI cho biết rẻ hơn trên mỗi tác vụ

GPT-6 Astra có giá 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra ở chế độ tiêu chuẩn thông qua API. Chế độ nhanh (Fast mode), hứa hẹn tốc độ gấp 2,5 lần, sẽ tăng gấp đôi giá, khiến Astra đắt hơn 2,5 lần so với GPT-5.6 Sol và đưa nó vào cùng tầm giá với Fable 5.1 của Anthropic.

Brockman lập luận rằng giá token đang trở thành một cách so sánh tồi giữa các mô hình, vì token của OpenAI không giống với của đối thủ và thậm chí không thể so sánh giữa các dòng mô hình của chính họ. Ông cho biết điều quan trọng là giá trên mỗi tác vụ hoàn thành, và OpenAI đang thử nghiệm mô hình định giá đó. Theo công ty, trên DeepSWE v1.1, cấu hình cao nhất của Astra giúp cắt giảm chi phí API ước tính trên mỗi tác vụ khoảng 57% so với Sol.

Trong buổi họp báo, Brockman thừa nhận không có khoảnh khắc AGI nào được xác định rõ ràng, nói rằng nhóm ban đầu nghĩ rằng sẽ có một ngưỡng rõ ràng mà mọi người đều nhận ra khi OpenAI mới thành lập. Mọi chuyện không diễn ra như vậy, và quá trình chuyển đổi diễn ra dần dần hơn dự kiến, một quan điểm mà OpenAI đã đưa ra vào mùa xuân năm ngoái. Brockman vẫn kết thúc buổi họp báo bằng câu nói: "Chào mừng đến với kỷ nguyên AGI." CEO Sam Altman của OpenAI trước đó đã nói rằng ông kỳ vọng một mô hình mà ông gọi là AGI sẽ xuất hiện vào cuối năm nay.

Mô hình đầu tiên đạt ngưỡng an ninh mạng quan trọng của OpenAI

Astra là mô hình đầu tiên mà OpenAI phân loại là "quan trọng" (critical) theo Khung chuẩn bị (Preparedness Framework) của họ. Điều đó có nghĩa là mô hình có thể tìm ra các lỗ hổng chưa từng được biết đến và xây dựng các chuỗi khai thác trên các hệ thống được bảo vệ tốt khi được cung cấp các công cụ và quyền truy cập phù hợp, tất cả mà không cần con người hướng dẫn từng bước. OpenAI cũng thừa nhận rằng khả năng suy luận bằng văn bản của Astra khó giám sát hơn so với GPT-5.6 Sol.

Trên ExploitBench, một bài kiểm tra đo lường khả năng phát hiện và khai thác các lỗ hổng phần mềm thực tế của mô hình, Astra đạt điểm tuyệt đối 100%. OpenAI cho biết mô hình đã phát hiện hai lỗ hổng chưa từng được biết đến trong quá trình đánh giá, sau đó công ty đã báo cáo cho các nhà cung cấp bị ảnh hưởng. Các chuyên gia con người xác nhận rằng Astra có thể xác định các lỗ hổng zero-day mới trên nhiều danh mục phần mềm, bao gồm trình duyệt và hệ điều hành.

Các năng lực an ninh mạng tiên tiến nhất hiện bị hạn chế đối với những người bảo vệ đáng tin cậy trong chương trình Daybreak Blue. OpenAI trước đó đã trì hoãn việc phát hành Astra để thực hiện thêm các thử nghiệm an toàn. Những năng lực lưỡng dụng này có hai mặt: một tác nhân có thể tự động tìm ra lỗ hổng sẽ giúp người bảo vệ vá lỗi dễ dàng như cách nó giúp kẻ tấn công khai thác.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về công nghệ tiên phong sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay

OpenAIGPT-6AGITrí tuệ nhân tạoBảo mật
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.