Tin ngành
GPT-5.6-Sol-Ultrafast của OpenAI: Mô hình tiên phong nhanh nhất thế giới
(giờ Việt Nam)
Tóm tắt AI
Cerebras công bố sự kết hợp đột phá với OpenAI để tối ưu hóa GPT-5.6-Sol-Ultrafast, thiết lập tiêu chuẩn mới về tốc độ xử lý cho các mô hình AI quy mô lớn.
Bản dịch AI

Hôm nay, Cerebras và OpenAI giới thiệu cái nhìn sớm về Ultrafast Mode, một tầng dịch vụ mới ra mắt đầu tiên trên OpenAI API và được vận hành bởi Cerebras. Ultrafast ban đầu được cung cấp cho một nhóm khách hàng chọn lọc và sẽ mở rộng quyền truy cập theo thời gian. Cerebras vận hành GPT-5.6 Sol trên chế độ Ultrafast, mang lại tốc độ lên tới 750 token đầu ra mỗi giây mà không làm giảm chất lượng, cho phép Sol Ultrafast tăng tốc các công việc quan trọng và nhạy cảm về thời gian của bạn.

Trí tuệ tiên phong với tốc độ chưa từng có
Các nhà phát triển AI luôn phải lựa chọn giữa tốc độ và trí tuệ. Khi các mô hình tăng dần về quy mô và trí tuệ, chúng phát sinh chi phí tính toán và di chuyển dữ liệu cao hơn, làm chậm thời gian phản hồi. Người dùng thường phải chờ đợi kết quả chất lượng cao hoặc chấp nhận kết quả kém hơn trong khung thời gian ngắn hơn.
GPT-5.6 Sol Ultrafast giải quyết sự đánh đổi này, mang trí tuệ tiên phong đến các sản phẩm và quy trình làm việc nơi mỗi giây đều quan trọng. So với tốc độ đầu ra được báo cáo bởi Artificial Analysis, GPT-5.6 Sol ở chế độ Ultrafast chạy nhanh hơn 11 lần so với Fable 5 và nhanh hơn 5 lần so với Opus 4.8 ở chế độ Fast.
Tại Cerebras, chúng tôi đã đưa Ultrafast vào thử nghiệm bằng cách so sánh trực tiếp với các mô hình phổ biến trên Humanity's Last Exam (HLE). HLE là một bài kiểm tra mô hình đầy thách thức bao gồm 2.500 câu hỏi thường chỉ có thể trả lời bởi những người có bằng Tiến sĩ trong các lĩnh vực như hóa học, kinh tế và văn học.
Trong các đánh giá của chúng tôi, GPT-5.6 Sol ở chế độ Ultrafast đã trả lời tất cả 2.500 câu hỏi HLE trong 11 giờ 11 phút. Claude Fable 5 cần 78 giờ 27 phút, tương đương hơn ba ngày tính toán liên tục, để đưa ra các kết luận tương tự. Nói cách khác, Ultrafast đã xử lý xong các kiến thức tiên phong của nhân loại chỉ trong một ngày làm việc, đạt được độ chính xác tương đương với tốc độ nhanh hơn gần 7 lần.
Việc đo kiểm (benchmarking) được thực hiện bởi Cerebras sử dụng GPT 5.6 Sol Ultrafast với Codex ở chế độ suy luận xhigh vào ngày 10 tháng 7 và Claude Fable 5 với Claude Code ở chế độ suy luận xhigh từ ngày 13-15 tháng 7.
Khi khả năng của mô hình tiếp tục tiến bộ, phạm vi ứng dụng cho suy luận tốc độ cao cũng mở rộng. GPT-5.6 Sol là mô hình tốt nhất của OpenAI cho đến nay đối với các bản tóm tắt pháp lý, mô hình tài chính và báo cáo kỹ thuật. Trên GDP-Val, một tiêu chuẩn đánh giá cho các tác vụ công việc tri thức có giá trị kinh tế, Ultrafast mang lại tốc độ nhanh hơn 5,6 lần từ đầu đến cuối mà không làm giảm chất lượng, cho thấy cách suy luận nhanh hơn có thể thúc đẩy các công việc có giá trị kinh tế.

Việc đo kiểm được thực hiện bởi Cerebras vào ngày 31 tháng 7 năm 2026 sử dụng GPT 5.6 Sol và GPT 5.6 Sol Ultrafast với chế độ suy luận trung bình (medium) trong Codex.
Trí tuệ tốc độ cao thúc đẩy các công việc quan trọng
Trí tuệ nhanh hơn thay đổi những gì có thể thực hiện được đối với các cá nhân và tổ chức. Với Ultrafast, giờ đây bạn có thể đưa các tác nhân (agents) vào lộ trình quan trọng của các vấn đề mà mỗi giây đều có giá trị.
Rohan Varma
Bộ phận Sản phẩm tại OpenAI
Ultrafast là lợi thế bền vững cho các tổ chức sử dụng AI tiên phong để phản ứng nhanh chóng với thông tin đầu vào. Các công ty vận hành dịch vụ web có thể tận dụng Ultrafast để tìm ra nguyên nhân gốc rễ và giải quyết các sự cố sản xuất, bảo toàn lòng tin của khách hàng, ngăn ngừa mất doanh thu và tiết kiệm thời gian ngừng hoạt động so với các cam kết SLA của họ. Và trong các cuộc tấn công mạng đối kháng, rủi ro cao, Ultrafast là một công cụ vô giá cho các đội ngũ bảo mật, những người phải nhanh chóng phát hiện và phản ứng với các tác nhân xấu để ngăn chặn những tổn thất thảm khốc.
Rộng hơn nữa, Ultrafast cho phép các phương thức làm việc hoàn toàn mới với các tác nhân, nó cung cấp thông tin chi tiết và cập nhật theo thời gian thực, vì vậy bạn không cần phải chuyển đổi ngữ cảnh qua nhiều phiên làm việc song song để tận dụng tối đa các tác nhân của mình.
Jeffrey Wang
Nhà nghiên cứu tại OpenAI
Với Ultrafast, các nhà nghiên cứu và kỹ sư có thể dành sự tập trung để đi sâu vào các vấn đề chọn lọc quan trọng nhất, trong khi vẫn tiếp tục sử dụng xử lý Tiêu chuẩn (Standard) để song song hóa các tác vụ thông thường. Cerebras rất hào hứng khi được thúc đẩy làn sóng đổi mới AI tiếp theo, nâng cao giới hạn về những gì cá nhân và tổ chức có thể đạt được với AI phản hồi nhanh.
Tốc độ chóng mặt được kích hoạt bởi sự đổi mới đột phá
GPT-5.6 Sol ở chế độ Ultrafast được vận hành bởi kiến trúc Wafer-Scale Engine mang tính cách mạng của Cerebras, được xây dựng có mục đích cho các khối lượng công việc AI tiên phong. Suy luận tiên phong tốc độ cao là một vấn đề về di chuyển dữ liệu: trên GPU, suy luận trên các mô hình lớn bị nghẽn bởi băng thông bộ nhớ, vì trọng số mô hình phải được chuyển liên tục giữa bộ nhớ trên chip và bộ nhớ ngoài để tạo ra các token kế tiếp trong phản hồi của mô hình.
Cerebras thực hiện một cách tiếp cận khác biệt để loại bỏ sự di chuyển dữ liệu kém hiệu quả này: chúng tôi đóng gói 44 GB SRAM trên mỗi chip kích thước wafer. Các trọng số nằm lại trên chip và các token chảy liên tục qua các lớp mô hình được xử lý theo đường ống (pipelined) trên các wafer. Cách tiếp cận kỹ thuật này mở rộng quy mô một cách mượt mà theo kích thước mô hình, mở đường cho lợi thế tốc độ liên tục trên các mô hình tiên phong trong tương lai.
Ultrafast: Hiện đã có bản xem trước giới hạn
GPT-5.6 Sol ở chế độ Ultrafast hiện đã có bản xem trước giới hạn cho một nhóm khách hàng chọn lọc. Quyền truy cập sẽ mở rộng khi năng lực hệ thống tăng lên. Hãy đăng ký để nhận thông tin cập nhật.
Bài viết được AI dịch và tổng hợp tự động từ Cerebras: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.