The Decoder: AI News
85

Mô hình

OpenAI ra mắt GPT-6 Sol và Luna: Giá giảm một nửa, hiệu năng tiệm cận bản tiền nhiệm

(giờ Việt Nam)

Tóm tắt AI

OpenAI vừa giới thiệu bộ đôi mô hình GPT-6 Sol và Luna với chi phí sử dụng giảm 50% so với thế hệ trước, đồng thời áp dụng ưu đãi 10% cho các token đầu vào được lưu trữ.

Bản dịch AI

OpenAI's GPT-6 Sol and Luna cut prices in half but barely move the needle on performance

Với GPT-6 Sol và Luna, OpenAI bổ sung hai mô hình giá rẻ hơn vào danh mục sản phẩm của mình, mang lại hiệu năng tương đương các phiên bản tiền nhiệm với mức giá token chỉ bằng một nửa, đồng thời nhắm tới việc cạnh tranh với một số mô hình đắt đỏ hơn của Anthropic.

Thay đổi lớn nhất là mức giảm giá 50% so với GPT-5.6 Sol và Luna. GPT-6 Sol hiện có giá 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra, trong khi Luna có giá 0,10 USD cho đầu vào và 0,50 USD cho đầu ra.

OpenAI cho rằng mức giá thấp hơn này là nhờ những cải tiến trong việc lưu trữ bộ nhớ đệm (caching) và suy luận (inference), đồng thời khẳng định họ đang chuyển trực tiếp khoản tiết kiệm đó cho người dùng. Điều này đưa mức giá của hãng vào cùng phân khúc với các mô hình mã nguồn mở (open-weight) giá rẻ hơn. Terra, trước đây là mô hình rẻ nhất trong dòng sản phẩm, hiện đã không còn khả dụng.

Theo OpenAI, Sol được thiết kế cho các tác vụ phức tạp lặp đi lặp lại như xây dựng tính năng mới, đánh giá mã nguồn, gỡ lỗi và phân tích dữ liệu. Luna được thiết kế để xử lý khối lượng lớn các tác vụ được xác định rõ ràng với chi phí thấp, chẳng hạn như tóm tắt tài liệu, trích xuất thông tin và trả lời các câu hỏi ngắn.

Cùng với việc cắt giảm giá token, OpenAI cho biết họ đã cải thiện tính năng lưu trữ bộ nhớ đệm cho GPT-6, cung cấp mức giảm giá 90% cho các token đầu vào được lưu trong bộ nhớ đệm. Một bảng điều khiển lưu trữ bộ nhớ đệm và công cụ chẩn đoán mới được thiết kế để giúp các nhà phát triển tối ưu hóa việc sử dụng bộ nhớ đệm, và giờ đây các nhà phát triển có thể thay đổi mức độ suy luận (reasoning effort) và khả năng cung cấp công cụ mà không làm mất hiệu lực của bộ nhớ đệm.

Khi ra mắt, cả hai mô hình đều có sẵn trong ChatGPT Work và Codex cho người dùng đăng ký gói Plus, Pro, Business, Enterprise và Edu. Người dùng miễn phí và người dùng Go có thể truy cập Luna thông qua ứng dụng máy tính, nhưng cả hai mô hình ban đầu đều chưa khả dụng trong các cuộc trò chuyện thông thường. API cung cấp chúng dưới tên gpt-6-sol và gpt-6-luna, trong khi quyền truy cập trong ChatGPT đang được triển khai dần dần.

Lợi thế về điểm chuẩn của GPT-6 Sol và Luna nằm ở chi phí

OpenAI đang định vị các mô hình mới chủ yếu dựa trên tỷ lệ hiệu năng trên giá thành so với dòng Claude của Anthropic. Trên OSWorld 2.0, bài kiểm tra khả năng sử dụng máy tính, OpenAI cho biết GPT-6 mang lại kết quả tương tự Claude Opus 5 với chi phí thấp hơn khoảng 80%, mặc dù Astra vẫn dẫn đầu trong danh mục này.

Trên AutomationBench, bài kiểm tra quy trình làm việc doanh nghiệp trên 47 công cụ, GPT-6 Sol ở mức độ nỗ lực cao nhất được cho là đã vượt qua Claude Opus 5 ở mức nỗ lực tối đa. OpenAI cho biết chi phí mỗi tác vụ của Sol chỉ bằng 9% so với Opus. Trong khi đó, Luna cải thiện 5,4 điểm phần trăm so với phiên bản tiền nhiệm trong khi chi phí thấp hơn 58%.

Đối với lập trình, OpenAI cung cấp kết quả từ hai bài kiểm tra điểm chuẩn. FrontierCode 1.1 kiểm tra xem các tác nhân AI có tạo ra mã nguồn thực sự có thể tích hợp vào cơ sở mã hiện có hay không, bằng cách kiểm tra chất lượng thử nghiệm, phong cách mã và sự tuân thủ các yêu cầu. GPT-6 Sol đạt 49,3% ở mức nỗ lực tối đa với chi phí 2,14 USD mỗi tác vụ, ngang ngửa với Claude Fable 5.1, vốn đạt 50,3% ở mức nỗ lực tối đa nhưng có chi phí cao gấp sáu lần, ở mức 12,83 USD. Claude Opus 5 đạt 53,4% với chi phí 4,31 USD ở mức nỗ lực trung bình, thiết lập mang lại kết quả tốt nhất của nó trong bài kiểm tra này.

Các mức độ suy luận của OpenAI đang trở nên mất kiểm soát

Trên DeepSWE v1.1, một bài kiểm tra điểm chuẩn cho các tác vụ kỹ thuật phần mềm đòi hỏi khắt khe trong thời gian dài trên các cơ sở mã thực tế, OpenAI báo cáo 68,8% cho GPT-6 Sol ở mức nỗ lực tối đa. Con số này nằm trong khoảng cách 1,1 điểm phần trăm so với điểm số tốt nhất của Claude Fable 5 là 69,9% ở mức "xhigh", trong khi Fable ở mức "max" đạt 69,7% với chi phí 21,63 USD mỗi tác vụ.

Tất nhiên, Sol không theo đuổi vị trí dẫn đầu ở đây. Claude Opus 5 đạt 73,7% ở mức nỗ lực tối đa với chi phí 11,84 USD mỗi tác vụ, và GPT-5.6 Sol của chính OpenAI đạt 72,7% với chi phí 6,46 USD. Mục đích của GPT-6 Sol là đạt được con số gần với các kết quả đó với một phần nhỏ chi phí. Ở mức "xhigh", nó mang lại 66,6% với chi phí 1,00 USD mỗi tác vụ. Luna thậm chí còn rẻ hơn, đạt cùng mức điểm đó ở mức nỗ lực tối đa với chỉ 0,22 USD. OpenAI cho biết kết quả của Luna có thể so sánh với Claude Opus 5 và Claude Fable 5 ở mức nỗ lực trung bình, trong khi chi phí thấp hơn 93% so với Opus và 96% so với Fable.

Kết quả DeepSWE cũng khiến việc lựa chọn giữa các mô hình của chính OpenAI trở thành một cơn đau đầu. Luna ở mức nỗ lực tối đa ngang bằng với Sol ở mức "xhigh" trong khi chi phí thấp hơn 78%. Việc đẩy Sol lên mức nỗ lực tối đa chỉ giúp bạn đạt 68,8%, chỉ cao hơn Luna 2,2 điểm phần trăm. Ai sẽ là người giải quyết tất cả những điều này trong thực tế?

Nhìn chung, việc lựa chọn điểm chuẩn của OpenAI có vẻ như đã được chọn lọc kỹ lưỡng. Các chỉ số như GDPval cho công việc tri thức hoặc Terminal-Bench 4.0 cho lập trình tác nhân (agentic coding) đều bị thiếu, mặc dù chúng là một phần của danh mục thông thường. OpenAI cũng dường như đã bỏ lỡ đợt ra mắt Opus 5.5, phiên bản có khả năng rẻ hơn tới 40% so với Opus 5 với hiệu năng tốt hơn đáng kể.

Phân tích độc lập cho thấy rất ít tiến bộ thực sự

Theo Artificial Analysis, GPT-6 Sol và Luna cắt giảm chi phí mỗi tác vụ xuống một nửa so với các phiên bản tiền nhiệm, nhưng điểm số trí tuệ vẫn ở mức GPT-5.6, với sự cải thiện ở một số đánh giá và sự thoái lui ở những đánh giá khác. Theo phân tích, trên chỉ số tác nhân lập trình, Sol cải thiện 2 điểm trong khi Luna giảm 2 điểm.

Artificial Analysis cũng phát hiện sự thoái lui trên hai bài kiểm tra điểm chuẩn công việc tri thức quan trọng. Trên GDPval-AA v2.1, bài kiểm tra công việc tri thức dựa trên máy tính trên 44 lĩnh vực chuyên môn, Sol mất khoảng 100 điểm Elo và Luna giảm khoảng 75 điểm. Kiểm tra thủ công cho thấy sự thoái lui chủ yếu do chất lượng trình bày thấp hơn và kết quả không đầy đủ.

Tuy nhiên, Artificial Analysis trước đây đã từng đối mặt với sự chỉ trích khi đánh giá mô hình Astra của OpenAI quá thấp do các bài kiểm tra điểm chuẩn đã lỗi thời. Sau đó, hai bản cập nhật điểm chuẩn đã được thực hiện, giúp Astra quay trở lại vị trí dẫn đầu. Chúng ta hãy chờ xem điều gì sẽ xảy ra lần này.

Dù thế nào đi nữa, rõ ràng là OpenAI đang đặt cược lớn vào giá cả với GPT-6 Sol và Luna. Giờ đây, các mô hình này cần chứng minh bản thân trong công việc hàng ngày, vì các bài kiểm tra điểm chuẩn chỉ kể một phần câu chuyện. Đó cũng có thể là lý do tại sao OpenAI bỏ qua một số bài kiểm tra. Kết hợp với các mức độ suy luận khác nhau và các kết quả đôi khi trông như được tinh chỉnh cho các bài kiểm tra điểm chuẩn, dù cố ý hay không, toàn bộ trò chơi điểm chuẩn dường như trở nên nực cười hơn với mỗi lần ra mắt mô hình mới.

Tin tức AI không thổi phồng – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.

Đăng ký ngay

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.