Latent Space
92

Tin ngành

GPT-5.6 giảm giá tới 80%: Chi phí vận hành giảm 13 lần nhờ khả năng tự tối ưu hóa

(giờ Việt Nam)

Tóm tắt AI

Nhờ kỹ thuật chưng cất mô hình (distillation) và khả năng tự tối ưu hóa đệ quy, chi phí vận hành GPT-5.6 đã giảm mạnh chỉ sau 4 tháng, mở ra kỷ nguyên AI hiệu năng cao với giá rẻ.

Bản dịch AI

[AINews] GPT 5.6 price cut by 20%-80%: Cost of GPT 5.4 Intelligence dropped 13x in 4 months due to GPT 5.6 recursive self-optimization

Một trong những "biểu đồ anh hùng" quan trọng của chúng tôi cách đây một năm (sau đó được Demis áp dụng) đã đưa ra quan sát đáng kinh ngạc rằng, nếu giữ nguyên chỉ số LMSys Elo, trí tuệ ở cấp độ GPT-4 đã giảm chi phí 1000 lần trong vòng 18 tháng:

Khi đó, chưa rõ liệu đây có phải là "lợi ích của người mới bắt đầu" (noob gains) hay không - chuyển từ chưa tối ưu sang đã tối ưu, từ hoàn thiện câu sang suy luận, từ mô hình dày đặc (dense) sang MoE, với tất cả những thành quả dễ dàng đã bị khai thác hết. 18 tháng sau, câu trả lời dường như là không; trí tuệ ở mức độ ổn định vẫn đang tiếp tục trở nên rẻ hơn một cách chóng mặt.

Hôm qua, OpenAI đã công bố những phát hiện về cách GPT-5.6 tự tối ưu hóa việc phục vụ (serving) của chính nó:

Để phục vụ nhiều token hơn trên cùng một phần cứng mà không làm giảm chất lượng, OpenAI đã tập trung vào một số nâng cấp mang tính hệ thống:

Tự tối ưu hóa (Self-Optimization): GPT-5.6 Sol được sử dụng tích cực để phân tích lưu lượng truy cập thực tế, điều chỉnh cân bằng tải và tự động viết lại các kernel sản xuất bằng ngôn ngữ Triton và Gluon của riêng OpenAI. Việc tự động tối ưu hóa kernel này đã giảm 20% chi phí phục vụ từ đầu đến cuối.

Giải mã suy đoán (Speculative Decoding): Cải thiện mô hình dự thảo (draft model) của chính nó (bằng cách thiết kế và chạy hàng trăm thử nghiệm trên kiến trúc, kiểm tra các thay đổi về kích thước, cấu trúc và tính năng, đồng thời giám sát quá trình huấn luyện bộ suy đoán, tự động can thiệp khi có vấn đề phát sinh, bao gồm lỗi phần cứng và sự không ổn định trong huấn luyện), giúp tăng hiệu quả tạo token lên hơn 15%.

KV Caching: Tối ưu hóa việc batching, sharding và quản lý bộ nhớ đệm dành riêng cho các khối lượng công việc khác nhau (chủ yếu là Sol trong Codex) để trích xuất nhiều suy luận hơn từ phần cứng hiện có.

Để hợp lý hóa các tác vụ phức tạp, nhiều bước trong các công cụ như Codex và ChatGPT Work, OpenAI đã tối ưu hóa lớp điều phối Rust của họ để giảm chi phí tính toán lặp đi lặp lại:

Tránh làm phình to ngữ cảnh (Context Bloat): Các công cụ, kỹ năng và plugin chỉ được hiển thị khi cần (deferred discovery), và đầu ra của công cụ được giới hạn mặc định ở mức 10.000 token để ngăn cửa sổ ngữ cảnh mở rộng không cần thiết.

Prompt Caching: Để tránh việc xử lý lại các hướng dẫn và lịch sử giống nhau nhiều lần, hệ thống coi toàn bộ lịch sử mà mô hình có thể nhìn thấy là dạng chỉ thêm vào (append-only). Điều này bảo toàn tiền tố prompt, cho phép hệ thống tái sử dụng dữ liệu đã tính toán trước đó và duy trì tỷ lệ trúng bộ nhớ đệm (cache hit rate) cao.

Hôm nay, họ đã chứng minh đó không chỉ là lý thuyết khi công bố đợt giảm giá lớn cho các mô hình nhỏ hơn và chế độ mới nhanh gấp 2,5 lần trong Sol (mặc dù không phải là chế độ nhanh gấp 10 lần chạy trên Cerebras như đã gợi ý vào tháng 7):

X avatar for @sama

Sam Altman@sama

giảm giá lớn hôm nay: *giảm 80% cho GPT-5.6 Luna, hiện còn $0.20 mỗi triệu token đầu vào và $1.20 mỗi triệu token đầu ra *giảm 20% cho GPT-5.6 Terra, còn $2/$12 *GPT-5.6 Sol có chế độ Fast trong API, tốc độ nhanh gấp 2,5 lần với giá gấp đôi, trí tuệ không đổi

5:27 CH · 30 tháng 7, 2026 · 1,5 triệu lượt xem

995 lượt trả lời · 830 lượt đăng lại · 13,9 nghìn lượt thích

Đó là một đường cong Pareto tuyệt đẹp — nếu chỉ số Cost per Task (Chi phí trên mỗi tác vụ) của AA phản ánh đúng các tác vụ trong thế giới thực, thì OpenAI đã vượt qua cả các mô hình mở như DeepSeek, GLM, MiniMax và các mô hình chuyên biệt giá rẻ-nhưng-tốt như Gemini Flash-Lite.

Tốt, nhưng điều thực sự gây kinh ngạc là quan sát của Nicdunz:

GPT-5.4 bản đầy đủ ở mức xhigh đạt 51 điểm, chính xác bằng vị trí của Luna max hiện nay. GPT-5.4 có giá $2.50/$15; Luna hiện có giá $0.20/$1.20. Nói cách khác, khoảng bốn tháng sau, OpenAI đang bán trí tuệ hàng đầu của tháng Ba với giá chỉ bằng khoảng một phần mười ba trên mỗi token.

X avatar for @nicdunz

nic@nicdunz

GPT-5.4 bản đầy đủ ở mức xhigh đạt 51 điểm, chính xác bằng vị trí của Luna max hiện nay. GPT-5.4 có giá $2.50/$15; Luna hiện có giá $0.20/$1.20. Nói cách khác, khoảng bốn tháng sau, OpenAI đang bán trí tuệ hàng đầu của tháng Ba với giá chỉ bằng khoảng một phần mười ba trên mỗi token.

5:40 CH · 30 tháng 7, 2026 · 169 nghìn lượt xem

66 lượt trả lời · 259 lượt đăng lại · 4,26 nghìn lượt thích

Đó là tỷ lệ hàng năm khoảng 2000 lần mỗi năm, một sự tăng tốc khổng lồ kể từ quan sát gần nhất của chúng tôi - điều mà bạn NÊN cân nhắc kỹ vì tất cả các điểm chuẩn công khai như của AA đều được huấn luyện ở một mức độ nào đó, trong khi Elo ít có khả năng bị huấn luyện trực tiếp hơn. Mặc dù các mô hình mở hàng đầu của Trung Quốc và Mỹ như Laguna của Poolside và Inkling của Thinky cung cấp khả năng kiểm soát và chủ quyền hoàn toàn, nhưng nếu mục tiêu duy nhất của bạn là trí tuệ hiệu quả về chi phí mà không cần tinh chỉnh (non-finetuned), bạn sẽ thấy rất khó để đánh bại OpenAI vào lúc này.

Tin tức AI từ 29/7/2026-30/7/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm Discord nào. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một phần của Latent Space. Bạn có thể chọn bật/tắt tần suất nhận email!

Cắt giảm giá của OpenAI, Ngữ nghĩa Harness và cuộc tranh luận về bộ nhớ ARC-AGI-3

OpenAI cắt giảm giá GPT-5.6 mạnh mẽ và thêm tầng Sol nhanh hơn: OpenAI đã giảm 80% giá cho GPT-5.6 Luna và 20% cho Terra, đồng thời giới thiệu Sol Fast với độ trễ thấp hơn tới 2,5 lần với mức giá gấp đôi tiêu chuẩn mà "trí tuệ không thay đổi", theo @OpenAIDevs. Tác động hạ nguồn đáng chú ý đối với các quy trình làm việc của tác nhân (agent workflows): Tự động đánh giá trong ứng dụng ChatGPT và Codex CLI đang chuyển từ GPT-5.4 sang Luna, với kỳ vọng của OpenAI là chi phí sẽ giảm khoảng 10 lần. Nhiều nhà quan sát coi đây là một sự thay đổi có ý nghĩa trong biên độ giá/hiệu năng, bao gồm @sama, @nicdunz và @kimmonismus. OpenAI cũng gắn các đợt cắt giảm này với những cải tiến về hiệu quả cấp hệ thống bao gồm "mô hình, ngăn xếp suy luận và harness tác nhân" theo @OpenAIDevs.

ARC-AGI-3 nhấn mạnh lại rằng "mô hình" không phải là toàn bộ hệ thống: Cuộc thảo luận kỹ thuật nhất tập trung vào thiết kế harness, khả năng lưu giữ bộ nhớ và nén ngữ cảnh. François Chollet đã làm rõ các quy tắc của ARC: các harness tùy chỉnh dành riêng cho điểm chuẩn là không được phép, nhưng các tính năng API đa năng có sẵn cho tất cả người dùng là chấp nhận được nếu cài đặt và chi phí được báo cáo. Một bản tóm tắt chi tiết từ @kimmonismus đối chiếu Opus 5 ở mức 30,2% trên thiết lập ARC bán riêng tư chính thức với GPT-5.6 Sol ở mức 7,8% dưới harness tiêu chuẩn, đồng thời lưu ý việc OpenAI sử dụng nội bộ API Phản hồi đã giữ lại khả năng suy luận + nén, giúp nâng điểm số trên tập dữ liệu công khai của Sol lên 38,3%. Kết luận được @gneubig, @scaling01 và những người khác lặp lại: các đánh giá dài hạn ngày càng đo lường toàn bộ hệ thống tác nhân—lưu giữ suy luận, chính sách cắt ngắn, nén, điều phối công cụ—chứ không chỉ là trọng số cơ sở.

Inkling-Small của Thinking Machines và nỗ lực thúc đẩy trọng số mở (open-weights)

Inkling-Small nén khả năng của dòng Inkling vào một dấu chân hoạt động nhỏ hơn nhiều: Thinking Machines đã phát hành Inkling-Small, một mô hình MoE đa phương thức gốc với trọng số mở, có tổng cộng 276 tỷ tham số và 12 tỷ tham số hoạt động, được định vị là mang lại hiệu suất tương đương với Inkling gốc với kích thước chỉ bằng khoảng một phần tư. Công ty cho biết mô hình này xử lý âm thanh và hình ảnh cùng với văn bản và hỗ trợ kiểm tra hình ảnh dựa trên Python trong quá trình suy luận trong các cài đặt đa phương thức, theo thông tin cập nhật của họ. Bản phát hành ngay lập tức xuất hiện trên ngăn xếp suy luận mở: vLLM đã thông báo hỗ trợ ngày đầu tiên, Modal làm nổi bật việc triển khai B300 đơn lẻ, LMSYS/SGLang báo cáo số liệu thông lượng giải mã và Unsloth đã xuất bản hướng dẫn chạy cục bộ/GGUF.

Các điểm chuẩn cho thấy một mô hình mở hiệu quả bất thường cho lập trình và đa phương thức: Artificial Analysis đã xếp Inkling-Small ở vị trí 40 trên Chỉ số Trí tuệ của họ—trong phạm vi một điểm so với Inkling hàng đầu—với thế mạnh về Humanity’s Last Exam, GPQA Diamond, CritPt và SciCode, mặc dù yếu hơn ở một số tác vụ tác nhân và kiến thức thực tế. Các bản tóm tắt cộng đồng nhấn mạnh rằng mô hình nhỏ hơn có thể đánh bại hoặc ngang bằng với Inkling lớn hơn trong một số tác vụ lập trình, bao gồm cả @kimmonismus và @mervenoyann. Sự kết hợp giữa trọng số mở, đầu vào đa phương thức, hỗ trợ ngữ cảnh 1 triệu token trong các ngăn xếp triển khai và 12 tỷ tham số hoạt động khiến đây trở thành một trong những bản phát hành mở quan trọng nhất về mặt thực tiễn trong đợt này.

Gemini Robotics 2 của Google và sự tăng tốc của AI hiện thân (Embodied AI)

Gemini Robotics 2 mở rộng từ thao tác trên bàn sang điều khiển toàn thân và phối hợp đa robot: Google DeepMind đã ra mắt Gemini Robotics 2, mô tả nó là "một bộ não cho mọi robot", với các bản demo bao gồm điều khiển hình người toàn thân, sự khéo léo nâng cao và sự cộng tác đa robot. Google AI nói thêm rằng ngăn xếp bao gồm Gemini Robotics ER 2, một mô hình suy luận hiện thân cấp cao có thể quan sát, lập kế hoạch, phối hợp với mô hình VLA, theo dõi tiến trình và phục hồi sau các bước thất bại trong các tác vụ kéo dài nhiều phút. Các bản demo nhấn mạnh các tác vụ vận động không tầm thường như thắt nút, vặn bóng đèn, cúi xuống nhặt đồ vật và dọn dẹp nhà để xe cộng tác.

Câu chuyện thực tế là sự không đồng nhất và khả năng thích ứng, không chỉ là các bản demo đẹp mắt: Bình luận kỹ thuật nhấn mạnh rằng cùng một checkpoint đã điều khiển nhiều loại phần cứng khác nhau và On-Device 2 được cho là có thể thích ứng với một robot hai tay mới với ít hơn 200 ví dụ, được tóm tắt bởi @kimmonismus. @OfficialLoganK và @osanseviero tập trung vào tính khả dụng API của ER 2 và các chỉ số suy luận hiện thân, trong khi NVIDIA Robotics tận dụng thời điểm này để thúc đẩy khía cạnh phần cứng cục bộ với Jetson AGX Thor cho các hệ thống hình người/tự hành. So với các thông báo về robot trước đây, thông báo này nổi bật vì nó kết hợp phạm vi nền tảng, lập kế hoạch, sự khéo léo và API phát trực tiếp thay vì chỉ một điểm chuẩn thao tác hẹp.

Tác nhân, Môi trường phát triển đám mây và Cơ sở hạ tầng bộ nhớ bền vững

Các tác nhân đám mây đang chuyển từ bản demo sang quy trình kỹ thuật cốt lõi: Một trong những dữ liệu vận hành mạnh mẽ hơn đến từ Cursor: vào tháng 12, cứ 10 PR được hợp nhất thì có 1 PR đến từ các tác nhân đám mây; hiện tại tỷ lệ đó là 56%, nhờ việc cung cấp cho các tác nhân máy tính đám mây riêng và cho phép chúng cải thiện môi trường theo thời gian. Tương tự, @jaredpalmer cho biết anh vẫn chưa thiết lập máy tính xách tay để phát triển cục bộ sau khi gia nhập Cognition, thay vào đó ưu tiên Devin trong Slack/webapp, và @dabit3 đã trình diễn các tác nhân đám mây Devin chạy macOS với quyền truy cập Xcode và trình mô phỏng để xây dựng/kiểm tra các ứng dụng iOS gốc. Cognition cũng đã thêm hỗ trợ PR xếp chồng (stacked PR) gốc của GitHub, một sự thích ứng hữu ích cho các bộ thay đổi do tác nhân tạo ra.

GPT-5.6AITối ưu hóaChi phí AICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.