Latent Space
92

Sản phẩm

Điểm tin Hot Chips: OpenAI Jalapeño, Cerebras CS-5, Groq 3 LPX và Apple M6

(giờ Việt Nam)

Tóm tắt AI

Tổng hợp những công nghệ phần cứng AI đột phá nhất từ hội nghị Hot Chips, nơi các ông lớn công nghệ trình làng những con chip thế hệ mới đầy tham vọng.

Bản dịch AI

[AINews] Hot Chips: OpenAI’s Jalapeño, Cerebras CS-5, Groq 3 LPX, Apple M6

Thông báo lớn nhất tại hội nghị Hot Chips lần thứ 37 cho đến nay chính là bước tiến đáng kinh ngạc của OpenAI đối với con chip của riêng họ, chỉ chưa đầy một năm sau thông báo từ Broadcom… và đây không phải là một ASIC thông thường, mà là một giải pháp thay thế hoàn chỉnh có khả năng đánh bại Blackwell.

X avatar for @OpenAI

OpenAI@OpenAI

Kể từ khi công bố Jalapeño, con chip suy luận tùy chỉnh đầu tiên của chúng tôi, chúng tôi đã tiến hành thử nghiệm nó cùng với hệ thống đi kèm. Kết quả cho thấy một bước tiến lớn: trí tuệ cao hơn trên mỗi watt điện và phản hồi nhanh hơn, mang lại cả thông lượng cao hơn và độ trễ thấp hơn trong cùng một kiến trúc mà không cần...

5:19 CH · 25 tháng 8, 2026 · 2,26 triệu lượt xem

584 lượt trả lời · 1,08 nghìn lượt đăng lại · 13,6 nghìn lượt thích

Chỉ số chính hiện nay đang chuyển dịch sang hiệu năng trên mỗi watt, và Jalapeño đã đáp ứng được điều đó:

Bài thuyết trình đầy đủ tại Hot Chips vẫn chưa được công bố nhưng các góc nhìn khác nhau được liệt kê dưới đây. Để có cái nhìn chi tiết hơn, hãy theo dõi cùng với phần còn lại của OpenAI:

Tin tức AI từ ngày 24/8/2026 đến 25/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn nhận hoặc hủy nhận email theo tần suất mong muốn!

Chip suy luận Jalapeño của OpenAI và sự thay đổi trong ngăn xếp suy luận (Inference Stack)

Các số liệu được công bố của Jalapeño là câu chuyện kỹ thuật lớn nhất trong ngày: OpenAI đã công bố chi tiết điểm chuẩn (benchmark) đầu tiên cho con chip suy luận tùy chỉnh Jalapeño, tuyên bố hiệu suất và độ trễ vượt trội đáng kể so với các hệ thống NVIDIA GB200/GB300 trên các khối lượng công việc mô hình thực tế. Trong các thử nghiệm của OpenAI, Jalapeño mang lại hiệu suất trên mỗi watt cao hơn 1,5–1,9 lần ở thông lượng đỉnh và độ trễ đầu cuối thấp hơn 1,7–3,6 lần, với hiệu năng cao hơn 2,1–4,1 lần cho các khối lượng công việc có tính tương tác cao; con chip được định mức ở mức 700W nhưng được báo cáo là duy trì ở mức 550W hoặc thấp hơn trong các lần chạy thử nghiệm. OpenAI cho biết việc triển khai vào cơ sở hạ tầng của riêng họ sẽ bắt đầu vào cuối năm nay, với thế hệ thứ 2 đang được phát triển chuyên sâu và thế hệ thứ 3 đang được tiến hành (thông báo của OpenAI, lộ trình triển khai, Sam Altman).

Tại sao các kỹ sư lại quan tâm: tuyên bố này không chỉ nằm ở hiệu năng thô, mà là một kiến trúc suy luận cân bằng hơn giúp giảm bớt sự đánh đổi thông thường giữa thông lượng và độ trễ. Nhiều phản hồi kỹ thuật nhấn mạnh rằng một số điểm so sánh đặc biệt đáng chú ý vì Jalapeño được cho là hoạt động tốt ngay cả khi không cần các thủ thuật như phân tách prefill/decode mạnh mẽ hoặc suy luận dự đoán (speculative decoding) trong một số thiết lập, trong khi vẫn đánh bại các hệ thống có sử dụng chúng (gdb, tóm tắt của kimmonismus, phân tích của eliebakouch, You Jiacheng). SemiAnalysis đánh giá đây là một ASIC thế hệ đầu tiên mạnh mẽ bất thường và so sánh trực tiếp nó với các hệ thống lớp Blackwell và Rubin (SemiAnalysis, dylan522p).

Một câu chuyện thứ cấp là tối ưu hóa hệ thống có sự hỗ trợ của mô hình: bài đăng của OpenAI cũng cho biết GPT-Astra + Codex đã giúp viết và tối ưu hóa các nhân (kernel) cấp thấp, đưa ba mô hình trọng số mở chưa từng được lên kế hoạch trước đó đạt hiệu năng cao trên Jalapeño trong khoảng hai tháng; đối với các khối attention và MoE được chọn lọc, các triển khai này được báo cáo là chạy nhanh hơn 1,5–1,8 lần so với mã nguồn do chuyên gia con người viết trước đây (kimmonismus, eliebakouch). Đó là một tín hiệu có ý nghĩa cho thấy công việc về trình biên dịch/nhân đang ngày càng được tích hợp vào vòng lặp cải tiến mô hình, thay vì chỉ là viết mã ở tầng ứng dụng.

Ý nghĩa hạ tầng rộng hơn: một số bài đăng liên kết Jalapeño với một sự chuyển dịch lớn hơn của ngành, trong đó các phòng thí nghiệm tiên phong có thể không còn phụ thuộc hoàn toàn vào NVIDIA về kinh tế suy luận, ngay cả khi năng lực đóng gói và xưởng đúc vẫn là một nút thắt cổ chai khó giải quyết (Liam Fedus, phản ứng của teortaxesTex, lưu ý của LearnOpenCV về năng lực TSMC/CoWoS).

Harness cho tác nhân (Agent Harnesses), Hệ thống bộ nhớ và Kỹ thuật đánh giá (Eval Engineering) đang trở thành ưu tiên hàng đầu

Chất lượng của harness ngày càng quan trọng ngang bằng với việc lựa chọn mô hình: nhiều bài báo và đợt ra mắt hội tụ vào cùng một chủ đề: hiệu suất của tác nhân phụ thuộc rất nhiều vào hệ thống xung quanh. Một bài báo mới do Microsoft dẫn đầu về AutoSaddler coi harness là mã nguồn và vá các prompt, cấu hình công cụ và logic điều khiển ngoại tuyến bằng cách sử dụng các dấu vết lỗi (failure traces), báo cáo mức tăng +9.0 trên GAIA2, +9.6 trên SWE-Bench Pro và +10.0 trên Terminal-Bench 2.0 so với các harness cơ sở (tóm tắt bài báo). Song song đó, một bài báo khác đã định lượng trực tiếp sự biến thiên của harness, phát hiện ra rằng việc thay đổi harness có thể làm thay đổi điểm số nhiều hơn so với việc thay đổi mô hình, với thứ hạng cặp mô hình bị đảo lộn trên các khung (scaffold) khác nhau; giải pháp được đề xuất là một tiêu chuẩn công khai Harness Card có cấu trúc (phân tích, “There Is No Neutral Harness”).

Kỹ thuật phần mềm dài hạn vẫn là một vấn đề chưa có lời giải: SWE Refactor Bench đo lường các tác vụ di chuyển toàn bộ kho lưu trữ như C→Rust, Maven→Gradle và POSIX→WebAssembly trên các dự án thực tế bao gồm SQLite, zlib và libsodium. Qua 520 lần chạy, chỉ có 28 lần vượt qua cả ba giai đoạn, đạt tỷ lệ thành công 5,4%, và 13/20 tác vụ không ai giải được (EinsiaAI). Đây là một sự điều chỉnh hữu ích đối với các con số sửa lỗi ấn tượng trên các benchmark lập trình cục bộ hơn.

Các hệ thống bộ nhớ đang được thiết kế lại như trạng thái có thể lập trình, không phải lịch sử trò chuyện nén: một bài báo của Alibaba được DAIR tóm tắt hỗ trợ các phiên tác nhân bằng nhật ký sự kiện chỉ ghi (append-only) cộng với một nhân Python bền vững, liên kết đầu ra công cụ và trạng thái dẫn xuất với các biến có kiểu dữ liệu thay vì liên tục tuần tự hóa chúng vào các prompt. Kết quả được báo cáo bao gồm 94,8% trên LongMemEval_S, 73,1% trên BEAM_10M (+5,1 so với hệ thống bộ nhớ tốt nhất được công bố trước đó) và 86,7% trên LOCA_256K với Qwen3.8-Max (tóm tắt). Công trình liên quan về Phân loại tri thức (Knowledge Triage) cho thấy việc nén ngữ cảnh ngây thơ sẽ phá hủy khả năng lưu giữ các quy tắc chính xác; sau năm vòng nén, một thiết lập chỉ bảo tồn được 10% các quy tắc an toàn, trong khi các chính sách lưu giữ nhận biết kiểu dữ liệu bảo tồn được nhiều hơn gấp 2–4 lần (tóm tắt).

Kỹ thuật đánh giá thực tế đang chuyển từ các quy trình làm việc đặc thù (ad hoc) sang các quy trình sản phẩm hóa: LangChain và các đối tác đã chia sẻ một vòng lặp cụ thể để biến các dấu vết và phản hồi của con người thành các đặc tả tác vụ, môi trường tổng hợp và các bài đánh giá có thể được sử dụng để đo lường và đào tạo lại các tác nhân theo thời gian (Vtrivedy10, hwchase17). LangSmith Engine cũng đã đạt hiệu suất tốt hơn gấp 2 lần trên các benchmark nội bộ quan trọng với khả năng phát hiện/phân cụm vấn đề tốt hơn, hỗ trợ SaaS và tự lưu trữ, tích hợp Slack/Linear và các chế độ phân tích theo tầng chi phí (LangChain).

Tác nhân ưu tiên cục bộ (Local-First Agents), Suy luận trên thiết bị và Ngăn xếp điện toán cá nhân mới

Portable Computer của Perplexity là đợt ra mắt sản phẩm tác nhân cục bộ rõ ràng nhất trong ngày: Perplexity đã ra mắt Portable Computer trên NVIDIA DGX Spark, định vị nó như một phiên bản hoàn toàn cục bộ của Perplexity Computer, nơi LLM điều phối, LLM tác nhân phụ và harness tác nhân đều chạy trên phần cứng cục bộ mà không phụ thuộc vào đám mây (ra mắt của Perplexity, chi tiết mô hình, NVIDIA, Arav Srinivas). Ngăn xếp cục bộ ban đầu sử dụng PPLX 27B đã qua đào tạo bổ sung với Qwen 3.8 27B cũng có sẵn; hỗ trợ cho Nemotron 3.5 Lightning sắp ra mắt.

Xu hướng sâu sắc hơn là các tác nhân cục bộ bền bỉ, luôn hoạt động: Srinivas đã phác thảo rõ ràng một tương lai của các tiến trình nền liên tục tiếp nhận ngữ cảnh từ các trình kết nối, thực hiện suy luận đa chặng trong một vòng lặp vĩnh viễn và chạy trên phần cứng của riêng bạn (Arav Srinivas). Phản ứng của cộng đồng chia làm hai luồng: hào hứng về quyền riêng tư/quyền kiểm soát và hoài nghi rằng "ưu tiên cục bộ" nên có nghĩa là một thiết bị DGX Spark trị giá 5.000 USD thay vì các thiết bị tiêu dùng phổ thông (phê bình của theo, phản hồi của theo).

Các công cụ AI cục bộ trên Apple/macOS cũng đang hoàn thiện: exo cho biết Apple đã giới thiệu nó trên các trang Mac Studio M5 Ultra và Mac Mini M6/M5 Pro mới, nhấn mạnh RDMA độ trễ thấp qua Thunderbolt 5 để cụm các máy Mac và chạy các mô hình như Kimi K3 và GLM-5.3 ở tốc độ giống như API, với khả năng mở rộng 4× M5 Ultra đạt băng thông bộ nhớ tổng hợp khoảng 4,8 TB/s (exo). Các bài đăng liên quan chỉ ra rằng bộ lưu trữ PCIe nhanh hơn của Apple và các đường ống thị giác dựa trên ANE giúp các cụm cục bộ nhỏ và suy luận hỗn hợp CPU/ANE/GPU trở nên thiết thực hơn (anemll, onirenaud).

Các công cụ tiếp tục được bổ sung xung quanh các môi trường chạy cục bộ: Ollama v0.33 đã thêm tích hợp một lần nhấn để cho phép Claude Desktop sử dụng Ollama như một cổng kết nối bên thứ ba cho các mô hình đám mây và cục bộ (Ollama); OpenCode v2 được trình diễn chạy bên trong Cloudflare Durable Object, minh họa cách các môi trường chạy tác nhân nhỏ đang trở nên có thể nhúng trong các môi trường biên (fayazara).

Mô hình, Truy xuất và Hạ tầng tìm kiếm

Qwen 3.8 đang xuất hiện trên khắp ngăn xếp: sự nhiệt tình xung quanh bản phát hành Qwen3.8 được thể hiện rõ trong cả các bài đăng về triển khai và đánh giá, với Together bổ sung hỗ trợ tinh chỉnh và suy luận chuyên dụng cho Qwen3.8-27B (Together) và Unsloth tuyên bố tinh chỉnh QLoRA đầy đủ cho mô hình 27B trên các phiên bản Kaggle Tesla T4 2× miễn phí bằng cách sử dụng các nhân được tối ưu hóa (danielhanchen). Về phía ứng dụng, Qwen3.8-27B đã đạt vị trí số 1 trong số các mô hình mở trong Image-to-WebDev Arena và vị trí thứ 7 chung cuộc, với mức giá 0,40 USD / 3 USD cho mỗi triệu token đầu vào/đầu ra (arena).

Hạ tầng tìm kiếm và truy xuất đã nhận được nhiều cập nhật quan trọng: Hugging Face đã xuất bản một bài viết chi tiết về kiến trúc cho công cụ tìm kiếm Papers with Code: PostgreSQL + pgvector, Qwen 3 Embedding 0.6B, truy xuất lai, các embedding được tạo trên NVIDIA L4 thông qua Hugging Face Jobs, các artifact trong bucket và phục vụ trực tiếp thông qua Inference Endpoints; cùng một ngăn xếp này cung cấp năng lượng cho "các bài báo liên quan" trên các trang bài báo (Niels Rogge). Keenable đã thoát khỏi chế độ ẩn danh với Web Search API và Web Query Language dành cho AI, được xây dựng bởi các cựu lãnh đạo Yandex Search và được hỗ trợ bởi khoản đầu tư hạt giống 26 triệu USD, nhắm mục tiêu rõ ràng vào truy xuất web ở quy mô tác nhân (styskin).

Thiết kế mô hình truy xuất vẫn là một lĩnh vực hoạt động tích cực: có những thảo luận mới xung quanh việc truy xuất tương tác muộn / đa vector, với các tuyên bố rằng hành vi mở rộng cuối cùng cũng đang trở nên rõ ràng trong các khối lượng công việc truy xuất và việc đồng thiết kế mô hình + DB quan trọng ít nhất bằng định dạng lưu trữ (góc nhìn của mixedbread, Silvio Martinico).

Robot học, Mô hình thế giới vật lý và Dữ liệu hiện thân

"Index" của Figure là một thông báo lớn về dữ liệu robot: Figure đã giới thiệu Index, được mô tả là tập dữ liệu robot lớn nhất và đa dạng nhất trên thế giới, với tốc độ nạp dữ liệu được báo cáo là 30 phút video mỗi giây, 16 triệu lượt tải lên video, 15 triệu USD đã được chi trả cho dữ liệu và 264 nghìn lượt tải xuống. Công ty cũng cho biết họ sẽ chi 1 tỷ USD trong 12 tháng tới cho dữ liệu và tính toán (Brett Adcock, thông tin tiếp theo). Quy mô đó rất quan trọng vì nhiều phòng thí nghiệm robot dường như vẫn bị thắt cổ chai về dữ liệu trình diễn và nhận thức hơn là sự mới lạ về kiến trúc.

Mô hình vật lý/thế giới quy mô lớn tiếp tục đẩy giới hạn ngữ cảnh: Anima Anandkumar đã nêu bật Accelerated Understanding, một công ty khởi nghiệp xây dựng các mô hình AI lớn cho mô phỏng vật lý trên các phương thức và không gian thời gian 4D, tuyên bố 1 nghìn tỷ tham số trong quá trình tiền huấn luyện, 1 nghìn tỷ ngữ cảnh trong quá trình huấn luyện và >5 nghìn tỷ ngữ cảnh khi suy luận mà không cần lấy mẫu phụ hoặc vá lỗi (Anima Anandkumar). Các chi tiết còn thưa thớt, nhưng bài đăng đáng chú ý như một tuyên bố về hướng đi của một số công việc mô hình hóa phi ngôn ngữ tiên phong: mô phỏng đa phương thức với ngữ cảnh khổng lồ thay vì chỉ tạo văn bản/video.

Khả năng tổng quát hóa chính sách hiện thân vẫn là một mục tiêu benchmark tích cực: một bài đăng khác về robot đã giới thiệu S1, một mô hình thao tác có thể hoàn thành các tác vụ từ một lần trình diễn duy nhất nằm ngoài phân phối huấn luyện của nó (anag004). Google Research cũng đã chia sẻ AgentHands, một hệ thống XR giúp tăng cường các tác nhân hội thoại bằng các cử chỉ tay đồng bộ để hướng dẫn không gian trong các tác vụ vật lý (Google Research).

Các tweet hàng đầu (theo mức độ tương tác)

Ra mắt chip OpenAI: @sama về Jalapeño, thông báo benchmark của @OpenAI đã thúc đẩy cuộc trò chuyện kỹ thuật lớn nhất từ trước đến nay.

Ra mắt tác nhân cục bộ: @perplexity_ai ra mắt Portable Computer là đợt phát hành sản phẩm lớn nhất ngoài câu chuyện về chip.

Nền tảng nhà phát triển / web gốc tác nhân: @OpenAIDevs thông báo về Thử thách WebMCP và hỗ trợ WebMCP trong ChatGPT desktop báo hiệu OpenAI đang thúc đẩy các trang web hướng tới các giao diện tác nhân rõ ràng.

Tác nhân tác vụ cục bộ mã nguồn mở: @AndrewYNg về OpenWorker nổi bật vì kết hợp các harness mở, mô hình cục bộ và quy trình làm việc tập trung vào bảo mật.

Tính thực tế của benchmark cho các tác nhân lập trình: @EinsiaAI về SWE Refactor Bench là một trong những bản phát hành benchmark hữu ích hơn trong bộ vì nó nhắm mục tiêu vào các quá trình di chuyển toàn bộ kho lưu trữ thay vì các chỉnh sửa cục bộ.

Phần cứng AIChip AIOpenAICông nghệ mớiHot Chips
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.