Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
92

Thủ thuật

OpenAI ra mắt chip Jalapeño: Đối thủ đáng gờm thách thức vị thế của Nvidia Blackwell

(giờ Việt Nam)

Tóm tắt AI

OpenAI vừa công bố chip tự phát triển Jalapeño với hiệu năng suy luận vượt trội so với Blackwell của Nvidia, đánh dấu bước tiến chiến lược trong việc giảm phụ thuộc vào phần cứng bên thứ ba.

Bản dịch AI

OpenAI Jalapeño: Better Than Nvidia Blackwell

OpenAI đã dành vài năm qua để âm thầm xây dựng “Jalapeño”, một con chip suy luận vừa được công bố tại Hot Chips. Những tin đồn về việc tapeout (hoàn tất thiết kế để sản xuất) thành công đã lan truyền từ lâu. Nhưng giờ đây chúng ta đã có thông tin chi tiết. OpenAI đã mời chúng tôi xem xét con chip của họ, đến các phòng thí nghiệm để kiểm chứng tính thực tế và thực hiện đo kiểm (benchmark) bằng bộ công cụ InferenceX của chúng tôi.

Vào tháng 6, OpenAI đã công bố chương trình chip hợp tác với Broadcom, được xây dựng từ con số không dành riêng cho suy luận LLM. Công việc thiết kế bắt đầu từ giữa năm 2024, đi từ khâu tuyển dụng đội ngũ ban đầu đến khi tapeout sản xuất trong khoảng 16 tháng, một chu kỳ phát triển ASIC cực kỳ nhanh chóng.

Thông thường, các thế hệ chip đầu tiên không có tính cạnh tranh cao, nhưng OpenAI đã phá vỡ xu hướng này bằng cách dẫn đầu ngành và đánh bại mọi con chip của Nvidia, AMD và Google mà chúng tôi có thể thử nghiệm trên nhiều mô hình mã nguồn mở hàng đầu. OpenAI đạt được điều này nhờ sự kết hợp phần cứng và phần mềm (hardware-software codesign) ở mức độ cao. Đáng ngạc nhiên là OpenAI không quá chuyên biệt hóa vào bất kỳ phần cụ thể nào của quá trình suy luận mô hình, mà thay vào đó tập trung trở thành một con chip đa năng mang lại hiệu suất cao trong mọi tình huống.

Trong bài viết này, chúng tôi sẽ đi sâu vào các chi tiết kiến trúc, chi tiết phần mềm và kết quả hiệu suất của Jalapeño trên InferenceX.

Mọi người đều nói rằng chip của OpenAI được chuyên biệt hóa cho các mô hình của OpenAI, nhưng điều đó sai, OpenAI đã tạo ra một con chip tổng quát cho suy luận AI.

Các mốc thời gian thật điên rồ. Nó cho thấy những tuyên bố về việc sử dụng AI để tăng tốc thiết kế chip là có thật. Bất chấp tiến độ nhanh chóng, OpenAI đã chi rất nhiều tiền, đưa ra các quyết định thiết kế thực dụng và đội ngũ của họ rất xuất sắc, vì vậy điều này không có gì đáng ngạc nhiên.

Chỉ nhìn vào thông số kỹ thuật, nó đã là một đối thủ cạnh tranh trực tiếp:

Và việc sử dụng HBM4 khiến nó nổi bật, có thể so sánh với các GPU hàng đầu từ NVIDIA và AMD:

Rất nhiều phương tiện truyền thông đưa tin về con chip này dựa trên một vài bình luận bâng quơ từ OpenAI cho rằng con chip sẽ được tối ưu hóa cho các mô hình của họ theo cách mà các con chip khác không làm được. Điều này sai. Jalapeño là một con chip suy luận tổng quát có khả năng chạy tất cả các loại mô hình và tất cả các loại khối lượng công việc, bao gồm cả bài kiểm tra InferenceX của chúng tôi, nơi chúng tôi đã chạy benchmark cùng với các kỹ sư của OpenAI trong phòng thí nghiệm. Như một trò đùa, OpenAI thậm chí còn cho chúng tôi xem nó chạy Doom, trò chơi đã được chuyển sang con chip của họ chỉ bằng các câu lệnh Codex.

Dưới đây là kết quả hiệu suất trên mỗi Watt (perf/W) tiêu đề của chúng tôi, xem xét thông lượng token trên mỗi MW tiện ích All-in. Jalapeño vượt xa mọi con chip khác. Tất cả những điều này được thực hiện mà không cần Multi Token Prediction (MTP), trong khi các con chip khác trên biểu đồ là các cấu hình hoạt động tốt nhất của từng SKU tương ứng, tất cả đều có MTP.

Jalapeño đánh bại Blackwell về hiệu suất trên mỗi Watt (perf/W) trong hầu hết các tình huống mà không cần tinh chỉnh cho bất kỳ điểm cụ thể nào trên đường cong. Nó không chỉ vượt trội trong các tình huống có độ trễ thấp mà còn trong các tình huống có thông lượng cao. Một sự so sánh công bằng hơn là với kết quả Single Token Prediction, nó đánh bại mọi đối thủ cạnh tranh. Ở các tình huống đồng thời thấp, Jalapeño thể hiện khả năng tương tác đáng kinh ngạc, đạt hơn 700 token mỗi giây trên mỗi người dùng ở mức đồng thời 1 trên mô hình DeepSeek R1.

Đáng kinh ngạc là tất cả những điều này đạt được với single-token prediction (STP), không cần giải mã suy đoán (speculative decoding) và không cần phân tách prefill-decode. Ngoài DeepSeek R1, chúng tôi cũng được xem một số mô hình khác, bao gồm Kimi-K2.5 và GPT-OSS chạy ở tốc độ khoảng 1.400 tok/sec/user. Đối với tất cả các mô hình, chúng tôi xác nhận rằng các đánh giá GSM8k của Jalapeño đạt kết quả ngang bằng với chip Nvidia.

Một vài lưu ý về điều này. Thứ nhất, tất cả các con số đều do OpenAI cung cấp cho chúng tôi. Chúng tôi đã xác minh các lượt chạy InferenceX trực tiếp tại phòng thí nghiệm, nhưng chúng tôi chưa chạy toàn bộ bộ benchmark InferenceX cũng như chưa thấy kết quả AgentX. AgentX là bộ công cụ ưa thích của chúng tôi để so sánh hiệu suất chip do bối cảnh dài và đặc điểm đa lượt của tập dữ liệu phản ánh hành vi bộ nhớ đệm của các quy trình sản xuất thực tế. Các khung làm việc hoạt động tốt trên 8k1k có thể hoạt động kém hơn trên AgentX vì tải sản xuất thực tế gây áp lực lên các thành phần như bộ định tuyến, cơ chế bộ nhớ đệm tiền tố, quản lý bộ nhớ đệm, cơ sở hạ tầng offload, v.v. Những điều này không được kiểm tra bởi 8k1k đơn lượt. Đọc thêm về điều này trong bài viết AgentX của chúng tôi.

Thứ hai, chúng tôi tin rằng việc so sánh với Blackwell là hơi không đầy đủ và không công bằng. Jalapeño thực sự đang cạnh tranh với các con chip như Rubin cũng sử dụng HBM4. Các hệ thống Vera Rubin đang bắt đầu được vận chuyển đến khách hàng ngay bây giờ, trong khi OpenAI vẫn còn một thời gian nữa mới có thứ gì đó ngoài các mẫu kỹ thuật của Jalapeño.

Do đó, hiệu suất thực sự nên được so sánh với Rubin, không phải Blackwell, và theo một nghĩa nào đó, chúng tôi kỳ vọng một con chip tùy chỉnh như Jalapeño sẽ vượt trội hơn Blackwell. Vera Rubin NVL72 mang lại hiệu suất trên mỗi MW (perf/MW) gấp 5,4 lần so với GB200 NVL72 như chúng tôi đã mô tả trong bài viết phân tích các tuyên bố về hiệu suất của NVIDIA trong buổi ra mắt với CoreWeave tháng trước. Chúng tôi sẽ so sánh Jalapeño với số liệu hiệu suất tháng 7 của Vera Rubin ở phần dưới đây.

Thứ ba, các mô hình đang được thử nghiệm không nằm ở ngưỡng tiên phong (frontier). NVIDIA và AMD đã công bố kết quả trên các mô hình lớn hơn như DeepSeek V4 Pro và Kimi K3, sử dụng AgentX. Mô hình càng lớn và càng mới thì việc đưa lên một con chip mới càng phức tạp. Mặc dù vậy, các mô hình mà OpenAI đang chạy trên Jalapeño cũng không hề nhỏ.

OpenAI thiết kế vì hiệu suất trên mỗi Watt (perf/W). Lý do rất đơn giản: OpenAI hiện đang bị giới hạn bởi điện năng trung tâm dữ liệu, không phải bởi ngân sách hay diện tích sàn, và do đó số token trên mỗi MW là tối quan trọng. Tại Computex 2026, Jensen cho biết perf/W, độ tin cậy và tuổi thọ lâu dài là những tính năng cốt lõi của các GPU tương lai. Trích dẫn: “Nếu bạn có 1 gigawatt điện, thì thông lượng trên mỗi watt chính là doanh thu”. Ông cũng đề cập rằng việc chọn sai kiến trúc chỉ vì chip rẻ hơn là không hợp lý.

Điều này đã được Nvidia nhấn mạnh trong bài nói chuyện về Vera tại Hot Chips 2026 khi hiển thị cùng một biểu đồ doanh thu: “Trung tâm dữ liệu ngày nay bị giới hạn về điện năng”. Điện năng rất quan trọng và thúc đẩy doanh thu.

Các nhà vận hành không thể đơn giản có thêm MW vì việc thêm GPU và thêm công suất lưới điện xảy ra ở các mốc thời gian rất khác nhau. Các giới hạn điện năng của trung tâm dữ liệu có những ràng buộc như kết nối tiện ích, cơ sở hạ tầng, công suất làm mát và thiết kế UPS/máy phát điện dự phòng. Sự chậm trễ của lưới điện liên tục vượt xa tiến độ phần cứng và xây dựng, thúc đẩy nhu cầu về công suất điện BtM (behind-the-meter): tua-bin khí và máy phát điện tại chỗ được xây dựng và đặt ngay tại trung tâm dữ liệu. Công suất này nằm sau đồng hồ đo của đơn vị tiện ích thay vì được lấy từ lưới điện công cộng. Nó cho phép nhà vận hành cấp nguồn cho cơ sở mà không cần chờ đợi kết nối lưới điện và nâng cấp tiện ích, đó chính xác là lý do tại sao Colossus 2 của xAI phụ thuộc rất nhiều vào BtM trong khi kết nối lưới điện thực tế của nó bị tụt hậu rất xa. Tìm hiểu thêm trong mô hình Năng lượng của chúng tôi.

Như chúng tôi đã viết trong một bài đăng trên X, tok/s/MW quy đổi thành token trên mỗi Joule vì một Watt là một Joule mỗi giây. Điều này làm cho tok/s/MW trở thành đại diện cho hiệu quả của hệ thống và khả năng chuyển đổi năng lượng thành token.

Về mặt này, ngay cả khi so sánh với Rubin, Jalapeño vẫn thắng. Jalapeño của OpenAI có thông lượng token đầu ra STP trên mỗi MW vượt qua kết quả MTP của Vera Rubin mà NVIDIA và CoreWeave đã công bố vào tháng 7. Nó cũng vượt xa kết quả MTP năm 2025 của GB200. Như đã đề cập trong bài viết về Vera Rubin, VR được so sánh với kết quả GB200 năm 2025 vì đó là giai đoạn tương tự của quá trình khởi động sớm, và việc so sánh với GB200 năm 2025 giữ cho sự trưởng thành của phần mềm là hằng số. Theo logic này, chúng tôi so sánh kết quả mới nhất tháng 7 năm 2026 của Vera Rubin, kết quả GB200 năm 2025 và kết quả Jalapeño hôm nay. Đây là một sự so sánh rất hợp lệ vì đây là những con số Rubin công khai tốt nhất, và OpenAI đã tapeout con chip của họ sau Rubin. Cả OpenAI và Rubin đều vẫn chưa hoàn thiện nên hiệu suất sẽ tiếp tục tăng.

Về perf/TCO (hiệu suất trên tổng chi phí sở hữu), Vera Rubin và Jalapeño ngang ngửa nhau, tạo ra gần như cùng một số lượng token đầu ra trên mỗi $. Tuy nhiên, như đã đề cập trước đó, kết quả của Jalapeño đạt được mà không cần giải mã suy đoán (speculative decoding) và kết quả của Vera Rubin sử dụng giải mã suy đoán. Giải mã suy đoán dẫn đến giảm chi phí trên mỗi token khoảng 3-5 lần. Khi giải mã suy đoán được triển khai trên Jalapeño, điều này sẽ cho phép Jalapeño phục vụ token hiệu quả hơn nữa về chi phí. Tất nhiên, một phần lợi thế TCO này đến từ việc đánh đổi biên lợi nhuận cao của Nvidia lấy biên lợi nhuận thấp hơn (mặc dù vẫn cao) của Broadcom. Nhưng đó không phải là tất cả. Ví dụ, các chương trình ASIC AI của Meta và Microsoft không thành công mặc dù đã thực hiện lâu hơn nhiều cho thấy chi phí chỉ là một phần của phương trình. Để biết bảng phân tích TCO đầy đủ của Jalapeño, hãy xem mô hình TCO AI Cloud của SemiAnalysis.

Về mặt kiến trúc, OpenAI đã chọn không phân tách prefill và decode (PD) trên các nhóm chip riêng biệt. Mô hình dự thảo và mô hình chính chia sẻ cùng một con chip và cấu trúc, một triết lý thiết kế đánh đổi một số hiệu quả lý thuyết để lấy tính vận hành thực tế. Động lực là sự kết hợp khối lượng công việc thay đổi theo thời gian, ví dụ tỷ lệ đầu vào so với ghi bộ nhớ đệm so với đọc bộ nhớ đệm so với token đầu ra đã thay đổi đáng kể khi chúng ta trải qua ba kỷ nguyên của các mô hình (kiến thức, suy luận và tác nhân, như đã thảo luận trong bài viết gần đây của chúng tôi). Do đó, việc chọn trước một lượng silicon prefill và decode không đồng nhất cố định có thể dẫn đến sự kém hiệu quả theo thời gian. OpenAI chọn một nhóm đồng nhất trong kiến trúc này và cố gắng làm cho con chip hoạt động tốt trên mọi thứ.

Và nó làm được điều đó. Trên Kimi K2.5 (dựa trên Cursor Composer 2.5), Jalapeño đạt gần 700tok/s/user và gấp hơn 9 lần con chip hoạt động tốt nhất tiếp theo ở mức 100tok/s/user.

Trên GPT-OSS, đó lại là một cuộc thảm sát khác. Thông lượng iso-interactivity trên mỗi MW của Jalapeño gần gấp đôi điểm thông lượng cao nhất của GB200 và gấp hơn 50 lần điểm đồng thời 1 của GB200. Các điểm Jalapeño có độ đồng thời cao hơn sử dụng EP8.

Những kết quả này thật ấn tượng! Tuy nhiên, chúng tôi phải bắt bẻ: chúng chỉ là 8k1k, một khối lượng công việc dễ dàng hơn nhiều để tinh chỉnh, và chưa có lượt chạy AgentX nào. Như đã đề cập trong bài viết AgentX của chúng tôi, khối lượng công việc đa lượt, bối cảnh dài gây áp lực lên nhiều khía cạnh hơn của ngăn xếp phục vụ, chẳng hạn như bộ định tuyến và bộ nhớ đệm tiền tố. Cần nhiều tối ưu hóa hơn nữa để vượt trội trong các khối lượng công việc tác nhân (agentic). Đọc thêm về điều này trong bài viết AgentX.

Tất cả các kết quả này được thu thập trên stepping A0 của Jalapeño, chỉ sau 9 tháng thực hiện chương trình. Nhưng đã có một stepping B0 hiện đang ở trong nhà máy! B0 có các tối ưu hóa mang lại hiệu suất trên mỗi watt cải thiện khoảng 25% so với silicon A0 trước đó. Cụ thể, stepping B0 mang lại 13,4 PFLOPs MXFP4 trên một khuôn tính toán kích thước reticle duy nhất được sản xuất trên N3P của TSMC. Con số này so với 17,5 PFLOPs NVFP4 dày đặc của Rubin cho một khuôn tính toán Rubin duy nhất có kích thước tương tự và trên cùng một node.

Điều này đáng nể hơn khi xét đến TDP của Jalapeño chỉ là 700W so với Rubin ở mức 900-1.150W trên mỗi khuôn tính toán. Vì Jalapeño hướng tới suy luận thay vì đào tạo, nên dễ hiểu là OpenAI không cần đẩy TDP cao hơn để tối đa hóa FLOPs, nhưng dù sao thì điều trên cho thấy Jalapeño mang lại các FLOPs lý thuyết đỉnh cao đáng nể.

Khi so sánh trực tiếp với các bộ tăng tốc khác, Jalapeño có băng thông HBM trên mỗi watt cao nhất và FLOPs trên mỗi watt cao nhất, tương đương với cấu hình Rubin Max-Q 1.800W:

I/O ngoài gói được cung cấp bởi một chiplet I/O N3E với 32 làn 800G SerDes, cho cấu trúc tính toán, với 24 làn (600GB/s) được sử dụng để mở rộng cục bộ trong rack và 8 làn (200GB/s) để mở rộng toàn cầu, đó là miền đa rack 2.048 XPU. PCIe Gen 5 được sử dụng cho I/O hệ thống để kết nối với CPU máy chủ x86.

Jalapeño sẽ xuất xưởng với HBM4, biến con chip này thành một trong những người áp dụng tương đối sớm sau Nvidia và AMD, thậm chí còn đánh bại các chương trình TPU và Trainium đã được thiết lập. Vì một trong những nguyên tắc kiến trúc chính đằng sau Jalapeño là tận dụng tối đa băng thông HBM, nên việc chấp nhận bất cứ thứ gì ngoài HBM tốt nhất sẽ đi ngược lại mục tiêu đó. Điều này dẫn đến 15,4TB/s băng thông bộ nhớ trên mỗi gói, vượt qua tất cả các bộ tăng tốc khác đang vận chuyển sử dụng HBM3E. Băng thông 15,4TB/s cho thấy HBM4 của nó có thể đạt tốc độ chân 10Gbps, điều này sẽ mang lại cho nó một lợi thế nhỏ so với 9,6Gbps mà Nvidia đang đạt được từ HBM4 của họ trong Rubin. HBM có khả năng được cung cấp bởi Samsung.

OpenAI đã tapeout Jalapeño vào tháng 11 năm 2025, hay cụ thể hơn, đây là bản tapeout của thiết kế CoWoS, không chỉ là silicon khuôn trên cùng. Trong vòng 9 tháng kể từ lần tapeout tháng 11 năm 2025 đó, và chỉ với 3 tháng khởi động trên silicon thực tế, OpenAI đã mang lại kết quả rất tốt với Jalapeño. Điều này càng ấn tượng hơn khi đội ngũ bắt đầu từ con số không trên ngăn xếp phần mềm.

Trong khi đó, bản tapeout CoWoS của Rubin đã hoàn thành vào tháng 10 năm 2025, sớm hơn một tháng, nhưng kết quả sớm duy nhất chúng tôi thấy là từ các mẫu kỹ thuật của CoreWeave. Nvidia đã không cho phép chúng tôi kiểm tra và công bố các benchmark theo cách mà OpenAI đã làm, cho thấy phần mềm chip của họ vẫn chưa hoàn thiện. Hào quang CUDA có khả năng đã chết khi xét đến tốc độ OpenAI có thể đưa các mô hình mới lên silicon của họ.

Chúng vẫn còn xa mới được tối ưu hóa và chúng ta có thể thấy rằng nhìn chung Jalapeño đã mang lại những con số tốt hơn. Chúng tôi không nghĩ rằng phần cứng Nvidia kém hơn, mà là quá trình khởi động phần mềm của Jalapeño đã tiến triển nhanh hơn của Nvidia. Điều này nói lên sức mạnh của việc đồng thiết kế phần cứng/phần mềm, đây là lĩnh vực chính mà một đội ngũ ASIC phòng thí nghiệm tiên phong xuất sắc có thể vượt qua các nhà cung cấp silicon thương mại lâu đời hơn. Trái ngược với suy nghĩ thông thường, việc bắt đầu từ đầu cũng có thể đã mang lại lợi ích cho OpenAI vì nó có thể đưa ra các quyết định kiến trúc từ con số không mà không phải lo lắng về khả năng tương thích ngược hoặc các phiên bản phần mềm cũ hơn.

OpenAINvidiaChip AIPhần cứngBán dẫn
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.