IT Home
92

Sản phẩm

OpenAI ra mắt chip suy luận Jalapeño hợp tác cùng Broadcom, tuyên bố vượt mặt Nvidia GB300

(giờ Việt Nam)

Tóm tắt AI

Tại hội nghị Hot Chips, OpenAI đã công bố kết quả thử nghiệm chip Jalapeño, cho thấy hiệu suất xử lý token và lưu lượng trên mỗi kilowatt vượt trội so với các bộ xử lý suy luận hàng đầu hiện nay.

Bản dịch AI

Theo tin từ IT ngày 25 tháng 8, OpenAI đã công bố thêm chi tiết về hệ thống suy luận hoàn toàn mới mang tên Jalapeño tại hội nghị Hot Chips tối nay (25/8), đồng thời lần đầu tiên tiết lộ kết quả kiểm thử benchmark. Trong bài kiểm tra InferenceX của SemiAnalysis, Jalapeño đã vượt qua các bộ xử lý suy luận hàng đầu hiện có trên thị trường về cả lưu lượng xử lý token trên mỗi người dùng lẫn thông lượng trên mỗi kilowatt.

Richard Ho, Giám đốc phần cứng của OpenAI, cho biết trong một cuộc họp báo qua điện thoại: "Điểm quan trọng nhất của kết quả kiểm thử là Jalapeño đã đạt được sự cải thiện hiệu năng vượt trội so với các sản phẩm tiên tiến nhất hiện nay. Nó có thể xử lý khối lượng công việc AI lớn hơn với cùng một mức tiêu thụ điện năng, đồng thời đưa ra phản hồi nhanh hơn. Jalapeño vừa phù hợp để phục vụ hiệu quả cho lượng lớn người dùng, vừa duy trì được độ trễ rất thấp."

Jalapeño được OpenAI hợp tác phát triển cùng Broadcom, với sự tham gia nghiên cứu từ chính các mô hình của OpenAI. OpenAI kỳ vọng sẽ phát triển Jalapeño thành một nền tảng công nghệ có thể kế thừa qua nhiều thế hệ, cho phép các sản phẩm AI, mô hình, chip và bộ nhớ được đồng thiết kế ngay từ đầu.

Con chip này chủ yếu đảm nhận nhiệm vụ suy luận AI, tức là giúp các mô hình AI đã được huấn luyện thực sự vận hành, hoàn thành tác vụ hoặc điều khiển các AI agent.

OpenAI đã sử dụng nền tảng InferenceX để kiểm tra hiệu năng suy luận của Jalapeño và so sánh với hệ thống siêu chip GB200 và GB300 của NVIDIA. OpenAI cho biết, trên ba mô hình GPT-OSS 120B, DeepSeek R1 và Kimi K2.5 1T, khối lượng công việc AI mà Jalapeño có thể hoàn thành trên mỗi watt cao gấp 1,5 đến 1,9 lần so với các hệ thống đối chứng, trong khi độ trễ end-to-end chỉ bằng khoảng 28% đến 59% so với các hệ thống này.

Việc phát triển đồng bộ toàn diện (full-stack) cũng cho phép OpenAI tối ưu hóa trực tiếp các khâu dễ gây chậm trễ nhất trong quá trình suy luận. Jalapeño tập trung giảm độ trễ ở giai đoạn tiền nạp (prefill) và giai đoạn truyền tải dữ liệu, vốn là những nút thắt cổ chai chính đối với hiệu năng suy luận theo quan điểm của OpenAI.

Trong bài đăng trên blog công bố kết quả kiểm thử, OpenAI đề cập rằng Jalapeño được thiết kế để giảm thiểu tối đa việc di chuyển dữ liệu và độ trễ truyền tải ngay từ đầu. Các trạng thái mô hình như KV cache được sử dụng khi tạo phản hồi có thể được lưu trữ và giữ lại cục bộ một cách rõ ràng, sau đó hệ thống sẽ điều phối tài nguyên tính toán, bộ nhớ và mạng phù hợp dựa trên các giai đoạn suy luận khác nhau.

Theo thông tin mà IT nắm được, OpenAI dự kiến sẽ triển khai Jalapeño ở "quy mô nhỏ" trước cuối năm nay và dần mở rộng quy mô triển khai vào năm 2027, tuy nhiên hãng chưa công bố cụ thể số lượng chip sẽ được đưa vào sử dụng trong năm tới.

Tham khảo

Thông cáo chính thức của OpenAI: Kết quả đầu tiên của Jalapeño cho thấy tốc độ và hiệu quả dẫn đầu ngành trong suy luận AI.

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, giúp tiết kiệm thời gian lựa chọn; kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.

OpenAIChip AIBroadcomNvidiaPhần cứng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.