IT Home
92

Tin ngành

MLPerf Inference v6.1: AMD MI355X thiết lập kỷ lục mới, NVIDIA lộ diện chip Vera Rubin VR200

(giờ Việt Nam)

Tóm tắt AI

Kết quả MLPerf Inference v6.1 ghi nhận AMD với 512 GPU Instinct MI355X đạt kỷ lục 5,75 triệu token/giây trên DeepSeek R1. Đồng thời, thế hệ chip Vera Rubin VR200 của NVIDIA cũng lần đầu xuất hiện trong bảng xếp hạng.

Bản dịch AI

Theo tin từ IT ngày 17 tháng 9, trang tin công nghệ Wccftech đã đăng tải bài viết vào ngày hôm qua (16 tháng 9), báo cáo rằng sau khi MLPerf Inference v6.1 được công bố, các nhà sản xuất như AMD và NVIDIA đã đồng loạt gửi kết quả kiểm thử.

Lưu ý của IT: MLPerf Inference là bộ công cụ đo lường hiệu năng suy luận do MLCommons duy trì, được sử dụng để đánh giá khả năng thông lượng và độ trễ của các phần cứng khác nhau trong các tác vụ suy luận AI. Phiên bản 6.1 mới nhất tập trung vào thông lượng suy luận AI, hiệu quả mở rộng và hiệu năng trên các cấu hình GPU khác nhau.

AMD cho biết họ đã thiết lập kỷ lục MLPerf mới với tốc độ 5,75 triệu token/giây trên quy mô 512 GPU. Đây là bài đệ trình có quy mô lớn nhất của AMD từ trước đến nay, một lần nữa khẳng định hiệu năng, quy mô, độ hoàn thiện của phần mềm và khả năng tái lập kết quả của hãng.

Trong bài kiểm tra DeepSeek R1, AMD tham gia với 512 GPU Instinct MI355X, đạt kết quả ở chế độ Offline (nhấn mạnh khả năng xử lý hàng loạt, thường dùng để đo thông lượng tối đa của hệ thống trong các tình huống không yêu cầu thời gian thực) là 2.901.950 tokens/s, và ở chế độ Server (nhấn mạnh thông lượng và khả năng phản hồi trong các tình huống dịch vụ trực tuyến, sát với môi trường xử lý yêu cầu khi triển khai thực tế) là 2.405.310 tokens/s.

NVIDIA đã gửi kết quả cho cùng hạng mục với cấu hình 288 GPU của GB300 và GB200, trong đó GB300 đạt 2.705.130 tokens/s ở chế độ Offline và 2.028.030 tokens/s ở chế độ Server. Do có sự khác biệt về cấu hình, các dữ liệu trên chỉ mang tính chất tham khảo.

Ngoài ra, Vera Rubin VR200 của NVIDIA lần đầu tiên xuất hiện trong bộ tiêu chuẩn đo lường MLPerf Inference với hai cấu hình là 36 GPU và 72 GPU. Ở cùng cấu hình 72 GPU, Vera Rubin (VR200) nhanh hơn 95% so với GB300; bên cạnh đó, phiên bản cấu hình 36 GPU còn đạt tốc độ nhanh hơn cả cấu hình 72-GPU GB200.

Phần cứng AIAMDNVIDIAMLPerfDeepSeek
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.