Tin ngành
NVIDIA công bố GPU Rubin: 336 tỷ bóng bán dẫn, hiệu năng AI tác tử tăng gấp 10 lần
(giờ Việt Nam)
Tóm tắt AI
NVIDIA vừa hé lộ kiến trúc GPU Rubin sử dụng tiến trình 3nm của TSMC, tích hợp 336 tỷ bóng bán dẫn và bộ nhớ HBM4. Với những cải tiến về lõi Tensor và Transformer Engine, Rubin mang lại hiệu suất xử lý AI tác tử vượt trội gấp 10 lần so với thế hệ Blackwell.
Bản dịch AI
Theo tin từ IT ngày 22 tháng 7, NVIDIA hôm nay đã đăng tải bài viết công bố chi tiết về kiến trúc GPU Rubin. GPU này dựa trên tiến trình 3nm của TSMC, tích hợp 336 tỷ bóng bán dẫn và mang lại hiệu suất AI tác tử (agent AI) cao gấp 10 lần so với Blackwell.
Về kiến trúc, NVIDIA cho biết GPU Rubin được sản xuất bằng tiến trình 3nm (N3P) của TSMC, đạt được mật độ và hiệu suất cao nhờ hai khuôn (Die) có kích thước giới hạn quang học. Hai khuôn này được kết nối thông qua giao diện băng thông cao của NVIDIA (NV-HBI) thành một gói thống nhất, tích hợp tổng cộng 336 tỷ bóng bán dẫn, tăng 62% so với chip Blackwell GB300.

Mỗi GPU Rubin bao gồm 8 GPC (Cụm xử lý đồ họa), với tổng cộng 224 SM (Bộ xử lý dòng) và 896 Tensor Cores. Theo sơ đồ khối, có hai loại GPC: một loại chứa 30 SM và loại còn lại chứa 26 SM.
Mỗi khuôn (Die) được trang bị 4 GPC, kết nối với hai nhóm bộ nhớ đệm L2 phi tập trung lớn, một Gigathread Engine, bốn kênh HBM (4096-bit mỗi chip) và một giao diện NVLink.
NVLink 6 cung cấp băng thông kết nối giữa các GPU là 3600 GB/s, giao diện NVLink-C2C cung cấp băng thông giao tiếp giữa CPU và GPU là 1800 GB/s, trong khi các kênh PCIe Gen6 x16 cung cấp băng thông kết nối máy chủ là 256 GB/s.
Về các chỉ số hiệu suất, dữ liệu chính thức từ NVIDIA cho thấy đối với khối lượng công việc AI tác tử, thông lượng trên mỗi đơn vị năng lượng của Rubin đạt gấp 10 lần so với Blackwell.

Sự cải thiện này đến từ ba thay đổi kiến trúc chính: Tensor Cores nâng cao hỗ trợ độ chính xác mở rộng, hệ thống con bộ nhớ HBM4 hoàn toàn mới và Transformer Engine thế hệ thứ ba.
Về hệ thống bộ nhớ, Rubin được trang bị 8 ngăn xếp HBM4 12-Hi với tổng dung lượng 288 GB, dung lượng mỗi ngăn xếp là 36 GB, băng thông đỉnh đạt 22 TB/s, tăng 1,8 lần so với mức 8 TB/s của Blackwell.

Giải pháp bộ nhớ này hỗ trợ cửa sổ ngữ cảnh lớn hơn, lưu lượng truy cập đồng thời cao hơn, đồng thời đảm bảo tốc độ di chuyển nhanh chóng của trọng số mô hình và trạng thái KV trong giai đoạn tạo token.



Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian lựa chọn, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.