Thủ thuật
Chạy ứng dụng CUDA trên GPU AMD tại Windows: Giải pháp mã nguồn mở từ ZLUDA và HIP
(giờ Việt Nam)
Tóm tắt AI
Dự án mã nguồn mở mới cho phép chạy các ứng dụng CUDA trên GPU AMD thông qua sự kết hợp giữa ZLUDA v6 và AMD HIP SDK, mở ra khả năng tương thích phần cứng linh hoạt hơn cho người dùng Windows.
Bản dịch AI
STACK CÓ THỂ TÁI LẬP ĐÃ ĐƯỢC TẢI LÊN.
Chạy các ứng dụng Windows nhắm mục tiêu CUDA trên GPU AMD thông qua ZLUDA + ROCm/HIP.
Một thiết lập tương thích Windows CUDA có thể tái lập được xây dựng dựa trên ZLUDA + AMD HIP/ROCm. Nó dành cho các ứng dụng tính toán sử dụng CUDA, bao gồm cả các khối lượng công việc sử dụng LibTorch hỗ trợ CUDA.
Quan trọng
Phần cứng đã được xác thực hiện chỉ bao gồm AMD Radeon RX 9060 XT (gfx1200). Các GPU AMD khác chỉ là ứng viên, không đảm bảo là thiết bị hoạt động tốt. Nếu bạn thử nghiệm trên card khác, vui lòng mở một báo cáo tương thích GPU, bất kể nó hoạt động hay thất bại.
Đã xác minh hôm nay
Đường dẫn công khai, chỉ sử dụng upstream đã được kiểm thử mà không cần bất kỳ DLL riêng tư/đã khôi phục nào:
Bài kiểm tra tích hợp đó đã sử dụng cùng khối lượng công việc huấn luyện LibTorch hướng CUDA vốn là động lực ban đầu cho dự án này. Xem docs/VALIDATION.md.
Điều này không có nghĩa là mọi chương trình CUDA hoặc mô hình AI đều hoạt động. Độ bao phủ của API/thư viện CUDA phụ thuộc vào khối lượng công việc.
Cách thức hoạt động
Cài đặt
1. Cài đặt các điều kiện tiên quyết của AMD
Cài đặt trình điều khiển GPU AMD hiện tại và AMD HIP SDK cho Windows, bao gồm cả các Thư viện HIP.
Tham chiếu đã xác thực sử dụng HIP SDK 6.4. Các phiên bản mới hơn có thể hoạt động nhưng nên được coi là chưa xác minh cho đến khi có báo cáo.
Hướng dẫn AMD Windows HIP SDK: https://rocm.docs.amd.com/projects/install-on-windows/en/docs-6.4.2/index.html
2. Sao chép (clone) và chạy trình cài đặt
install.ps1 sẽ:
Nếu bạn không cần LibTorch:
Chạy một ứng dụng nhắm mục tiêu CUDA
Trình khởi chạy sẽ dàn dựng các DLL tương thích ZLUDA cần thiết bên cạnh ứng dụng mục tiêu và thiết lập các đường dẫn runtime HIP/ROCm cho lần chạy đó.
Bạn cũng có thể dàn dựng mà không cần khởi chạy:
Chẩn đoán máy tính
Trình quét GPU ghi lại thông tin về model, kiến trúc gfx, trình điều khiển và thông tin HIP. Nó không cố ý thu thập tên người dùng, token hoặc tệp tin của người dùng.
Ví dụ trên máy đã xác thực:
Trạng thái GPU hiện tại
Trình quét nhận diện các dòng kiến trúc Windows HIP khác và đánh dấu chúng là các ứng viên chưa xác minh thay vì khẳng định hỗ trợ. Việc phát hiện không phải là bằng chứng cho thấy khối lượng công việc sẽ chạy được.
Bảng phần cứng Windows hiện tại của AMD: https://rocm.docs.amd.com/projects/install-on-windows/en/latest/reference/system-requirements.html
Độ bao phủ runtime trên thiết lập đã xác thực
Kiểm tra runtime upstream hiện tại:
HIP SDK ổn định trên Windows không đi kèm với toàn bộ stack thư viện AI của ROCm như MIOpen, vì vậy các phần mềm nặng về tích chập (convolution) yêu cầu cuDNN có thể cần một stack HIP mới hơn/bản nightly hoặc các công việc bổ sung. Việc huấn luyện LibTorch nặng về Dense/GEMM không nhất thiết yêu cầu cuDNN; khối lượng công việc PPO đã xác thực đã hoàn thành mà không cần đến nó.
Hiệu năng
Một thử nghiệm A/B có kiểm soát vào ngày 13/09/2026 đã chạy 10 lần lặp mỗi runtime trên cùng khối lượng công việc PPO của RX 9060 XT. Sau khi loại bỏ lần lặp đầu tiên của mỗi thử nghiệm để làm nóng (warmup), đường dẫn upstream công khai đạt trung bình 13.278 SPS tổng thể so với 12.876 của lớp phủ tùy chỉnh (custom overlay) đã khôi phục. Trong khối lượng công việc này, lớp phủ tùy chỉnh chậm hơn khoảng 3,03%, vì vậy upstream vẫn là mặc định.
Các lần chạy tinh chỉnh lịch sử đã sử dụng cấu hình huấn luyện khác và đạt khoảng 70k–109k bước/giây tổng thể. Xem docs/BENCHMARKS.md để biết phương pháp và dữ liệu thô.
Lớp phủ tùy chỉnh lịch sử tùy chọn
Môi trường phát triển ban đầu cũng đã thử nghiệm với một lớp phủ cuBLAS/cuBLASLt/HIP tùy chỉnh. Nó không bắt buộc đối với đường dẫn công khai đã xác thực và dựa trên thử nghiệm A/B có kiểm soát ở trên, hiện tại nó không mang lại lợi thế về hiệu năng cho khối lượng công việc PPO tham chiếu.
Các DLL đã khôi phục vẫn được lưu dấu vân tay trong manifests/recovered-artifacts.sha256. Chúng không được xuất bản dưới dạng binary blob vì nguồn/nguồn gốc của trình bao bọc tùy chỉnh ban đầu không đầy đủ và runtime HIP đã khôi phục chứa các tệp nhị phân của bên thứ ba từ AMD. Xem docs/CUSTOM_OVERLAY.md.
Tìm thấy lỗi hoặc đã thử nghiệm trên một GPU khác?
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.