Tin ngành
Loongson ra mắt nền tảng GPU tự phát triển: Hỗ trợ CUDA, OpenCL 3.0 và suy luận AI
(giờ Việt Nam)
Tóm tắt AI
Loongson chính thức phát hành phiên bản phần mềm đầu tiên cho nền tảng GPU LG200, hỗ trợ các chuẩn lập trình CUDA, OpenCL 3.0 cùng thư viện tối ưu cho suy luận AI.
Bản dịch AI
Theo tin từ IT ngày 22 tháng 9, Loongson hôm nay thông báo ra mắt phiên bản phần mềm đầu tiên của Nền tảng tính toán tăng tốc Loongson (Loongson Accelerated Computing Platform), hỗ trợ GPU đa năng tự phát triển. Nền tảng này cung cấp sự hỗ trợ phần mềm toàn diện cho GPU đa năng của Loongson, từ trình điều khiển tầng thấp, môi trường lập trình cho đến suy luận mô hình AI.
Nền tảng này được phát triển dựa trên lõi GPU đa năng dòng LG200 tích hợp trong các chip Loongson 2K3000 và 9A1000. Trên nền tảng các ngăn xếp phần mềm đồ họa OpenGL và Vulkan hiện có, nền tảng này mở rộng bao phủ các thành phần như trình điều khiển chip tính toán, trình biên dịch, môi trường runtime, thư viện toán tử, công cụ suy luận, công cụ gỡ lỗi và công cụ phân tích hiệu năng.
Nền tảng tính toán tăng tốc Loongson hỗ trợ hai mô hình lập trình là OpenCL 3.0 và CUDA, đồng thời tích hợp các thư viện toán tử hiệu năng cao như BLAS, DNN, có thể được sử dụng cho suy luận mô hình AI. Nền tảng này hướng tới toàn bộ dòng chip tính toán của Loongson, hỗ trợ quy trình phát triển từ lựa chọn hệ thống, gọi tài nguyên tính toán, tối ưu hóa mô hình đến triển khai ứng dụng.
Về môi trường runtime, nền tảng cung cấp các chức năng như quản lý lập lịch tài nguyên, quản lý bộ nhớ, lập lịch hàng đợi tác vụ và đồng bộ hóa sự kiện. Trình điều khiển tầng thấp thực hiện trừu tượng hóa và quản lý thống nhất các tài nguyên tính toán phần cứng khác nhau để hỗ trợ thực thi đồng thời đa tiến trình và đa tác vụ.
Nền tảng cũng tích hợp trình biên dịch tính toán dành cho GPU đa năng Loongson, đồng thời tương thích với các giao diện lập trình OpenCL 3.0 và CUDA. Loongson cho biết trình biên dịch đã được tối ưu hóa cho kiến trúc tập lệnh và đặc tính phần cứng của GPU đa năng tự phát triển, đồng thời giảm chi phí phát triển và chuyển đổi thông qua khả năng tương thích ở cấp độ API.
Các công cụ gỡ lỗi và phân tích hỗ trợ thiết lập điểm dừng (breakpoint), truy cập thanh ghi và kiểm tra trạng thái các bộ phận phần cứng như đơn vị tensor, có thể được sử dụng để xác định các vấn đề trong phát triển chương trình tính toán như truy cập bộ nhớ vượt giới hạn, lỗi tính toán và khóa chết (deadlock) đồng bộ.
Thư viện toán tử hiện bao gồm đại số tuyến tính cơ bản và tính toán mạng thần kinh. Trong đó, các toán tử liên quan đến BLAS đã được tối ưu hóa ở cấp độ hợp ngữ cho phép nhân ma trận (GEMM), nhân ma trận-vector và các phép toán vector đối với các kiểu dữ liệu như FP32, INT8; các toán tử DNN bao gồm các thao tác phổ biến như tích chập (convolution), gộp (pooling), chuẩn hóa (normalization), kết nối đầy đủ (fully connected) và hàm kích hoạt (activation function).
Đối với đơn vị tensor và cấu trúc phân cấp bộ nhớ đệm của GPU đa năng Loongson, Loongson cũng đã tối ưu hóa chuyên biệt cho thư viện toán tử nhằm nâng cao hiệu suất sử dụng tài nguyên tính toán phần cứng.
Về suy luận AI, Loongson đã ra mắt công cụ suy luận hiệu năng cao LacInfer, tối ưu hóa đồ thị tính toán thông qua các phương pháp như hợp nhất toán tử (operator fusion), gấp hằng số (constant folding), loại bỏ toán tử và chuyển đổi bố cục. Trong đó, việc hợp nhất toán tử hỗ trợ các toán tử theo phần tử cũng như các toán tử đa nhánh, đa đầu vào, đồng thời hỗ trợ hợp nhất sâu các toán tử tích chập, bias và kích hoạt để giảm thiểu việc truy cập bộ nhớ dữ liệu.
Nền tảng tính toán tăng tốc Loongson hỗ trợ ONNX Runtime và sử dụng LacInfer làm backend thực thi cho ONNX Runtime. Dựa trên kiến trúc này, người dùng có thể triển khai trực tiếp các mô hình ONNX được xuất từ các khung huấn luyện như PyTorch, TensorFlow lên nền tảng GPU đa năng Loongson mà không cần chuyển đổi bổ sung hoặc viết lại mã nguồn.
Hiện tại, Loongson đã tối ưu hóa trên các chip như 9A1000 cho các mô hình thị giác máy tính như phát hiện mục tiêu, phân đoạn hình ảnh, ước tính tư thế, phát hiện mục tiêu xoay. Công ty cho biết trong khi tăng tốc độ suy luận, tổn thất độ chính xác của các suy luận lượng tử hóa liên quan cũng đã được kiểm soát.
Về khả năng tương thích phần cứng, nền tảng này hỗ trợ toàn bộ dòng chip tính toán của Loongson và các phiên bản nhân hệ điều hành Linux, đồng thời có kế hoạch phát triển đồng bộ cùng với các thế hệ chip tính toán tiếp theo như 9A2000, 9A3000 để đạt được khả năng tương thích phần mềm giữa các thế hệ chip tính toán khác nhau.
Ghi chú của IT: CUDA là nền tảng tính toán song song và mô hình lập trình GPU đa năng do NVIDIA ra mắt, trong khi OpenCL là một bộ tiêu chuẩn lập trình song song mở dành cho các thiết bị tính toán không đồng nhất, cả hai đều có thể được sử dụng cho tính toán tăng tốc GPU.
Loongson cho biết hiện tại các phần mềm tính toán liên quan đã phục vụ một số khách hàng sớm và đang triển khai nghiên cứu phát triển các tác nhân thông minh (intelligent agent) cho nhiều thiết bị trí tuệ hiện thân (embodied AI) dựa trên 2K3000 và 9A1000. Với việc chính thức ra mắt Nền tảng tính toán tăng tốc Loongson, công ty dự định cùng các đối tác trong chuỗi cung ứng và các nhà phát triển xây dựng hệ sinh thái phần mềm AI và tính toán.
Đọc thêm:
"Đạt cấp độ an toàn và tin cậy cấp III: Loongson 3A6000 (C)/3C3000, Huawei Kunpeng 950 vượt qua chứng nhận của Trung tâm Đánh giá An toàn Thông tin Trung Quốc"
"Hồ Vĩ Vũ (Loongson): Card đồ họa 9A1000 dự kiến bán ra vào nửa đầu năm sau, lõi CPU hiệu năng cao thế hệ thứ sáu đã bắt đầu nghiên cứu phát triển"
"Loongson: Dự kiến nửa đầu năm sau có thể cung cấp wafer logic cho các nhà sản xuất lưu trữ để sản xuất bộ nhớ HBM"
"Loongson: Lỗ ròng thuộc về công ty mẹ trong nửa đầu năm 2026 là 224 triệu nhân dân tệ, thu hẹp so với cùng kỳ năm trước"
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.