Sản phẩm
Huawei Ascend tối ưu hóa RL: Hiệu suất tăng tới 60% nhờ đồng bộ huấn luyện và suy luận
(giờ Việt Nam)
Tóm tắt AI
Huawei Ascend ra mắt giải pháp đồng bộ hóa huấn luyện và suy luận (RL), giúp đạt Logdiff bằng 0 trên mô hình Qwen3-30B và tăng 20-60% hiệu suất. Công nghệ này đã được mã nguồn mở để hỗ trợ cộng đồng tối ưu hóa mô hình AI.
Bản dịch AI
Theo tin từ IT ngày 6 tháng 8, học tăng cường (Reinforcement Learning) đã trở thành mô hình chủ đạo trong huấn luyện các mô hình ngôn ngữ lớn (LLM), thúc đẩy việc ứng dụng công nghệ mô hình vào các kịch bản cốt lõi của ngành. Trong đó, tính nhất quán giữa huấn luyện và suy luận (train-inference consistency) là vô cùng quan trọng, bởi vì quá trình suy luận và huấn luyện có sự liên kết chặt chẽ, và sự khác biệt về cơ sở hạ tầng dễ làm khuếch đại các yếu tố không chắc chắn.
Ngày 5 tháng 8, bộ phận Huawei Computing chính thức thông báo rằng, dựa trên ngôn ngữ lập trình Ascend C, Ascend cung cấp một tập hợp toán tử (operator) nhất quán hoàn chỉnh cho cả huấn luyện và suy luận. Trong các thử nghiệm trên mô hình Qwen3-30B MoE, chỉ số Logdiff đạt mức 0. Đồng thời, thông qua việc tối ưu hóa toán tử FA (FlashAttention) tương thích với Ascend, hiệu suất đã tăng từ 20% đến 60% ở chế độ Eager, mang đến cho các nhà phát triển giải pháp huấn luyện học tăng cường hiệu quả và đáng tin cậy.
Nguyên nhân gốc rễ dẫn đến sự thiếu nhất quán giữa huấn luyện và suy luận trong hậu huấn luyện RL (RL post-training) chính là việc không bảo toàn thứ tự cộng dồn trong tính toán cấp thấp. Để đảm bảo thứ tự cộng dồn giữa engine huấn luyện và engine suy luận luôn đồng nhất từ trên xuống dưới, cần sự phối hợp đồng bộ từ phía framework và phía toán tử. Khi tham số mô hình càng lớn, vấn đề này càng trở nên nghiêm trọng: các chiến lược phân đoạn như song song hóa tensor (tensor parallelism), song song hóa chuyên gia (expert parallelism), cùng với các đường dẫn truyền thông tập hợp (collective communication), chỉ cần một khâu không khớp là không thể đạt được "true-on-policy" cuối cùng. Các toán tử cũng cần bao phủ nhiều kịch bản gọi hàm khác nhau, áp đặt các ràng buộc lên những bước tính toán then chốt, đồng thời kiểm soát mức độ suy giảm hiệu suất trong phạm vi cho phép — đây là một thách thức kỹ thuật mang tính hệ thống.
Sự thiếu nhất quán giữa huấn luyện và suy luận đề cập đến sự không nhất quán về giá trị giữa engine Rollout (suy luận) và engine huấn luyện. Ngay cả khi cả hai sử dụng cùng một trọng số mô hình, xác suất log (logprob) được tính toán cho cùng một chuỗi Token vẫn có thể tồn tại những sai biệt nhỏ; sự khác biệt này thường được đo lường bằng logdiff.

Dựa trên ngôn ngữ lập trình Ascend C, Ascend đã thực hiện các ràng buộc và căn chỉnh mang tính hệ thống đối với các toán tử then chốt trong chuỗi huấn luyện và suy luận. Tư duy cốt lõi là: để huấn luyện và suy luận đi theo cùng một lộ trình giá trị tại "những nơi cần cộng dồn", chủ yếu bao gồm 4 thay đổi sau:
Thống nhất ngữ nghĩa chú ý (Attention): Căn chỉnh phạm vi tính toán trên các vị trí hiệu dụng giữa Softmax mặt nạ huấn luyện và cơ chế chú ý từng bước (step-wise attention) trong suy luận, nhằm loại bỏ sai số giá trị do sự khác biệt về tập hợp Token khả kiến.
Khóa thứ tự cộng dồn reduce: Ràng buộc thứ tự phân đoạn và quy giảm (reduction) trên chiều quy giảm của FA huấn luyện, PFA / PagedAttention suy luận, tránh tình trạng "cùng một template nhưng phân đoạn khác nhau" dẫn đến việc cộng dồn không bảo toàn thứ tự.
Căn chỉnh chiến lược phân khối (chunking) Softmax trực tuyến: Thống nhất kích thước khối và nhịp độ quy giảm, tránh sự không nhất quán giữa Softmax hợp nhất nhiều khối ở phía decoder và Softmax phân khối ở phía huấn luyện.
Căn chỉnh độ chính xác của đường dẫn then chốt: Thống nhất chiến lược chuyển đổi độ chính xác ở các bước nhạy cảm như cộng dồn Softmax, nhằm giảm thiểu sai số phần dư (mantissa error) do sự khác biệt trong triển khai độ chính xác hỗn hợp (mixed precision).

Trên cơ sở đó, kết hợp với việc tối ưu hóa lập lịch và phân phối FA, giúp tính nhất quán giữa huấn luyện và suy luận không còn phải đánh đổi bằng sự sụt giảm hiệu suất đáng kể, từ đó đạt được cả logdiff=0 và tăng tốc end-to-end trong các thử nghiệm thực tế.
Huawei thông báo rằng cơ sở hạ tầng liên quan đã được mã nguồn mở, đồng thời sẽ ra mắt "Skill nhận diện vấn đề nhất quán huấn luyện-suy luận", hỗ trợ rà soát logdiff còn sót lại, xác định xem đó là vấn đề về đường dẫn toán tử hay sự khác biệt trong triển khai framework.
IT đính kèm địa chỉ mã nguồn mở như sau:
https://github.com/verl-project/verl-ascend-recipe/tree/main/true_on_policy
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.