MarkTechPost
92

Sản phẩm

Cursor mã nguồn mở Mixture-of-Kittens (MoK): Siêu nhân kernel tối ưu huấn luyện MoE cho hệ thống GB300 NVL72

(giờ Việt Nam)

Tóm tắt AI

Cursor Research vừa công bố mã nguồn mở MoK, một siêu nhân kernel giúp hợp nhất tính toán và truyền tải dữ liệu, tăng tốc huấn luyện MoE lên tới 2,37 lần trên quy mô hàng chục nghìn GPU.

Bản dịch AI

Cursor Open-Sources Mixture-of-Kittens (MoK): A Deterministic MoE Training Megakernel for GB300 NVL72 Racks

Cursor Research vừa mã nguồn mở Mixture-of-Kittens (MoK), megakernel huấn luyện mixture-of-experts đứng sau các mô hình Composer của họ. MoK hợp nhất mọi bước tính toán và giao tiếp MoE thành một kernel tất định duy nhất. Nhóm Cursor báo cáo thông lượng cao hơn tới 2,37 lần so với các baseline công khai mạnh nhất hiện nay. Công nghệ này hiện đã hỗ trợ việc huấn luyện Composer trên hàng chục nghìn GPU.

Có thể triển khai được không?

Có, nhưng yêu cầu phần cứng rất cao. MoK hiện có trên GitHub theo giấy phép Apache-2.0. Nó yêu cầu GPU NVIDIA Blackwell SM100 hoặc SM103, đồng nghĩa với việc cần các rack GB200 NVL72 hoặc GB300 NVL72. Nó cũng yêu cầu Python 3.12+, PyTorch 2.10+ và CUDA toolkit 13.0+. Các bộ đệm liên GPU (inter-GPU buffers) dựa trên bộ nhớ đối xứng (symmetric memory) của PyTorch.

Điều đó giới hạn đối tượng áp dụng thực tế vào các tổ chức sở hữu hoặc thuê năng lực NVL72. Các phòng thí nghiệm tiên phong, các startup mô hình được tài trợ, các nhà cung cấp GPU neocloud và các trung tâm tính toán quốc gia là những đơn vị phù hợp. Các nhóm làm việc trên một node đơn lẻ hoặc các cửa hàng chỉ có 8 GPU thì không.

Các ứng dụng tuy hẹp nhưng có giá trị cao. Chúng bao gồm tiền huấn luyện (pretraining) và hậu huấn luyện (post-training) các mô hình MoE theo phong cách DeepSeek-V3. Tính tất định cũng làm cho nó hữu ích cho việc hậu huấn luyện RL on-policy và các thử nghiệm cắt bỏ (ablations) nội bộ. Các ngành liên quan bao gồm phát triển mô hình AI, hạ tầng GPU đám mây, công cụ tạo mã và nghiên cứu định lượng.

Lớp MoE là nút thắt cổ chai

Công việc trước đây của Cursor tập trung vào khía cạnh tính toán. Nhóm nghiên cứu đã tự viết các kernel huấn luyện MXFP8 và NVFP4 của riêng họ cùng với đường dẫn ‘warp decode’ cho suy luận MoE. Những công trình đó giả định rằng giao tiếp liên GPU được xử lý riêng biệt.

Trong sản xuất, giao tiếp trở thành yếu tố hạn chế. Lớp MoE có thể chiếm hơn một nửa thời gian huấn luyện tổng thể. Việc chuyển sang GB300 NVL72 lại thay đổi vấn đề một lần nữa. Một rack bao gồm 72 GPU bên trong một miền NVLink, cho phép chồng lấp (overlap) ở mức độ chi tiết. Tuy nhiên, các CPU Grace tích hợp lại chậm so với các GPU. Do đó, việc đồng bộ hóa CPU-GPU phải được giảm thiểu một cách quyết liệt.

Ba quyết định thiết kế quan trọng

MoK được xây dựng như một megakernel và hoàn toàn tất định. Nó hỗ trợ các chế độ chính xác BF16 và MXFP8. Việc lập lịch chạy thông qua Cluster Launch Control của Blackwell, vì vậy RDMA liên rack không bị tuần tự hóa phía sau nó. Gradient trọng số bộ định tuyến (router weight gradients) sử dụng phép tính theo phong cách SonicMoE được hợp nhất vào quá trình lan truyền ngược (backward) của SwiGLU.

Kết quả

Các bài kiểm tra lớp (layer benchmarks) được thực hiện trong một rack NVL72 đơn lẻ ở mức độ EP 64. Mỗi GPU giữ 2.048 token trước khi định tuyến. Các baseline bao gồm NCCL+PyTorch, DeepEP+PyTorch, DeepEP+TransformerEngine và HybridEP+Megatron. Các cấu hình bao gồm Kimi K2.7 Code, GLM-5.2, Qwen3.5-397B-A17B và DeepSeek-V4-Pro.

So với baseline nhanh nhất, MoK nhanh hơn tới 2,37 lần đối với quá trình lan truyền xuôi (forward) MXFP8. Các con số khác là 1,78 lần cho lan truyền ngược MXFP8, 1,92 lần cho lan truyền xuôi BF16 và 1,58 lần cho lan truyền ngược BF16. Kiểm thử tổng thể sử dụng 512 GPU trên nhiều rack GB300 NVL72. Số token mỗi giây trên mỗi GPU tăng từ 760,9 lên 1.070,2, đạt mức tăng 1,41 lần.

Những điểm chính cần lưu ý

Hãy xem GitHub Repo và các chi tiết kỹ thuật. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như đăng ký nhận Bản tin (Newsletter). Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Sản phẩm mới hoặc Webinar, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

CursorMoEHạ tầng AIHuấn luyện mô hìnhGPU
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.