Mô hình
AMD ra mắt dòng mô hình mã nguồn mở Instella-MoE, huấn luyện hoàn toàn trên GPU nhà
(giờ Việt Nam)
Tóm tắt AI
AMD giới thiệu dòng mô hình Instella-MoE (16B tham số) được huấn luyện từ đầu bằng GPU Instinct và phần mềm ROCm, giúp tăng tốc độ huấn luyện 12,7% và giảm 39,2% thời gian phản hồi token đầu tiên.
Bản dịch AI
Theo tin từ IT ngày 28 tháng 7, AMD đã đăng tải một bài viết vào ngày 24 tháng 7 công bố ra mắt dòng mô hình Instella-MoE, với tổng số tham số là 16B, tham số kích hoạt là 2.8B, sử dụng kiến trúc decoder 27 lớp và được phát triển bằng GPU cùng phần mềm do chính AMD nghiên cứu.
Dẫn nguồn từ bài viết, IT giới thiệu rằng dòng mô hình Instella-MoE mà AMD ra mắt lần này bao gồm 6 phiên bản:
Mô hình
Giai đoạn
Mô tả
Instella-MoE-16B-A3B-Pretrain
Tiền huấn luyện (Pretrain)
Mô hình nền tảng MoE được huấn luyện từ đầu dựa trên kho dữ liệu huấn luyện đa dạng và quy mô lớn.
Instella-MoE-16B-A3B-Midtrain
Huấn luyện trung gian (Mid-training)
Mô hình tiền huấn luyện được đào tạo thêm trên dữ liệu hỗn hợp chất lượng cao nhằm hoàn thiện các năng lực then chốt.
Instella-MoE-16B-A3B-Base
Ngữ cảnh dài (Long-context)
Huấn luyện ngữ cảnh dài nhằm nâng cao khả năng xử lý và suy luận các chuỗi dữ liệu dài hơn của mô hình. Chúng tôi sử dụng đây làm checkpoint nền tảng cuối cùng.
Instella-MoE-16B-A3B-SFT
SFT
Mở rộng checkpoint nền tảng thông qua tinh chỉnh có giám sát (SFT) để đạt được khả năng tuân thủ chỉ dẫn và suy luận theo chuỗi.
Instella-MoE-16B-A3B-DPO
DPO
Tối ưu hóa ưu tiên trực tiếp (DPO) dựa trên dữ liệu ưu tiên đối chiếu để cải thiện hiệu suất mô hình.
Instella-MoE-16B-A3B-Think
RL
Cải tiến checkpoint tư duy cuối cùng thông qua học tăng cường (RL) để tăng cường hơn nữa khả năng tuân thủ chỉ dẫn và chất lượng phản hồi tổng thể.
Về hiệu suất, hình dưới đây so sánh mô hình Instella-MoE-16B-A3B-Base với các mô hình khác, trong đó trục hoành đại diện cho số tham số hoạt động và trục tung đại diện cho các bài kiểm tra điểm chuẩn. Có thể thấy điểm số của mô hình này thấp hơn Qwen3.5-4B-Base, nhưng cao hơn các mô hình khác.

Dưới đây là so sánh hiệu suất giữa Instella-MoE-16B-A3B-Think với các sản phẩm cùng loại. So với Gemma-4-E4B-it, nó đạt được điểm số cao hơn trong khi sử dụng ít tham số kích hoạt hơn.

Instella-MoE là mô hình ngôn ngữ hỗn hợp chuyên gia (MoE) mã nguồn mở tiên tiến nhất do AMD phát triển, được huấn luyện từ đầu trên các GPU AMD Instinct™ MI300X và MI325X.
Quá trình huấn luyện mô hình hoàn toàn dựa trên ngăn xếp phần mềm AMD ROCm™, sử dụng các khung huấn luyện Primus và RL Miles làm nền tảng, đồng thời tích hợp các kiến trúc và đổi mới hệ thống tiên tiến bao gồm Gated MLA (Gated Multi-Head Latent Attention), giúp thực hiện huấn luyện và suy luận quy mô lớn một cách hiệu quả trên phần cứng AMD.
Trong giai đoạn tiền huấn luyện, FarSkip-Collective đã giúp tăng tốc độ tiền huấn luyện mô hình lên 12,7% thông qua việc chồng lấp giao tiếp nhờ song song hóa chuyên gia (expert parallelism).


Trong giai đoạn suy luận, chúng tôi đã triển khai Instella-MoE bằng khung suy luận SGLang. Bằng cách chồng lấp giao tiếp với tính toán, việc triển khai này có thể rút ngắn thời gian phản hồi Token đầu tiên (TTFT) lên tới 39,2% khi mô hình sử dụng dịch vụ song song hóa chuyên gia.


Tuyên bố quảng cáo: Các liên kết ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin và tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo. Tất cả các bài viết của IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.