MarkTechPost
88

Mô hình

AMD ra mắt Instella-MoE-16B-A3B: Mô hình ngôn ngữ lớn mã nguồn mở huấn luyện trên GPU Instinct

(giờ Việt Nam)

Tóm tắt AI

AMD vừa trình làng Instella-MoE-16B-A3B, mô hình MoE mã nguồn mở với 16 tỷ tham số, chỉ kích hoạt 2,8 tỷ tham số mỗi token. Mô hình được huấn luyện từ đầu trên hệ thống GPU Instinct MI300X và MI325X mạnh mẽ.

Bản dịch AI

AMD Releases Instella-MoE-16B-A3B: A Fully Open Mixture-of-Experts LLM With 2.8B Active Parameters Trained On Instinct GPUs

AMD đã phát hành Instella-MoE-16B-A3B, một mô hình ngôn ngữ Mixture-of-Experts (MoE) hoàn toàn mở, được huấn luyện từ đầu trên các GPU Instinct MI300X và MI325X. Mô hình này có tổng cộng 16 tỷ tham số nhưng chỉ kích hoạt 2,8 tỷ tham số cho mỗi token. AMD đang công bố trọng số từ mọi giai đoạn huấn luyện, cùng với các tập dữ liệu hỗn hợp, cấu hình huấn luyện và mã nguồn suy luận. Hai lựa chọn ở cấp độ hệ thống tạo nên sự khác biệt cho bản phát hành này: Gated Multi-head Latent Attention và kết nối FarSkip-Collective.

Liệu mô hình này có thể triển khai được không?

Một phần. Các trọng số được phát hành theo giấy phép ResearchRAIL chỉ dành cho mục đích học thuật và nghiên cứu, vì vậy đây không phải là một mô hình thương mại có thể sử dụng ngay. Cơ sở mã huấn luyện được cấp phép theo MIT, và đó là tài sản có khả năng tái sử dụng cao hơn ở đây.

Kiến trúc

Instella-MoE là một mô hình MoE chỉ có bộ giải mã (decoder-only) với 27 lớp, kích thước ẩn 2048, 16 đầu chú ý (attention heads) và từ điển 128.896 token. Mỗi lớp MoE sử dụng 2 chuyên gia dùng chung cộng với 6 chuyên gia được định tuyến từ tổng số 64 chuyên gia. Điều này mang lại 2,8 tỷ tham số hoạt động trên tổng số 16 tỷ. Mục tiêu Dự đoán Đa Token (Multi-Token Prediction) được sử dụng trong quá trình tiền huấn luyện và huấn luyện trung gian.

Có hai lựa chọn cấu trúc quan trọng cần lưu ý. Gated MLA bổ sung một cổng đầu ra được học có trọng lượng nhẹ vào Multi-head Latent Attention. Một phép chiếu tuyến tính chuyên dụng tạo ra một cổng có điều kiện đầu vào, được áp dụng theo kiểu nhân trước khi thực hiện phép chiếu đầu ra. FarSkip-Collective truyền các kích hoạt lỗi thời và một phần vào các lớp MoE và lớp chú ý, chồng lấp việc giao tiếp song song giữa các chuyên gia với quá trình tính toán. AMD báo cáo tốc độ tiền huấn luyện tăng 12,7% và giảm tới 39,2% thời gian để tạo token đầu tiên khi phục vụ với cơ chế song song hóa chuyên gia.

Quy trình huấn luyện

Tiền huấn luyện bao gồm 7,1 nghìn tỷ token từ các tập dữ liệu mở bao gồm Nemotron-CC-v2, MegaMath, FineMath, RefineCode và TxT360. Huấn luyện trung gian sử dụng Dolma3 Dolmino 100B trên ba biến thể dữ liệu, được hợp nhất bằng cách lấy trung bình trọng số. Một giai đoạn ngữ cảnh dài mở rộng cửa sổ từ 4K lên 64K bằng cách sử dụng YaRN, tăng RoPE theta và kỹ thuật che giấu tài liệu (document masking).

Hậu huấn luyện thực hiện SFT trên Dolci-Think-SFT-7B cộng với các hỗn hợp Nemotron, kết thúc bằng một tập hợp 512 nghìn ví dụ dựa trên phản hồi nhắm vào các điểm yếu đã đo lường. Tiếp theo là DPO, với các cập nhật độ lệch bộ định tuyến (router bias) và tắt hàm mất mát cân bằng tải phụ trợ để tránh suy giảm hiệu suất. RL chạy trong khung Miles: 1.400 bước RLVR tuân thủ chỉ dẫn, sau đó là Multi-Teacher On-Policy Distillation để tích hợp lợi ích đó mà không làm mất khả năng toán học hoặc lập trình.

Kết quả

Điểm kiểm tra cơ sở đạt trung bình 76,7, mạnh nhất trong số các mô hình hoàn toàn mở, vượt trên Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) và OLMoE-1B-7B (61,9). Nó đứng sau Qwen3.5-4B-Base (79,5). Nó dẫn đầu về WinoGrande (86,5) và đạt 65,7 điểm trên HumanEval+. Điểm trung bình ngữ cảnh dài là 41,5 trên HELMET và 79,4 trên RULER.

Hậu huấn luyện tăng từ SFT (71,58) lên DPO (72,67) và Think (73,22), cao hơn Olmo3-7B-Think (71,97), Gemma-4-E4B think (70,47) và Qwen3.5-4B (69,73). IFEval tăng từ 77,08 lên 83,70.

Trình giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem blog ROCm, bộ sưu tập Hugging Face và GitHub. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến, v.v. của bạn? Hãy kết nối với chúng tôi.

Nguồn: Blog ROCm · Bộ sưu tập Hugging Face · GitHub

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

AMDMoEMã nguồn mởLLMInstinct
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.