Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
95

Thủ thuật

Moonshot AI ra mắt Kimi K3: Mô hình mã nguồn mở 2.8 nghìn tỷ tham số với kiến trúc đột phá

(giờ Việt Nam)

Tóm tắt AI

Moonshot AI vừa công bố Kimi K3, mô hình mã nguồn mở lớn nhất hiện nay với 2.8 nghìn tỷ tham số, sử dụng kiến trúc NoPE thay thế RoPE và bổ sung thành phần LatentMoE để tối ưu hóa hiệu suất.

Bản dịch AI

Kimi K3 Architecture Notes

Hình ảnh kiến trúc Kimi K3 cho đợt phát hành mô hình mã nguồn mở lớn ngày hôm qua, cùng với một vài quan sát và suy nghĩ.

Vâng, trông nó có vẻ khá phức tạp, nhưng về cơ bản đây là phiên bản sản xuất đã được mở rộng từ mô hình Kimi Linear mà họ đã phát hành năm ngoái (quy mô tăng từ 48B lên 2.8T; K3 hiện là mô hình mã nguồn mở lớn nhất tính đến thời điểm này).

Thành phần mới duy nhất so với Kimi Linear là LatentMoE. Tôi đã lược bỏ nó trong hình bên dưới vì sơ đồ đã quá dày đặc, nhưng về cơ bản đó chính là LatentMoE giống như trong Nemotron 3 Ultra (bạn có thể tìm thấy nó trong LLM Architecture Gallery của tôi nếu thấy tò mò). Ý tưởng ở đây là nén (down-project) các lớp tuyến tính lớn tương tự như multi-head latent attention.

Xu hướng chung của Kimi K3 (tương tự như Nemotron 3, DeepSeek V4 và các mô hình khác) cũng là hướng tới hiệu quả suy luận tốt hơn. Nghĩa là, có nhiều thành phần thay thế các thành phần hiện có bằng các phiên bản đã được tinh chỉnh về hiệu suất. Ví dụ: MoE chuyển thành LatentMoE, attention thông thường chuyển thành multi-head latent attention và Kimi Delta Attention. (Tôi cũng có các bài hướng dẫn ngắn và bài viết trong thư viện của mình nếu bạn muốn biết thêm chi tiết).

Thay đổi thành phần duy nhất không phải là tinh chỉnh hiệu suất chính là attention residuals. Giống như cách DeepSeek V4 cải thiện đường dẫn residual bằng mHC (manifold-constrained Hyper-Connections), attention residuals là một cách để cải thiện đường dẫn residual, nhưng hoạt động theo cách hơi khác. Cụ thể, mHC làm cho đường dẫn residual rộng hơn. Attention residuals (cũng đã có trong Kimi Linear) kết nối các residual giữa các lớp; bản thân kết nối này sử dụng điểm số attention cho một trọng số quan trọng/đóng góp. Theo báo cáo, nó cải thiện validation loss và hiệu suất hạ nguồn (một chút) một cách nhất quán, đồng thời làm tăng khoảng 4% chi phí huấn luyện và 2% chi phí suy luận.

Thú vị là Kimi K3 đã loại bỏ tất cả các lớp RoPE và thay vào đó sử dụng NoPE (No Positional Embeddings) ở mọi nơi. (Một lần nữa, điều này được kế thừa từ Kimi Linear). Trong các kiến trúc khác, xu hướng gần đây là sử dụng RoPE trong các lớp attention cục bộ (như sliding window attention) và NoPE trong các lớp toàn cục. Đã có một vài kiến trúc chỉ sử dụng NoPE ở mọi nơi, nhưng theo tôi biết thì đây là kiến trúc cấp độ tiên phong (frontier-level) đầu tiên làm điều này.

Kimi K3 hiện cũng đã hỗ trợ đa phương thức (multimodal) nguyên bản, thật tuyệt vời!

Có một vài thông tin thú vị khác về quá trình huấn luyện trong báo cáo kỹ thuật, nhưng đó là tất cả những gì về mặt kiến trúc cho đến nay. Nhìn chung đây là một bản phát hành thực sự tuyệt vời.

Nguồn: phiên bản website từ ghi chú Substack của tôi.

Đọc tiếp

Một vài mô hình mã nguồn mở đáng chú ý trong tuần này: Ghi chú ngắn về kiến trúc của sáu mô hình mã nguồn mở mới, bao gồm Nanbeige 4.2, Laguna S 2.1, Motif-3-Beta, Solar Open 2, Antares 1B và BTL-3. Đính chính cho Listing 6.5 trong "Build a Reasoning Model From Scratch": Ghi chú đính chính ngắn về random seed trong Listing 6.5 ở trang 198 của cuốn "Build a Reasoning Model From Scratch". Inkling: Một mô hình MoE 975B mã nguồn mở mới với vài bất ngờ: Ghi chú ngắn về mô hình Inkling 975B của Thinking Machines Lab, bao gồm các bài kiểm chuẩn (benchmarks), thiết kế sparse MoE, tích chập ngắn (short convolutions), RMSNorm và position bias.

Kimi K3Mô hình ngôn ngữMã nguồn mởMoonshot AIAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.