MarkTechPost
88

Mô hình

Thinking Machines Lab ra mắt Inkling-Small: Mô hình đa phương thức MoE mã nguồn mở với 276 tỷ tham số

(giờ Việt Nam)

Tóm tắt AI

Thinking Machines Lab vừa phát hành Inkling-Small, mô hình MoE đa phương thức hỗ trợ văn bản, hình ảnh và âm thanh với 276 tỷ tham số (12 tỷ tham số kích hoạt). Mô hình có cửa sổ ngữ cảnh 1 triệu token và được cung cấp miễn phí theo giấy phép Apache 2.0.

Bản dịch AI

Thinking Machines Lab Releases Inkling-Small: A 276B Total, 12B Active Open Weights Multimodal MoE Model

Thinking Machines Lab vừa phát hành Inkling-Small, một mô hình Mixture-of-Experts (MoE) với trọng số mở, sở hữu tổng cộng 276 tỷ tham số, trong đó có 12 tỷ tham số hoạt động. Con số này chỉ bằng khoảng một phần tư kích thước của Inkling, vốn có 975 tỷ tham số tổng và 41 tỷ tham số hoạt động. Mô hình được huấn luyện trên các hệ thống NVIDIA GB300 NVL72. Nó có khả năng suy luận trực tiếp trên văn bản, hình ảnh và âm thanh. Cửa sổ ngữ cảnh đạt tới 1 triệu token và nỗ lực suy nghĩ (thinking effort) có thể điều chỉnh được. Trọng số được phát hành theo giấy phép Apache 2.0 trên Hugging Face.

Liệu mô hình có thể triển khai được không?

Có, và checkpoint được lượng tử hóa chính là lý do. Theo thẻ mô hình (model card), checkpoint BF16 cần ít nhất 600 GB VRAM tổng hợp. Yêu cầu này được đáp ứng bởi 4x NVIDIA B300 hoặc 8x NVIDIA H200. Checkpoint NVFP4 giảm mức yêu cầu đó xuống còn 180 GB. Nó chạy W4A4 trên một card B300 duy nhất (yêu cầu SM100+) hoặc W4A16 trên hai card H200. Các runtime được hỗ trợ bao gồm SGLang, vLLM, TokenSpeed, Unsloth và Hugging Face.

Khả năng chạy trên một GPU duy nhất giúp mô hình 276 tỷ tham số này thoát khỏi phạm vi chỉ dành cho các phòng thí nghiệm tiên phong. Các startup có thể tự lưu trữ (self-host) trên một instance B300 thuê ngoài. Các doanh nghiệp quy mô vừa đã có sẵn hạ tầng H200 có thể phục vụ mô hình mà không cần phần cứng mới. Các lĩnh vực được quản lý chặt chẽ như dịch vụ tài chính, vận hành y tế, bảo hiểm, viễn thông và khu vực công có thêm lựa chọn sử dụng trọng số riêng tư. Các khối lượng công việc áp dụng bao gồm tác nhân lập trình (coding agents), tự động hóa terminal, hiểu tài liệu và biểu đồ. Với âm thanh, phạm vi ứng dụng mở rộng sang phân tích trung tâm cuộc gọi, giao diện giọng nói và tóm tắt cuộc họp.

Kiến trúc

Inkling-Small là một transformer giải mã (decoder-only) 42 lớp với cấu trúc xương sống feed-forward MoE thưa. Mỗi token được điều hướng tới 6 trong số 256 chuyên gia (experts), cộng với 2 chuyên gia dùng chung hoạt động trên mọi token. Cơ chế chú ý (attention) là sự kết hợp giữa các lớp cục bộ và toàn cục. Mô hình không sử dụng bộ mã hóa (encoder-free) và là mô hình đa phương thức tự nhiên. Hình ảnh được chia thành các mảng 40×40 pixel và được biến đổi bằng hMLP bốn lớp. Âm thanh được biểu diễn dưới dạng phổ dMel. Cả hai đều đi qua một lớp nhúng (embedding layer) nhẹ và được xử lý cùng với các token văn bản. Khả năng hỗ trợ số học bao gồm BF16, MXFP8 và NVFP4. Đầu vào âm thanh là định dạng WAV ở tần số 16 kHz, lý tưởng nhất là dưới hai phút. Đầu ra chỉ là văn bản.

Inkling-Small bắt đầu huấn luyện sau phiên bản lớn hơn của nó. Điều này cho phép nhóm nghiên cứu sửa đổi hỗn hợp dữ liệu tiền huấn luyện và công thức học máy. Nhóm nghiên cứu đã hậu huấn luyện (post-train) một checkpoint sớm hơn, Inkling-Small (preview), một phần bằng cách sử dụng chưng cất on-policy với Inkling đóng vai trò là giáo viên. Từ checkpoint đó, mô hình tiếp tục mở rộng RL lập trình tác nhân (agentic coding RL) trong hai tuần.

Kết quả đánh giá (Benchmark)

Mô hình nhỏ hơn này vượt qua "giáo viên" của nó về khả năng suy luận và lập trình tác nhân. Trong bài kiểm tra Humanity’s Last Exam (chỉ văn bản), Inkling-Small đạt 31,6%, cao hơn mức 29,7% của Inkling. SWE-bench Verified đạt 80,2% so với 77,6% khi sử dụng harness chỉ dùng bash. Terminal-Bench 2.1 đạt 64,7% ở harness tốt nhất. Toolathlon Verified đạt 54,4% so với 45,5% của Inkling. GPQA Diamond đạt 89,5%, AIME 2026 đạt 95,5% và IFBench đạt 82,2%. ARC-AGI-2 tăng lên 40,1% từ mức 36,5% của Inkling.

SimpleQA Verified giảm xuống 20,6% từ mức 43,9% của Inkling, và chỉ số AA Omniscience giảm xuống -9,0 từ 2,1. Tau 3 Banking đạt 15,5% so với 23,7% của Inkling. Tất cả các đánh giá được thực hiện ở mức nỗ lực 0,99 và nhiệt độ 1,0, với giới hạn quỹ đạo tối đa 256K token trên các bài đánh giá lập trình. Các điểm số bên ngoài được lấy từ Artificial Analysis, Scale AI và ARC Prize.

Đa phương thức, nhận thức luận và an toàn

Điểm số đa phương thức duy trì gần với Inkling ở chi phí thấp hơn. MMMU Pro đạt 74,0%. CharXiv RQ đạt 77,4%, tăng lên 81,3% khi mô hình sử dụng Python để cắt, phóng to và kiểm tra biểu đồ theo lập trình. Audio MC đạt 54,9%, MMAU đạt 77,0% và VoiceBench đạt 90,1%.

Về nhận thức luận, việc hiệu chuẩn được huấn luyện bằng RL dựa trên các quy tắc chấm điểm phù hợp trên một tập dữ liệu lớn các câu hỏi dự báo thực tế. ForecastBench không cần tìm kiếm cho ra chỉ số Brier là 61,3 ± 0,46, vượt qua mức 60,1 ± 0,54 của Inkling. Về an toàn, StrongREJECT đạt 98,4%, FORTRESS adversarial đạt 71,6% và FORTRESS benign đạt 96,9%. Thinking Machines Lab kết luận rằng mô hình không mang lại sự cải thiện đáng kể nào ngoài hệ sinh thái trọng số mở hiện có. Họ khuyến nghị áp dụng các lớp kiểm duyệt hạ nguồn như Llama Guard trên các triển khai hướng tới người dùng cuối.

Cả hai mô hình đều có sẵn trên Tinker với ưu đãi giảm giá trong thời gian giới hạn. Trò chuyện văn bản, hình ảnh và âm thanh chạy trên Tinker Playground.

Công cụ giải thích tương tác

Phần nhúng bên dưới chia bản phát hành thành bốn phần tương tác. Tab một mô phỏng cách định tuyến thưa kích hoạt 8 trong số 258 chuyên gia mỗi lớp. Tab hai xếp hạng Inkling-Small so với các mô hình trọng số mở tương đương trên mười bài đánh giá. Tab ba theo dõi cách ba phương thức đầu vào hội tụ thành một bộ giải mã. Tab bốn định cỡ phần cứng mà mỗi định dạng checkpoint yêu cầu.

Những điểm chính cần lưu ý

Hãy xem chi tiết kỹ thuật và trọng số mô hình. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

MoEMô hình đa phương thứcAI mã nguồn mởInkling-SmallThinking Machines
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.