MarkTechPost
92

Mô hình

NVIDIA ra mắt Nemotron 3.5 Lightning: Mô hình mã nguồn mở 30B kết hợp kiến trúc MoE và Mamba-2

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu Nemotron 3.5 Lightning, mô hình mã nguồn mở 30B với 3B tham số hoạt động, hỗ trợ cửa sổ ngữ cảnh 1 triệu token và cho phép sử dụng thương mại.

Bản dịch AI

NVIDIA AI Releases Nemotron 3.5 Lightning: A 30B Open MoE with 3B Active Parameters, and NeMo Switchyard Model Router

NVIDIA đã giới thiệu các công nghệ mở để xây dựng các AI agent hoạt động liên tục từ các hệ thống mô hình chuyên biệt. Hai sản phẩm đã được ra mắt cùng nhau. Nemotron 3.5 Lightning là một mô hình mở nhẹ, có khả năng tùy biến, được xây dựng cho các tác vụ agentic khối lượng lớn, và NeMo Switchyard là một thư viện định tuyến mã nguồn mở giúp điều hướng từng bước trong quy trình làm việc của agent đến mô hình có năng lực và hiệu quả nhất hiện có. Vấn đề mà cả hai giải quyết mang tính cấu trúc: các agent hoạt động lâu dài dành phần lớn thời gian cho việc gọi công cụ, xác thực kết quả và ủy quyền cho các subagent, và việc gửi tất cả các bước đó đến một mô hình suy luận tiên tiến (frontier reasoning model) sẽ làm tăng chi phí và độ trễ. Lightning là mô hình mixture-of-experts 30B với 3B tham số hoạt động, được xây dựng trên kiến trúc lai Mamba-2 + MoE + Attention với cửa sổ ngữ cảnh 1 triệu token. NVIDIA báo cáo tốc độ đầu ra nhanh hơn tới 4 lần so với các mô hình có kích thước tương tự và hoàn thành 10.000 tác vụ PinchBench nhanh hơn 30% so với Qwen3.6 35B ở mức độ chính xác tương đương. Nhiều đơn vị trong ngành như CrowdStrike, Harvey, CodeRabbit, Fastino Labs và Lila Sciences đã và đang tùy biến mô hình này cho các khối lượng công việc về an ninh mạng, pháp lý, lập trình, tài chính và chăm sóc sức khỏe.

Có thể triển khai được không?

Có. Nemotron 3.5 Lightning hiện đã khả dụng rộng rãi theo giấy phép OpenMDW-1.1 cởi mở, với trọng số, dữ liệu huấn luyện và công thức (recipes) mở. NVIDIA khẳng định mô hình này đã sẵn sàng cho mục đích thương mại.

Lớp thực thi, không phải lớp lập kế hoạch

Các agent hoạt động lâu dài dành phần lớn thời gian cho việc thực thi khối lượng lớn. Các lệnh gọi công cụ, xác thực kết quả và ủy quyền subagent chiếm phần lớn ngân sách token. Việc định tuyến từng bước đó đến một mô hình suy luận tiên tiến sẽ làm tăng chi phí và độ trễ.

Nemotron 3.5 Lightning nhắm đến lớp thực thi đó. Đây là mô hình mixture-of-experts 30B với 3B tham số hoạt động, được xây dựng trên kiến trúc lai Mamba-2 + MoE + Attention. Độ dài ngữ cảnh đạt 1 triệu token. Quá trình tiền huấn luyện đã bao phủ hơn 20 nghìn tỷ token sử dụng công thức NVFP4.

Đây là thành viên nhỏ nhất trong dòng Nemotron 3. Các mô hình tiên tiến như Nemotron 3 Ultra đảm nhận việc điều phối và lập kế hoạch, trong khi Lightning xử lý các lệnh gọi định kỳ bên dưới chúng.

Tốc độ đến từ đâu

Hai cơ chế:

NVIDIA báo cáo tốc độ đầu ra nhanh hơn tới 4 lần so với các mô hình có kích thước tương tự. Trên PinchBench, mô hình đạt độ chính xác 86% trong khi hoàn thành 10.000 tác vụ nhanh hơn 30% so với Qwen3.6 35B ở mức độ chính xác tương đương.

Kết quả từ thẻ mô hình (model card) đã công bố (BF16 / NVFP4): MMLU Pro 81.94 / 81.62, GPQA Diamond 75.44 / 75.57, SWE-bench Verified 51.56 / 52.80, Terminal-Bench 2.1 24.58 / 23.46, AA-LCR 52.00 / 49.19. Cấu hình lấy mẫu (sampling) được khuyến nghị là temperature 1.0 và top_p 0.95.

NeMo Switchyard là một thư viện mã nguồn mở giúp định tuyến từng bước trong quy trình làm việc của agent đến mô hình có năng lực và hiệu quả nhất hiện có.

Thư viện này cung cấp các bộ định tuyến không cần tinh chỉnh (tuning-free), bao gồm bộ phân loại LLM với tính năng session affinity, bộ định tuyến theo giai đoạn (stage router) đọc hoạt động công cụ gần đây và bộ định tuyến leo thang (escalation router) bắt đầu với chi phí thấp và nâng cấp khi độ khó duy trì. Một bộ định tuyến tiền nạp (prefill router) có thể điều chỉnh sẽ học từ luồng dư (residual stream) của mô hình để dự đoán ứng viên nào sẽ thành công. Máy chủ tham chiếu chấp nhận các yêu cầu API từ OpenAI, Anthropic và Responses.

Hai kết quả đã công bố: LangChain đã đo kiểm 145 tác vụ agentic đa lượt. Việc định tuyến giữa Lightning và Claude Opus 4.8 với bộ định tuyến leo thang đã cắt giảm 74% chi phí so với đường cơ sở chỉ dùng mô hình tiên tiến, gửi 7% lệnh gọi đến mô hình tiên tiến, với mức đánh đổi độ chính xác khoảng 6 điểm. Cognition đã triển khai định tuyến theo giai đoạn trong Devin Desktop. Trên FrontierCode Main, việc định tuyến giữa Opus 5 và Kimi K2.7 đạt 50,6% với chi phí trung bình là 3,11 USD, nằm trong khoảng 2,8 điểm so với độ chính xác của Opus 5 với chi phí trung bình thấp hơn khoảng 28%.

Công cụ giải thích tương tác

Những điểm chính cần lưu ý

Hãy thử nghiệm trên build.nvidia.com hoặc OpenRouter, và tải xuống trọng số từ Hugging Face hoặc ModelScope. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Product Release hoặc Webinar, v.v. của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với người xem.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.