Mô hình
Nvidia ra mắt Nemotron 3.5 Lightning: Ưu tiên tốc độ vượt trội cho AI
(giờ Việt Nam)
Tóm tắt AI
Nvidia giới thiệu Nemotron 3.5 Lightning, mô hình 316 tỷ tham số với cơ chế kích hoạt tinh gọn, đạt tốc độ suy luận ấn tượng 670 token/giây trong khi vẫn duy trì hiệu suất ngang ngửa các mô hình lớn.
Bản dịch AI
Nemotron 3.5 Lightning mới của Nvidia là một mô hình trọng số mở (open-weights) nhỏ gọn, đạt hiệu suất tương đương với gpt-oss-120b của OpenAI trên các bài kiểm tra trí tuệ với chỉ một phần tư số tham số, đồng thời mang lại tốc độ suy luận nhanh nhất trong cùng phân khúc.
Nvidia đã phát hành Nemotron 3.5 Lightning, mô hình đầu tiên trong dòng sản phẩm Nemotron 3.5 mới. Mô hình này là phiên bản kế nhiệm trực tiếp của Nemotron 3 Nano 30B A3B và vẫn duy trì kiến trúc lai Mamba-Transformer, với tổng cộng 31,6 tỷ tham số nhưng chỉ có 3,6 tỷ tham số hoạt động tại bất kỳ thời điểm nào.
Theo nền tảng đánh giá độc lập Artificial Analysis, mô hình đạt 24 điểm trên Intelligence Index, tăng 9 điểm so với phiên bản tiền nhiệm (15). Điều này đưa Lightning ngang hàng với gpt-oss-120b của OpenAI (24) và chỉ đứng sau Nemotron 3 Super của chính Nvidia (26), vốn có kích thước lớn gấp khoảng bốn lần. Các mô hình nhỏ thông minh nhất trong cùng phân khúc kích thước như Qwen3.6 35B A3B (32) và Muse Glimmer mới của Meta (35) vẫn giữ vị trí dẫn đầu rõ rệt.

Nvidia đang nhắm đến một vị trí khác trên ranh giới hiệu suất với Lightning. Trong các thử nghiệm tiền phát hành sử dụng trọng số NVFP4 cuối cùng, mô hình đạt gần 670 token mỗi giây, mức thông lượng cao nhất trong số tất cả các mô hình được so sánh và nhanh gần gấp đôi so với Gemini 3.5 Flash-Lite của Google (386 token/giây). Một tác vụ từ Intelligence Index mất khoảng 0,5 phút để hoàn thành, trong khi Qwen3.6 35B A3B cần khoảng 3,5 phút và Gemma 4 31B mất khoảng 5,8 phút.

Các mô hình độc quyền vẫn thống trị ranh giới hiệu suất tổng thể. Gemini 3.5 Flash-Lite đạt 37 điểm trên Intelligence Index với thời gian thực hiện mỗi tác vụ tương đương, và GPT-5.6 Luna (max) đạt 52 điểm trong chưa đầy hai phút.
Các bài kiểm tra về tác nhân (agentic benchmarks) cho thấy sự cải thiện lớn nhất
Theo Artificial Analysis, những cải tiến lớn nhất xuất hiện trong các bài kiểm tra về tác nhân. Trên GDPval-AA v2, Lightning đạt xếp hạng Elo là 824, tăng 334 điểm so với Nemotron 3 Nano. Kết quả này vượt qua cả gpt-oss-120b (800) và Nemotron 3 Super lớn hơn (698). Trên Terminal-Bench v2.1, điểm số tăng từ 7 lên 24,3%, gần như bắt kịp mức 26,2% của gpt-oss-120b.

Nvidia phát hành mô hình này theo giấy phép OpenMDW-1.1 cởi mở, định vị nó như một "cỗ máy" có thông lượng cao cho các quy trình làm việc dựa trên tác nhân. Artificial Analysis báo cáo rằng Nvidia đã hợp tác với các đối tác như CodeRabbit và Harvey trong giai đoạn hậu huấn luyện để tăng cường hiệu suất trong các lĩnh vực cụ thể.
Khả dụng
Nvidia cung cấp mô hình này ở cả hai định dạng trọng số BF16 và NVFP4. Theo Artificial Analysis, biến thể NVFP4 cũng đạt 24 điểm trên Intelligence Index với mức suy giảm chất lượng tối thiểu so với phiên bản có độ chính xác cao hơn. Mô hình suy luận này chỉ xử lý văn bản và hỗ trợ cửa sổ ngữ cảnh lên đến một triệu token. Các trọng số hiện đã có sẵn và dịch vụ suy luận không máy chủ (serverless inference) được cung cấp bởi DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius, Crusoe và nhiều đơn vị khác.
Việc Nvidia ưu tiên hiệu suất hơn kích thước không phải là điều mới mẻ. Trong một bài báo được thảo luận rộng rãi vào năm ngoái, các nhà nghiên cứu của hãng lập luận rằng các mô hình dưới 10 tỷ tham số có thể xử lý hầu hết khối lượng công việc của tác nhân tốt như các mô hình từ 70 đến 175 tỷ tham số với chi phí chỉ bằng một phần mười đến một phần ba mươi. Nemotron 3.5 Lightning có 31,6 tỷ tham số nhưng chỉ kích hoạt 3,6 tỷ mỗi bước, đưa nó vào cùng phân khúc nhẹ. Với tốc độ gần 670 token mỗi giây, nó cũng đánh bại gpt-oss-120b và Nemotron 3 Super lớn hơn trong các bài kiểm tra về tác nhân, khiến đây trở thành bằng chứng rõ ràng nhất cho luận điểm đó ở cấp độ sản phẩm cho đến nay.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về các công nghệ tiên phong sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.