NVIDIA Blog
92

Mô hình

NVIDIA ra mắt Nemotron 3.5 Lightning và NeMo Switchyard: Đột phá tốc độ cho AI Agent

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu mô hình 30 tỷ tham số Nemotron 3.5 Lightning giúp tăng tốc độ xử lý gấp 4 lần cho AI Agent, cùng thư viện NeMo Switchyard giúp tối ưu chi phí vận hành và hỗ trợ triển khai linh hoạt từ PC đến máy chủ chuyên dụng.

Bản dịch AI

NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI

Khi AI chuyển dịch từ chatbot sang các tác nhân tự hành (autonomous agents), các mô hình mã nguồn mở đang đáp ứng nhu cầu thị trường về việc kiểm soát toàn diện nơi AI vận hành cũng như cách thức nó được triển khai và phát triển.

Hôm nay, NVIDIA mở rộng dòng mô hình Nemotron 3 với Nemotron 3.5 Lightning, mô hình có hiệu suất cao nhất trong phân khúc dành cho các khối lượng công việc AI tác nhân (agentic AI) chạy liên tục. Bản phát hành này tiếp nối Nemotron 3 Nano và phản ánh cam kết của NVIDIA trong việc liên tục cải tiến các mô hình mở để đạt độ chính xác và tốc độ cao hơn.

Được xây dựng cho các tác vụ chuyên biệt trong các hệ thống đa tác nhân (multi-agent systems) lớn hơn, Nemotron 3.5 Lightning là một mô hình hỗn hợp chuyên gia (mixture-of-experts) với 30 tỷ tham số, giúp tạo ra các ứng dụng tác nhân thông minh và hiệu quả hơn.

Ngoài ra, NVIDIA còn phát hành NeMo Switchyard, một thư viện mã nguồn mở dành cho việc định tuyến thông minh bên trong các công cụ tác nhân phổ biến. Các doanh nghiệp có thể sử dụng thư viện này để xây dựng bộ định tuyến dựa trên nhu cầu cụ thể của mình. Khi được triển khai, NeMo Switchyard có thể điều hướng thông minh từng yêu cầu đến mô hình phù hợp và có năng lực nhất cho công việc đó mà không yêu cầu các nhà phát triển phải viết lại ứng dụng của họ.

Kết hợp lại, Nemotron 3.5 Lightning và NeMo Switchyard mang đến khả năng kiểm soát tốt hơn về cách thức triển khai AI, nơi nó vận hành và hiệu quả hoạt động — trên PC, máy trạm, trung tâm dữ liệu và đám mây.

Các tác nhân luôn hoạt động (Always-On Agents) cần một hệ thống các mô hình

Các hệ thống tác nhân hiện đại — các tác nhân luôn hoạt động — ngày càng vận hành như những hệ thống mô hình, hay các tập hợp mô hình (model ensembles), với các mô hình khác nhau được chuyên biệt hóa cho những tác vụ khác nhau.

Các mô hình mở NVIDIA Nemotron được thiết kế cho kiến trúc này. Một mô hình suy luận tiên phong như Nemotron 3 Ultra hoặc GPT-5.6 có thể lập kế hoạch và điều phối quy trình làm việc, trong khi các mô hình chuyên biệt nhỏ hơn như Nemotron 3.5 Lightning có thể thực hiện các tác vụ mục tiêu như kiểm tra mã nguồn, sử dụng công cụ, giám sát cảnh báo bảo mật và trả lời các câu hỏi về thanh toán.

Thúc đẩy các tác vụ chuyên biệt khối lượng lớn với Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning là một mô hình mở có khả năng tùy chỉnh hoàn toàn, được xây dựng cho các tác vụ khối lượng lớn nhằm vận hành các tác nhân luôn hoạt động. Nó được phát triển với sự đóng góp từ Nemotron Coalition, nơi các thành viên cung cấp phương pháp đánh giá, phần mềm suy luận và các bộ dữ liệu để giúp thúc đẩy mô hình tiến xa hơn.

Mô hình mang lại tốc độ đầu ra nhanh hơn tới 4 lần, giúp hoàn thành tác vụ tác nhân nhanh hơn 30% so với các mô hình khác trong cùng phân khúc. Và vì là mô hình mở và có thể tùy chỉnh, Nemotron 3.5 Lightning có thể dễ dàng được huấn luyện bổ sung (post-trained) bằng NVIDIA NeMo trên chính dữ liệu miền, công cụ và quy trình làm việc của tổ chức để cải thiện độ chính xác cho các tác vụ chuyên biệt.

Các nhà lãnh đạo AI trong nhiều ngành công nghiệp đang tùy chỉnh Nemotron 3.5 Lightning cho khối lượng công việc của họ, bao gồm CrowdStrike cho an ninh mạng, Harvey với Trajectory cho các dịch vụ pháp lý và CodeRabbit với Baseten cho việc kiểm tra mã nguồn, giúp cải thiện độ chính xác cho các tác vụ tác nhân đặc thù theo lĩnh vực. Ngoài ra, Lila Sciences đang giúp cải thiện khả năng suy luận cho các tác vụ tác nhân trong lĩnh vực khoa học vật lý và khoa học sự sống, còn Fastino Labs đã tùy chỉnh mô hình và đang đạt được độ chính xác hàng đầu cho các khối lượng công việc về phát triển phần mềm, tài chính và chăm sóc sức khỏe.

Nemotron 3.5 Lightning cũng mang lại cho các tổ chức quyền kiểm soát về quyền riêng tư và triển khai. Nó có thể chạy trên các hệ thống AI cục bộ — bao gồm NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station và NVIDIA Jetson — để giúp người dùng tối đa hóa các khoản đầu tư vào cơ sở hạ tầng hiện có, hoặc mở rộng trên các thiết bị AI biên, máy trạm NVIDIA RTX PRO, trung tâm dữ liệu và môi trường đám mây cho các trường hợp sử dụng của doanh nghiệp. Nemotron 3.5 Lightning cũng có thể chạy cục bộ hoặc tại chỗ (on-premises) cho các tác vụ chuyên biệt, khối lượng lớn đòi hỏi phản hồi nhanh.

Ngoài ra, như với mọi đợt ra mắt Nemotron, NVIDIA công bố càng nhiều dữ liệu huấn luyện và kỹ thuật càng tốt trong phạm vi cấp phép cho phép, điều này cho phép khả năng truy xuất nguồn gốc, kiểm toán và huấn luyện các mô hình khác. Cùng với Lightning, NVIDIA phát hành Nemotron-RL-Agentic-Terminal-Pivot, một bộ dữ liệu học tăng cường tác nhân (agentic reinforcement learning dataset) được sử dụng để huấn luyện bổ sung cho các khả năng tác nhân lập trình.

Các ứng dụng AI hiệu quả hơn với định tuyến mô hình

Một số mô hình tốt hơn cho việc lập trình, một số cho suy luận, một số cho các tác vụ nhẹ và một số được tối ưu hóa để chạy cục bộ nhằm tăng cường quyền riêng tư và hiệu quả. Nếu khách hàng chỉ dựa vào một mô hình mặc định, họ có thể chi tiêu quá mức hoặc giảm chất lượng; nếu họ quản lý việc định tuyến thủ công, đó sẽ trở thành công việc tích hợp có thể làm chậm quá trình triển khai.

NVIDIA NeMo Switchyard là một thư viện định tuyến mô hình mã nguồn mở dành cho các tác nhân AI. Công nghệ này tự động điều hướng các câu lệnh (prompts) đến mô hình có năng lực và hiệu quả nhất cho từng bước của quy trình tác nhân, dựa trên các nhu cầu cụ thể. Các nhà phát triển ứng dụng tác nhân có thể tinh chỉnh hoặc sửa đổi bộ định tuyến với các thuật toán định tuyến khác nhau để phù hợp với các ưu tiên của họ, chẳng hạn như yêu cầu về chất lượng, độ trễ và chi phí. Trong một hệ thống các mô hình, các doanh nghiệp có thể tạo ra các tác nhân AI mạnh mẽ với kinh tế học token (tokenomics) được cải thiện.

Các điểm chuẩn nội bộ cho thấy NeMo Switchyard duy trì độ chính xác ở cấp độ tiên phong trong khi giảm chi phí hoàn thành tác vụ xuống gần bằng một phần ba so với việc chỉ sử dụng Opus 4.8.

NVIDIA đang làm việc với các đối tác trong hệ sinh thái AI để đưa việc định tuyến mô hình thông minh vào các công cụ và nền tảng mà các nhà phát triển đang sử dụng.

Nemotron 3.5 Lightning hiện đã có sẵn trên Hugging Face, ModelScope, OpenRouter và build.nvidia.com dưới dạng dịch vụ vi mô (microservice) NVIDIA NIM, cũng như thông qua hệ sinh thái rộng lớn gồm các Đối tác Đám mây NVIDIA, các nền tảng huấn luyện bổ sung, nền tảng suy luận và các nhà cung cấp dịch vụ đám mây. NeMo Switchyard hiện có sẵn trên GitHub và sẽ sớm có mặt trên các nền tảng đối tác.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.