NVIDIA Blog
92

Mô hình

NVIDIA ra mắt Nemotron 3.5 Lightning: Tăng tốc độ xử lý cho AI Agent cục bộ

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu mô hình mã nguồn mở Nemotron 3.5 Lightning (30B MoE) tối ưu cho AI Agent, giúp tăng tốc độ tạo token gấp 4 lần và giảm 30% thời gian hoàn thành tác vụ trên các thiết bị từ PC đến Jetson.

Bản dịch AI

NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents

Hệ sinh thái mã nguồn mở đang giúp những người đam mê AI và các nhà phát triển xây dựng, tùy chỉnh và vận hành các tác nhân (agents) ngày càng mạnh mẽ ngay trên thiết bị cục bộ một cách dễ dàng hơn.

Trong suốt tháng 8, NVIDIA sẽ tôn vinh các đối tác và cộng đồng mã nguồn mở đang thúc đẩy AI cục bộ phát triển, cùng với đó là các mô hình, ứng dụng và công cụ mới nổi trong hệ sinh thái. Điều này bao gồm các mô hình mở, phần mềm và công cụ dành cho nhà phát triển mới nhất của NVIDIA, cùng với điện toán tăng tốc, các thư viện và tài nguyên giáo dục giúp người dùng bắt đầu.

Đây hứa hẹn sẽ là một tháng quan trọng đối với các tác nhân (agents). Hãy theo dõi các bước phát triển mới nhất trong loạt bài blog đặc biệt về NVIDIA Local AI, với các bản cập nhật mới được bổ sung trong những tuần tới.

Hãy theo dõi NVIDIA RTX Spark trên X, Instagram, TikTok và Facebook — và cập nhật thông tin bằng cách đăng ký nhận bản tin RTX AI PC. Theo dõi NVIDIA Workstation trên LinkedIn và X.

Thứ Ba, ngày 11 tháng 8, 6:00 sáng giờ PT 🔗

NVIDIA giới thiệu Nemotron 3.5 Lightning cho các tác vụ tác nhân (agentic tasks) nhanh và chuyên biệt

Hôm nay, NVIDIA đã mở rộng dòng mô hình Nemotron 3 của mình với Nemotron 3.5 Lightning, một mô hình mixture-of-experts (MoE) 30B mã nguồn mở có thể tùy chỉnh dành cho các tác nhân luôn hoạt động.

Nemotron 3.5 Lightning mang lại tốc độ tạo token nhanh hơn tới 4 lần và thời gian hoàn thành tác vụ nhanh hơn 30% so với các mô hình mở cùng phân khúc.

Và vì Nemotron 3.5 Lightning là mô hình mở trọng số (open weights), những người đam mê AI và các nhà phát triển có thể tinh chỉnh (fine-tune) nó bằng các ví dụ của riêng mình để phù hợp hơn với các tác vụ, sở thích và quy trình làm việc cụ thể. Ví dụ, họ có thể huấn luyện mô hình để:

Khi kết hợp với quyền truy cập vào các ứng dụng, tệp tin và các công cụ khác, những mô hình đã tinh chỉnh này có thể cung cấp trải nghiệm AI tác nhân cục bộ được cá nhân hóa hơn — từ một trợ lý giúp quản lý email và lịch, đến một tác nhân nhà thông minh xử lý các công việc hàng ngày, hay một người bạn đồng hành lập trình làm việc cùng các nhà phát triển trên cơ sở mã nguồn cục bộ.

NVIDIA đã hợp tác với vLLM, Ollama, llama.cpp và LM Studio để mang đến trải nghiệm triển khai cục bộ tốt nhất cho các mô hình Nemotron 3.5 Lightning — cung cấp cho các nhà phát triển quyền lựa chọn định dạng mô hình NVFP4 và GGUF. Unsloth cũng cung cấp hỗ trợ ngay từ ngày đầu với các mô hình đã được tối ưu hóa và lượng tử hóa để triển khai cục bộ hiệu quả thông qua Unsloth Studio.

Nemotron 3.5 Lightning chạy cục bộ trên các máy tính NVIDIA RTX, NVIDIA DGX Spark và các hệ thống OEM GB10, NVIDIA Jetson, đồng thời có thể mở rộng lên các máy trạm RTX PRO, NVIDIA DGX Station và các hệ thống để bàn GB300, trung tâm dữ liệu và môi trường đám mây. Với các hệ thống NVIDIA Blackwell có sẵn từ Acer, ASUS, Dell Technologies, Exxact, GIGABYTE, HP, Lenovo, MSI và Supermicro, người dùng có thể lựa chọn từ nhiều loại thiết bị và kiểu dáng khác nhau để phù hợp với nhu cầu của mình.

Khi việc áp dụng AI tạo sinh ngày càng tăng, các doanh nghiệp đang tìm cách kiểm soát chi phí token ngày càng cao mà không làm giảm khả năng tiếp cận trí tuệ tiên tiến. NVIDIA NeMo Switchyard, một thư viện định tuyến mã nguồn mở, sẽ tự động điều hướng từng bước của quy trình tác nhân đến mô hình phù hợp nhất dựa trên độ chính xác, tốc độ và chi phí. Nó cũng mang lại cho các nhà phát triển sự linh hoạt để làm việc trên nhiều mô hình và nhà cung cấp khác nhau cho các tác vụ khác nhau.

Các bài kiểm tra hiệu năng nội bộ cho thấy NeMo Switchyard, bằng cách định tuyến từng bước qua một hệ thống các mô hình, đã giúp duy trì khả năng hoàn thành tác vụ ở cấp độ tiên tiến trong khi giảm chi phí hoàn thành xuống còn khoảng một phần ba so với việc chỉ sử dụng Opus 4.8. NeMo Switchyard hiện đã có sẵn trên GitHub.

Hãy truy cập các blog kỹ thuật về Nemotron 3.5 Lightning, NeMo Switchyard và Jetson AI để bắt đầu. Và để xây dựng tại biên (edge), hãy bắt đầu với các hướng dẫn của Jetson AI Lab và khám phá các dự án Jetson trong thực tế. Nemotron 3.5 Lightning cũng có sẵn thông qua OpenRouter, trên build.nvidia.com dưới dạng dịch vụ vi mô NVIDIA NIM, và thông qua hệ sinh thái rộng lớn gồm các Đối tác Đám mây NVIDIA, các nền tảng hậu huấn luyện, nền tảng suy luận và các nhà cung cấp dịch vụ đám mây. NeMo Switchyard hiện đã có sẵn trên GitHub.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.