NVIDIA Technical Blog (Blog - RSS)
71

Mô hình

NVIDIA ra mắt Nemotron 3 Ultra: Tối ưu hóa hiệu suất cho các AI Agent hoạt động dài hạn

(giờ Việt Nam)

Tóm tắt AI

NVIDIA giới thiệu mô hình Nemotron 3 Ultra, được thiết kế chuyên biệt để tăng tốc độ và giảm chi phí vận hành cho các AI Agent phức tạp, giúp duy trì ngữ cảnh và xử lý đa nhiệm hiệu quả trong thời gian dài.

Bản dịch AI

Các chatbot đơn lượt (single-turn) đang dần tiến hóa thành các tác nhân (agent) hoạt động lâu dài, có khả năng suy luận, duy trì ngữ cảnh, sử dụng công cụ và vận hành hiệu quả qua nhiều lượt hội thoại để hoàn thành các quy trình làm việc phức tạp.

Tuy nhiên, các quy trình làm việc đa tác nhân này khiến số lượng token tăng lên nhanh chóng. Các tác nhân liên tục lập kế hoạch, gọi công cụ, kích hoạt các tác nhân phụ, nhận thông tin, sau đó truyền lại lịch sử, kết quả đầu ra và các bước suy luận vào mô hình. Khi các tác vụ kéo dài, sự giao tiếp liên tục này làm tăng chi phí và rủi ro chệch mục tiêu (goal drift).

Các nhà phát triển có thể giải quyết vấn đề này bằng cách sử dụng hệ thống các mô hình: các mô hình suy luận tiên phong (frontier reasoning models) cho việc điều phối và lập kế hoạch phức tạp, cùng các mô hình hiệu quả cho việc thực thi khối lượng lớn, xác thực và gọi công cụ.

NVIDIA đang ra mắt NVIDIA Nemotron 3 Ultra, một mô hình mở được xây dựng để giúp các tác nhân hoạt động lâu dài hoàn thành tác vụ nhanh hơn trong khi giảm thiểu chi phí.

Nemotron 3 Ultra cho điều phối tác nhân

Nemotron 3 Ultra là mô hình Mixture-of-Experts với 550 tỷ tham số, trong đó có 55 tỷ tham số hoạt động, được xây dựng cho mục đích suy luận tiên phong và điều phối trong các hệ thống tác nhân.

Trong bất kỳ quy trình làm việc nào của tác nhân, hầu hết các lệnh gọi đều là thông thường, nhưng một tập hợp con quan trọng đòi hỏi khả năng suy luận sâu hơn. Nemotron 3 Ultra được xây dựng để xử lý các lệnh gọi khó này: duy trì các quyết định kiến trúc trong suốt các phiên lập trình, tổng hợp các bằng chứng mâu thuẫn từ hàng trăm nguồn nghiên cứu, hoặc xác minh thiết kế chip qua hàng ngàn ràng buộc.

Nemotron 3 Ultra cũng rất nhanh. Nó đạt thông lượng cao gấp 5 lần so với các mô hình mở khác cùng phân khúc, cho phép các tác nhân hoạt động lâu dài hoàn thành tác vụ nhanh hơn và hiệu quả hơn.

The chart shows frontier open models on an accuracy v. output speed benchmark from Artificial Analysis. Nemotoron 3 Ultra is 5x faster and the only model in the most attractive quadrant.

Nemotron 3 Ultra cũng được xây dựng để tối ưu hóa hiệu suất. Trong các thử nghiệm trên SWE-bench và Terminal bench 2.0, mô hình đã hoàn thành các bài kiểm chuẩn (benchmark) với tổng số token ít hơn và số token trên mỗi lượt ít hơn so với các mô hình tương đương. Điều này giúp giảm chi phí cho các tác vụ tác nhân lên đến 30%.

The chart plots Pareto curves of open models on Accuracy v. Cost to Task Completion. Nemotron 3 Ultra delivers 30% cost savings to complete SWE Bench verified benchmark.

Những đột phá tạo nên sức mạnh cho Nemotron 3 Ultra

Để giảm thiểu sự đánh đổi thông thường giữa hiệu suất và độ chính xác đối với các mô hình suy luận năng lực cao, các mô hình Nemotron giới thiệu những cải tiến về kiến trúc:

Hậu đào tạo cho các bộ công cụ tác nhân: Nemotron Ultra được hậu đào tạo để mang lại độ chính xác nhất quán trên các bộ công cụ (harness) hàng đầu. Mô hình được huấn luyện bằng các thư viện mở NVIDIA NeMo RL và Gym với một trong những bộ dữ liệu lớn nhất thế giới về các tác vụ giải quyết vấn đề lâu dài và sử dụng công cụ.

Ultra được tối ưu hóa cho các bộ công cụ mở do tác nhân dẫn dắt, không chỉ là trò chuyện đơn lượt, và được thiết kế để hoạt động trong các quy trình làm việc nơi các tác nhân lập kế hoạch, gọi công cụ, đọc quan sát, ủy quyền cho các tác nhân phụ, xác thực kết quả đầu ra và phục hồi sau lỗi qua nhiều lượt.

Hybrid Mamba transformer: Các lớp Mamba cải thiện hiệu suất trình tự cho các khối lượng công việc có ngữ cảnh dài, trong khi các lớp Transformer duy trì khả năng truy xuất chính xác khi các tác nhân cần tìm lại các dữ kiện cụ thể từ các cửa sổ ngữ cảnh lớn.

Độ chính xác NVFP4: Cùng một checkpoint NVFP4 có thể chạy trên các GPU NVIDIA Hopper, NVIDIA Blackwell và Ampere. Các nhà phát triển có thể sử dụng một checkpoint duy nhất trên tất cả các kiến trúc GPU NVIDIA nhờ các nhân lượng tử hóa NVFP4 chuyên biệt. NVFP4 cũng mang lại thông lượng trên mỗi GPU cao gấp 5 lần ở cùng mức độ tương tác so với BF16 trên Blackwell.

LatentMoE: LatentMoE hỗ trợ định tuyến chuyên gia hiệu quả hơn, cho phép mô hình xử lý các quy trình làm việc bao gồm suy luận, tạo mã, gọi công cụ và logic chuyên biệt theo miền.

Dự đoán đa token (Multi-token prediction): Dự đoán đa token (MTP) giúp giảm thời gian tạo bằng cách dự đoán nhiều token tương lai trong một lần truyền xuôi (forward pass), cải thiện thông lượng cho các kết quả đầu ra dài và quy trình làm việc đa lượt.

Nemotron 3 Ultra bổ sung phương pháp Multi-Teacher On-Policy Distillation

Multi-Teacher On-Policy Distillation (MOPD) là một phương pháp huấn luyện trong đó Ultra học hỏi từ nhiều mô hình giáo viên chuyên biệt trong khi tự tạo ra các thử nghiệm của riêng mình trong quá trình huấn luyện. Hơn 10 mô hình giáo viên chuyên biệt được huấn luyện, mỗi mô hình có quy trình huấn luyện chuyên biệt theo miền riêng. Mỗi giáo viên chấm điểm mô hình trong lĩnh vực chuyên môn của mình, giúp Ultra cải thiện khả năng suy luận trên các lĩnh vực một cách hiệu quả hơn.

The image describes the phases, and specific teacher and checkpoint interaction used for Nemotron 3 Ultra MOPD phase.

Trong quá trình MOPD, mô hình học viên tạo ra các kết quả (rollouts) trên các lĩnh vực và nhận các tín hiệu phần thưởng dày đặc từ các mô hình giáo viên tương ứng. Để tối đa hóa hiệu quả, MOPD chạy không đồng bộ, với việc tạo rollout của học viên, chấm điểm của giáo viên và tối ưu hóa học viên được thực hiện hoàn toàn theo dạng đường ống (pipelined).

MOPD cũng mang tính lặp lại. Sau khi tạo ra một checkpoint được huấn luyện bằng MOPD, các vòng huấn luyện giáo viên mới được khởi tạo từ mô hình học viên đã cập nhật, và các cải tiến được hợp nhất vào giai đoạn MOPD tiếp theo.

Sự đồng tiến hóa giữa học viên và giáo viên này cho phép cải thiện năng lực liên tục và chuyên môn hóa ngày càng mạnh mẽ hơn trên các lĩnh vực. Người dùng có thể thử nghiệm các công thức MOPD thông qua NeMo-RL, thư viện đã huấn luyện mô hình Ultra.

Dữ liệu huấn luyện cho khả năng suy luận của tác nhân mạnh mẽ hơn

Giống như tất cả các đợt ra mắt mô hình mở Nemotron, phần lớn quy trình dữ liệu huấn luyện được phát hành với giấy phép cởi mở nhất có thể. Đối với các đối tác trong lĩnh vực phát triển AI doanh nghiệp và AI chủ quyền, tính minh bạch và nguồn gốc của dữ liệu huấn luyện cũng quan trọng như năng lực của mô hình.

Dữ liệu tiền huấn luyện chuyên biệt theo miền

Dựa trên nền tảng tiền huấn luyện 10 nghìn tỷ (10T) token, Nemotron 3 Ultra bổ sung 212 tỷ token mới nhắm vào ba khoảng trống miền có giá trị cao.

Dữ liệu hậu huấn luyện và môi trường RL

Đợt ra mắt này cũng phát hành 10 triệu mẫu SFT mới, 1 triệu tác vụ RL mới trên nhiều lĩnh vực và 15 môi trường RL hoàn toàn mới, nâng tổng số dữ liệu mở của Nemotron lên 50 triệu mẫu SFT, 2 triệu tác vụ RL và 55 môi trường RL.

Kết quả là điểm số SWEBench Verified đạt từ 65% đến 70,4% trên Pi, OpenHands, Hermes, OpenCode và Mini SWE Agent—hiệu suất nhất quán bất kể bạn triển khai trên khung làm việc nào.

Tinh chỉnh cho miền của bạn

Nemotron 3 Ultra có thể được tinh chỉnh bằng cách sử dụng LoRA, SFT và học tăng cường (reinforcement learning) thông qua các thư viện NVIDIA NeMo. Các nhà phát triển có thể bắt đầu với các công thức sau.

Các công thức cho Nemotron 3 Ultra:

Triển khai

Triển khai Nemotron Ultra bằng Dynamo Recipes để định tuyến nhận biết KV, dự đoán đa token (MTP) và tách biệt quá trình prefill/decode.

Xem mô hình hoạt động

Hướng dẫn này cho thấy cách thiết lập và chạy quy trình tự nghiên cứu (autoresearch) sử dụng Hermes Agent được hỗ trợ bởi Nemotron 3 Ultra trên build.nvidia.com.

Vận hành các tác nhân an toàn hơn với NVIDIA NemoClaw và NVIDIA OpenShell

Ý chính từ bài gốc

  • Nemotron 3 Ultra là mô hình MoE 550B tham số, tối ưu cho việc điều phối tác nhân AI dài hạn.
  • Kiến trúc đột phá giúp tăng thông lượng suy luận gấp 5 lần và giảm 30% chi phí hoàn thành tác vụ.
  • Sử dụng phương pháp MOPD để học hỏi từ nhiều mô hình giáo viên chuyên biệt, giúp cải thiện khả năng suy luận.
  • Hỗ trợ các thư viện mã nguồn mở, cho phép tinh chỉnh (fine-tune) linh hoạt qua LoRA, SFT và RL.
  • Ra mắt kèm mô hình Nemotron 3.5 Content Safety để kiểm soát nội dung an toàn cho doanh nghiệp.
Tác tử AIMô hình
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Technical Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.