Mô hình
SGLang hỗ trợ tức thì mô hình NVIDIA Nemotron 3.5 Lightning
(giờ Việt Nam)
Tóm tắt AI
SGLang vừa cập nhật hỗ trợ Day-0 cho Nemotron 3.5 Lightning, mô hình MoE 30B với cửa sổ ngữ cảnh 1M token, cho phép tối ưu hóa hiệu suất thông qua các kỹ thuật giải mã suy đoán tiên tiến.
Bản dịch AI
SGLang vui mừng thông báo hỗ trợ Day-0 cho NVIDIA Nemotron 3.5 Lightning, một mô hình mở có khả năng tùy chỉnh, được xây dựng để vận hành các tác nhân (agent) luôn hoạt động trên các hệ thống cục bộ, thiết bị biên (edge), trung tâm dữ liệu và đám mây.
Các tác nhân luôn hoạt động (always-on agents) có khả năng thu thập ngữ cảnh, suy luận, sử dụng công cụ và thích ứng trong các quy trình làm việc nhiều bước. Các mô hình tiên phong (frontier models) xử lý việc điều phối phức tạp, trong khi các mô hình nhỏ hơn quản lý hiệu quả các tác vụ chuyên biệt với khối lượng lớn.
Nemotron 3.5 Lightning được thiết kế để xử lý các tác vụ khối lượng lớn này. Được chưng cất (distilled) từ NVIDIA Nemotron 3 Ultra và phát triển cùng Nemotron Coalition, mô hình này kết hợp khả năng lập trình, gọi công cụ, tuân thủ hướng dẫn và xử lý đa lượt mạnh mẽ trong một mô hình hỗn hợp chuyên gia (mixture-of-experts) 30 tỷ tham số, nhưng chỉ kích hoạt 3 tỷ tham số tại một thời điểm.
Nemotron 3.5 Lightning có thể vận hành các trợ lý cá nhân cục bộ, tự động hóa quy trình tài chính và rủi ro, hỗ trợ điều tra an ninh mạng, tối ưu hóa hoạt động viễn thông và cải thiện trải nghiệm bán lẻ. Các tổ chức có thể hậu huấn luyện (post-train) và triển khai mô hình này cho các thuật ngữ, chính sách, công cụ và quy trình làm việc cụ thể của riêng họ.
Với SGLang, các nhà phát triển có thể phục vụ mô hình thông qua một ngăn xếp suy luận (inference stack) hiệu năng cao, tương thích với OpenAI và kết nối nó với các bộ khung tác nhân (agent harnesses), trợ lý cục bộ và các quy trình làm việc chuyên biệt của doanh nghiệp.
Tóm tắt: NVIDIA Nemotron 3.5 Lightning
Cài đặt và Bắt đầu nhanh với SGLang
SGLang cung cấp một runtime phục vụ hiệu năng cao, tính năng batching liên tục, bộ nhớ đệm tiền tố (prefix caching), giải mã suy đoán (speculative decoding) và API tương thích với OpenAI. Lệnh cơ bản sau đây sử dụng checkpoint BF16:
Sau khi máy chủ khởi động, hãy gửi yêu cầu bằng bất kỳ client nào tương thích với OpenAI:
Suy luận tối ưu với Giải mã suy đoán (Speculative Decoding)
Nemotron 3.5 Lightning hỗ trợ ba kỹ thuật giải mã suy đoán—Multi-Token Prediction (MTP), DFlash và DSpark—để tăng tốc độ tạo token trong khi vẫn duy trì chất lượng đầu ra của mô hình mục tiêu.
MTP sử dụng các đầu dự đoán nhẹ, tích hợp trong mô hình để đề xuất một số token tương lai; DFlash sử dụng bộ dự thảo dựa trên khuếch tán (diffusion-based drafter) để tạo ra toàn bộ khối ứng viên song song; và DSpark bổ sung tính năng dự thảo bán tự hồi quy (semi-autoregressive) có nhận thức về độ tin cậy để cân bằng giữa tốc độ và chất lượng chấp nhận token. Cùng nhau, chúng cho phép các đội ngũ lựa chọn sự cân bằng tốt nhất về độ trễ, thông lượng và triển khai cho khối lượng công việc suy luận của mình.
Để phục vụ với độ trễ thấp, hãy sử dụng DSpark trên H100, H200 và DGX Spark; để đạt thông lượng tối đa hiện nay, chúng tôi khuyến nghị chạy mà không cần giải mã suy đoán.
Chạy Nemotron 3.5 Lightning với MTP
Nemotron 3.5 Lightning bao gồm dự đoán đa token. SGLang hiển thị MTP thông qua đường dẫn giải mã suy đoán, nơi các đầu dự đoán tích hợp của mô hình sẽ dự thảo các token tương lai và mô hình mục tiêu sẽ xác minh chúng.
Giao diện MTP tiêu chuẩn của SGLang sử dụng thuật toán suy đoán EAGLE. Xem sách hướng dẫn (cookbook) để biết lệnh chính xác cho từng phần cứng.
Chạy Nemotron 3.5 Lightning với DFlash
DFlash sử dụng một mô hình dự thảo khuếch tán chuyên dụng để đề xuất một khối token tuyến tính mà mô hình mục tiêu xác minh song song. Trong SGLang, DFlash yêu cầu một checkpoint dự thảo tương thích và được kích hoạt riêng biệt với MTP.
Triển khai DFlash của SGLang không hỗ trợ attention song song dữ liệu và yêu cầu kích thước song song đường ống (pipeline parallel size) bằng 1. Xem hướng dẫn giải mã suy đoán của SGLang để biết tham chiếu tham số hiện tại.
Chạy Nemotron 3.5 Lightning với DSpark
DSpark là một bộ suy đoán lai kết hợp giữa dự thảo tự hồi quy và dự thảo kiểu khuếch tán song song, nằm giữa phương pháp tự hồi quy hoàn toàn của MTP và phương pháp dựa trên khuếch tán hoàn toàn của DFlash, mang lại hiệu suất tốt nhất trong cả ba trên DGX Spark.
Kiểm soát suy luận cho từng bước của tác nhân
Nemotron 3.5 Lightning hỗ trợ bật hoặc tắt suy luận, cho phép bộ định tuyến hoặc bộ khung tác nhân sử dụng suy luận sâu hơn cho các bước khó và câu trả lời trực tiếp cho công việc thường nhật.
Suy luận được bật theo mặc định. Để yêu cầu câu trả lời trực tiếp mà không cần dấu vết suy luận, hãy truyền enable_thinking: false thông qua chat_template_kwargs:
Đối với các yêu cầu có bật suy luận, hãy bỏ qua chat_template_kwargs (suy luận được bật mặc định) hoặc thiết lập nó một cách rõ ràng:
Mô hình cũng hỗ trợ ngân sách token suy luận. Sử dụng thinking_budget (thông qua custom_params) cùng với enable_thinking để thay đổi độ sâu suy luận và thời gian phản hồi cho mỗi yêu cầu:
Kiểm soát suy luận đặc biệt hữu ích trong các hệ thống đa mô hình: bộ điều phối có thể phân bổ ngân sách lớn hơn cho việc lập kế hoạch, lập trình và các quyết định mơ hồ, trong khi sử dụng chế độ tắt suy luận hoặc ngân sách nhỏ cho việc trích xuất, phân loại và chuyển đổi có cấu trúc.
Tối ưu hóa suy luận cho Nemotron 3.5 Lightning
Nemotron 3.5 Lightning có kiến trúc giống hệt Nemotron 3 ngoại trừ trọng số và ngăn xếp giải mã suy đoán, vì vậy hầu hết công việc tối ưu hiệu suất đều nằm ở chính các runtime. Đây là những gì chúng tôi đã đóng góp vào SGLang:
Nemotron 3.5 Lightning mang lại độ chính xác và hiệu quả hàng đầu cho AI chuyên biệt
Nemotron 3.5 Lightning kết hợp kiến trúc MoE lai—với chỉ 3 tỷ trong số 30 tỷ tham số được kích hoạt trên mỗi token—với dự đoán đa token để giảm tính toán và tăng tốc độ tạo. Những tối ưu hóa này mang lại thông lượng cao hơn tới 4 lần so với các mô hình mở có kích thước tương đương, giúp các tác nhân hoàn thành các tác vụ chuyên biệt nhanh hơn.
Được chưng cất từ NVIDIA Nemotron 3 Ultra và huấn luyện trên các bộ khung tác nhân phổ biến, Nemotron 3.5 Lightning chuyển giao các khả năng tác nhân cấp độ tiên phong vào một mô hình nhỏ gọn, hiệu quả. Nó vượt trội trên các tiêu chuẩn về năng suất tác nhân, lập trình, sử dụng công cụ, tuân thủ hướng dẫn và suy luận ngữ cảnh dài.
Như được hiển thị trong Hình 1, thông lượng suy luận cao hơn và hiệu quả token đặt Nemotron 3.5 Lightning vào vị trí tiên phong về hiệu suất, giúp các tác nhân luôn hoạt động hoàn thành công việc khối lượng lớn nhanh hơn.
Hình 1: Nemotron 3.5 Lightning dẫn đầu về hiệu suất bằng cách hoàn thành các tác vụ tác nhân nhanh hơn tới 30% ở mức độ chính xác tương đương.
Tóm tắt
NVIDIA Nemotron 3.5 Lightning mang trí tuệ tác nhân nhanh, có thể tùy chỉnh đến các hệ thống cục bộ, thiết bị biên, trung tâm dữ liệu và đám mây. Với sự hỗ trợ Day-0 của SGLang, các nhà phát triển có thể phục vụ mô hình thông qua ngăn xếp hiệu năng cao, tương thích với OpenAI; kiểm soát suy luận cho từng bước tác nhân; quản lý bộ nhớ cho các triển khai cục bộ như DGX Spark; và tăng tốc độ tạo với dự đoán đa token, DFlash hoặc DSpark.
Đối với các hệ thống định tuyến công việc qua nhiều mô hình, Nemotron 3.5 Lightning mang đến cho các nhà phát triển một lựa chọn hấp dẫn cho các tác vụ chuyên biệt khối lượng lớn, nơi độ chính xác, tốc độ, tính mở và quyền kiểm soát triển khai đều quan trọng.
Bắt đầu
Cập nhật thông tin về NVIDIA Nemotron bằng cách đăng ký nhận tin tức từ NVIDIA và theo dõi NVIDIA AI trên LinkedIn, X, YouTube và kênh Nemotron trên Discord.
Bài viết được AI dịch và tổng hợp tự động từ LMSYS: Blog (Chatbot Arena ). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.