Sản phẩm
NVIDIA ra mắt PAIR: Bộ định tuyến suy luận AI mã nguồn mở giúp tối ưu hóa tài nguyên phần cứng
(giờ Việt Nam)
Tóm tắt AI
NVIDIA vừa giới thiệu PAIR, công cụ mã nguồn mở tự động phân phối các yêu cầu suy luận AI đến các thiết bị trong mạng nội bộ như RTX, DGX Spark và Mac, giúp tận dụng tối đa sức mạnh phần cứng sẵn có.
Bản dịch AI

Các quy trình làm việc đa tác nhân (multi-agent workflows) đã thay đổi diện mạo của việc suy luận cục bộ (local inference). Một tác nhân chính sẽ phân tách nhiệm vụ và tạo ra các tác nhân phụ. Những gì trông có vẻ như một yêu cầu từ người dùng lại trở thành hàng chục lệnh gọi mô hình độc lập. Khi hướng vào một công cụ cục bộ duy nhất, các lệnh gọi này sẽ cạnh tranh cho cùng một vị trí thực thi. Hàng đợi ngày càng dài ra trong khi một máy trạm, máy tính xách tay hoặc DGX Spark trên cùng mạng lại đang ở trạng thái nhàn rỗi.
NVIDIA Personal AI Router (PAIR) nhắm đến chính nút thắt đó. Được công bố trong tuần này, PAIR là một bộ định tuyến suy luận ảo. Nó tự động phát hiện các máy tương thích trên mạng gia đình và lập lịch các yêu cầu suy luận độc lập trên các máy đó. Đây không phải là một công cụ suy luận mới. Ollama hoặc LM Studio vẫn thực thi mô hình trên bất kỳ nút nào mà PAIR chọn.
Nó có thể triển khai được không? Có. PAIR hiện đã ra mắt dưới dạng bản beta công khai (v0.1.1) với các trình cài đặt đã ký cho Windows, macOS và Linux, đồng thời toàn bộ mã nguồn có sẵn trên GitHub theo giấy phép Apache 2.0. Nó chạy hoàn toàn trên mạng cục bộ, chỉ cần internet để tải xuống các mô hình.
Không có API mới
Quyết định thiết kế quan trọng nhất là PAIR không giới thiệu bất kỳ API cụm (cluster API) nào. Nó đóng vai trò proxy cho các giao diện tương thích với Ollama và LM Studio mà các tác nhân vốn đã sử dụng, tiếp quản cổng mặc định mà mỗi công cụ sử dụng. Nếu một bộ khung (harness) lắng nghe ở nơi khác, cổng proxy có thể được cấu hình trong cài đặt công cụ của PAIR. Kho lưu trữ cũng cung cấp các điểm cuối proxy tương thích với OpenAI.
Hệ quả là: các bộ khung tác nhân hiện có không cần thay đổi gì cả. Tác nhân quyết định công việc cần yêu cầu, còn PAIR quyết định nơi công việc đó được thực thi.
Khám phá, ghép nối và truyền tải
PAIR sử dụng mDNS để tự động tìm kiếm các hệ thống lân cận. Một nút có thể được thêm bằng địa chỉ IP khi tính năng khám phá tự động thất bại. Sự tin cậy được thiết lập bằng mã PIN gồm sáu chữ số hiển thị trên máy chủ và được nhập trên máy khách. Tất cả giao tiếp giữa các nút đều bị chặn cho đến khi quá trình ghép nối hoàn tất. Lưu lượng truy cập giữa các nút đã ghép nối sau đó được bảo mật bằng mTLS sử dụng các chứng chỉ được tạo.
Mỗi nút chạy Ollama hoặc LM Studio. PAIR có thể cài đặt một công cụ và bắt đầu tải xuống mô hình trên các hệ thống đã ghép nối, giúp loại bỏ hầu hết công việc thiết lập trên nhiều máy.
Cách bộ lập lịch chọn một nút
Một nút chỉ đủ điều kiện cho một yêu cầu khi công cụ cần thiết được bật và mô hình được yêu cầu chính xác đang hiện diện. Các mô hình không cần phải giống hệt nhau trên toàn bộ cụm; các hệ thống khác nhau có thể chứa các mô hình khác nhau và PAIR định tuyến dựa trên vị trí của mô hình. Việc tải cùng một thẻ (tag) trên nhiều nút hơn chỉ đơn giản là mở rộng nhóm các nút đủ điều kiện.
Đối với mỗi yêu cầu, bộ lập lịch sẽ cân nhắc năm tín hiệu: Nút có đang trực tuyến và sẵn sàng không? Công cụ hỗ trợ có được bật không? Mô hình chính xác có hiện diện không? Tải công việc hiện tại của nút và công cụ là bao nhiêu? Mức sử dụng GPU hiện tại là bao nhiêu?
Đây là khả năng xử lý đồng thời ở cấp độ khối lượng công việc và ranh giới này rất rõ ràng. PAIR gán mỗi yêu cầu cho một nút đủ điều kiện, nơi nó sẽ tồn tại trong suốt vòng đời của yêu cầu đó. Nó không gộp VRAM, không hợp nhất các GPU thành một bộ tăng tốc lớn hơn, cũng không phân mảnh một yêu cầu duy nhất trên nhiều máy.
Các con số demo và những lưu ý đi kèm
Bản trình diễn của NVIDIA kết hợp PAIR với Hermes Desktop, tạo ra khối lượng công việc gồm năm tác nhân phụ trên một hộp thư đến giả lập trong gia đình. Ollama thực thi mô hình Qwen 3.6 35B A3B trên mỗi nút được chọn.
Trên một máy tính xách tay RTX Spark, khối lượng công việc mất trung bình 18 phút. Trên một cụm PAIR gồm ba thiết bị bao gồm một máy tính xách tay RTX Spark, một DGX Spark và một RTX 5090, thời gian trung bình là 8 phút 48 giây.
Phần cứng hỗ trợ và yêu cầu
PAIR hỗ trợ GPU GeForce RTX 20 Series trở lên, GPU máy trạm RTX PRO từ kiến trúc Turing trở đi, DGX Spark và Apple M4 hoặc silicon mới hơn. Các nút Windows, Linux và macOS đều có thể ghép nối với nhau trên cả kiến trúc x64 và arm64, mặc dù Windows trên ARM vẫn đang ở giai đoạn thử nghiệm. Các cấu hình được xác thực yêu cầu RAM từ 8 GB trở lên và khuyến nghị 20 GB dung lượng đĩa. Các bản phân phối Linux khác có thể xây dựng từ mã nguồn.
Những điểm chính cần lưu ý
Hãy xem trang sản phẩm NVIDIA PAIR, Blog kỹ thuật của NVIDIA, kho lưu trữ GitHub, Playbook và FAQ. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới, hội thảo trực tuyến (webinar), v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Với tư cách là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về các tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.