Sản phẩm
Perplexity ra mắt Portable Computer: Chạy nền tảng AI cục bộ trên NVIDIA DGX Spark, không tốn phí token
(giờ Việt Nam)
Tóm tắt AI
Perplexity giới thiệu giải pháp Portable Computer tích hợp trên NVIDIA DGX Spark, cho phép vận hành các tác nhân AI cục bộ hoàn toàn mà không phát sinh chi phí theo token.
Bản dịch AI

Perplexity vừa ra mắt Portable Computer, một bản dựng ưu tiên cục bộ (local-first) của nền tảng Computer có khả năng tác nhân (agentic), chạy bộ khung tác nhân (agent harness), trình điều phối (orchestrator), trình lập kế hoạch (planner), bộ định tuyến công cụ (tool router) và các mô hình đã qua huấn luyện hậu kỳ trực tiếp trên NVIDIA DGX Spark. Mô hình cục bộ, công cụ suy luận (inference engine), môi trường thử nghiệm công cụ (tool sandbox) và các trình kết nối ứng dụng được đóng gói thành một hệ thống duy nhất; mọi tác vụ đều bắt đầu trên thiết bị và công việc được xử lý bởi các mô hình cục bộ sẽ không tính phí theo token. Khi một bước cần đến web trực tiếp hoặc khả năng suy luận tiên tiến, trình điều phối sẽ dừng lại và hỏi ý kiến người dùng trước khi gửi bước đó đến một trong hơn 15 mô hình đám mây.
Nó có thể triển khai được không?
Có, với một rào cản phần cứng nghiêm ngặt. Đây là phần mềm thương mại chính thức, không phải bản xem trước, nhưng nó yêu cầu một thiết bị lớp GB10 hoặc GPU RTX với 24 GB VRAM đặt dưới bàn làm việc.
Những gì thực sự được cài đặt trên thiết bị
Portable Computer không phải là một ứng dụng trò chuyện cục bộ với trình chọn tệp đơn thuần. Perplexity đóng gói mô hình cục bộ, công cụ suy luận, bộ khung tác nhân, môi trường thử nghiệm công cụ và các trình kết nối ứng dụng thành một hệ thống duy nhất, giúp loại bỏ công việc thông thường là thiết lập máy chủ suy luận và kết nối thủ công các công cụ. Người dùng có thể chọn Qwen 3.8 27B hoặc PPLX 27B — biến thể đã qua huấn luyện hậu kỳ của Perplexity được tinh chỉnh cho bộ khung riêng của hãng — cùng với NVIDIA Nemotron 3.5 Lightning, một mô hình MoE 30B mã nguồn mở, dự kiến sẽ sớm ra mắt. Hệ thống cũng hỗ trợ việc tự mang theo mô hình và máy chủ suy luận riêng (Bring-your-own model).
Mã nguồn và các lệnh gọi công cụ được thực thi bên trong một sandbox do hệ điều hành kiểm soát, giúp hạn chế các tiến trình, đường dẫn hệ thống tệp và quyền truy cập mạng. Nếu sandbox không khả dụng, việc thực thi công cụ sẽ bị vô hiệu hóa thay vì tự động hạ cấp âm thầm. Các trình kết nối Gmail, Outlook, Slack và GitHub sẽ được định tuyến thông qua trình điều phối cục bộ.
Cổng leo thang (escalation gate) chính là quyết định thiết kế thực sự
Ưu tiên cục bộ không có nghĩa là chỉ chạy cục bộ. Khi một bước cần đến web trực tiếp hoặc khả năng suy luận tiên tiến, trình điều phối sẽ dừng lại và hỏi ý kiến. Trước bất kỳ lệnh gọi nào, bộ khung sẽ chọn ngữ cảnh liên quan, chạy bộ phân loại PII (thông tin nhận dạng cá nhân) trên đó và hiển thị chính xác cho người dùng những gì sẽ rời khỏi máy. Bước được phê duyệt sẽ được gửi đến một trong hơn 15 mô hình đám mây; cố vấn từ xa sẽ trả về hướng dẫn bằng văn bản và không bao giờ nhận được quyền truy cập trực tiếp vào các tệp cục bộ, công cụ hoặc cuộc trò chuyện.
Perplexity cũng đã thiết kế để vượt qua các giới hạn ngữ cảnh của mô hình nhỏ. Qwen 3.8 27B quảng cáo cửa sổ 260K-token nhưng sẽ suy giảm hiệu suất sau khoảng 100K, vì vậy bộ khung giữ cho lời nhắc hệ thống (system prompt) và bộ công cụ ở mức nhỏ gọn, tải các kỹ năng chuyên biệt theo yêu cầu, hiển thị các trình kết nối dưới dạng công cụ CLI nhỏ gọn thay vì các định nghĩa MCP đầy đủ, và nén ngữ cảnh cũ trong quá trình chạy.
Các điểm chuẩn (Benchmarks)
Trên Local Knowledge Work Bench với 53 tác vụ — bao gồm nghiên cứu chuyên sâu, phân tích tài chính và tạo tài liệu, mà Perplexity cho biết họ có kế hoạch mở mã nguồn — Computer chạy Qwen 3.8 27B trên DGX Spark đạt 82,6%, so với 77,6% của bộ khung Pi mã nguồn mở và 74,0% của Hermes trên cùng một mô hình. PPLX 27B nâng con số này lên 85,4%.
Trên BrowseComp, Computer đạt 66,7% so với 50,2% (Pi) và 43,9% (Hermes), sử dụng ít thời gian thực tế hơn 51% và ít token hơn 70% so với Pi. Trên ParseBench-100 cho khả năng hiểu tài liệu trực quan, nó đạt 65,1% so với 34,6% và 13,9%.
Kết quả mang tính thông tin nhất là kết quả lai. Trên Terminal Bench 2.1, phiên bản chạy hoàn toàn cục bộ đạt 59,6% với chi phí biên gần như bằng không; việc leo thang lên cố vấn đã nâng nó lên 73,0% với chi phí khoảng 0,415 USD cho mỗi lần thực hiện, so với 82,4% ở mức khoảng 0,65 USD cho riêng Claude Opus 5. Việc leo thang giúp thu hẹp khoảng cách với các mô hình tiên tiến mà không hoàn toàn thay thế chúng.
Phần cứng, mô hình định giá và giới hạn
Các cài đặt DGX Spark cần siêu chip GB10, 128 GB bộ nhớ và ít nhất 1 TB dung lượng lưu trữ. Trình điều phối Qwen 3.8 27B được phân phối ở định dạng lượng tử hóa 3-bit, tải xuống 17,4 GB, yêu cầu 32 GB RAM; Nemotron 3.5 Lightning là 4-bit, 19 GB, yêu cầu 36 GB. Các hệ thống khác cần DGX OS hoặc Ubuntu trên ARM hoặc x64 với GPU RTX có 24 GB VRAM trở lên. Việc cài đặt là một thao tác thêm kho lưu trữ apt tiêu chuẩn.
Tính khả dụng hiện ưu tiên Linux cho các thuê bao Pro, Max, Enterprise Pro và Enterprise Max; Windows sẽ có vào tháng 9, và macOS không nằm trong lộ trình. Chỉ một DGX Spark được hỗ trợ khi ra mắt — việc phân cụm (clustering) nằm trong lộ trình, chưa được phát hành. Công việc được xử lý bởi các mô hình cục bộ không tính phí theo token, đây chính là điều giúp cho việc di chuyển quy mô kho lưu trữ và các vòng lặp xác minh dài trở nên hợp lý về mặt kinh tế trên phần cứng sở hữu riêng.
Những điểm chính cần lưu ý
Hãy xem qua Perplexity Portable Computer và blog về AI cục bộ của NVIDIA.
Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.