MarkTechPost
85

Sản phẩm

Hermes Desktop: Nous Research ra mắt tính năng cài đặt mô hình AI cục bộ chỉ với một cú nhấp chuột

(giờ Việt Nam)

Tóm tắt AI

Hermes Desktop tự động quét phần cứng, tối ưu hóa và cấu hình mô hình AI phù hợp nhất cho máy tính của bạn chỉ bằng một cú nhấp chuột, đảm bảo tiêu chuẩn chất lượng 4-bit và cửa sổ ngữ cảnh 64K.

Bản dịch AI

Nous Research Adds One-Click Local Model Setup to Hermes Desktop

Khó khăn khi chạy một mô hình open-weights cục bộ chưa bao giờ nằm ở chính mô hình đó. Mà là mọi thứ trước đó: đọc thông số VRAM, đoán xem mức độ lượng tử hóa (quantization) nào phù hợp, thiết lập độ dài ngữ cảnh (context length) và số lớp GPU, rồi đến lúc tải mới phát hiện ra file bị thừa mất ba gigabyte. Nous Research đã rút gọn quy trình đó chỉ còn một cú nhấp chuột trong Hermes Desktop. Luồng thiết lập dễ dàng mới sẽ tự động đọc phần cứng của bạn, chọn mô hình phù hợp, tải xuống các trọng số và cấu hình môi trường chạy suy luận (inference runtime) cho bạn.

Có thể triển khai được không? Có. Hermes Desktop là bản dựng miễn phí, sử dụng giấy phép MIT của Hermes Agent mã nguồn mở, chạy trên macOS 12+, Windows 10/11 và bất kỳ bản phân phối Linux nào, đồng thời không cần tài khoản để sử dụng các mô hình cục bộ.

Những gì đã thực sự được phát hành

Thông báo này rất cụ thể và tập trung: Hermes Desktop hiện thiết lập các mô hình cục bộ chỉ bằng một cú nhấp chuột, tự động đọc phần cứng, chọn mô hình, tải xuống và cấu hình môi trường chạy. Luồng này xuất hiện tự động khi khởi chạy lần đầu và có thể truy cập sau đó trong mục Settings → Providers → Local Models.

Về mặt kỹ thuật, Hermes tự quản lý công cụ suy luận. Theo tài liệu Local Models, nó sẽ tìm nạp bản dựng llama.cpp chính thức phù hợp với phần cứng của bạn (dung lượng vài trăm megabyte), xác minh và cập nhật nó. Các backend hỗ trợ bao gồm CUDA, Metal, Vulkan, HIP và CPU. Thẻ phát hành (release tag) được ghim nằm trong khối local_runtime của file config.yaml, vốn được giao diện người dùng desktop tự động ghi lại và người dùng headless có thể tự thiết lập thủ công.

Cách Hermes định giá mô hình dựa trên máy tính của bạn

Mọi mô hình trong danh mục đều được đánh giá dựa trên máy tính cụ thể của bạn trước khi bạn tải xuống bất cứ thứ gì. Mỗi hàng đều có một đánh giá về khả năng tương thích bộ nhớ: màu xanh lá cây nghĩa là chạy hoàn toàn trong bộ nhớ GPU, màu vàng nghĩa là tràn sang RAM hệ thống và sẽ chậm hơn, màu đỏ nghĩa là quá lớn so với máy này. Các hàng cũng hiển thị cửa sổ ngữ cảnh tối thiểu và tối đa cùng dung lượng tải xuống của bản dựng được chọn cho phần cứng của bạn.

Việc lựa chọn lượng tử hóa tuân theo một quy tắc: Hermes chọn bản dựng chất lượng cao nhất có thể chạy hoàn toàn trên GPU của bạn, và các máy có ít bộ nhớ hơn sẽ nhận được bản dựng gọn nhẹ hơn của cùng một mô hình đó. Có một giới hạn cứng ở mức 4-bit. Dưới mức đó, Nous coi sự sụt giảm chất lượng là quá nghiêm trọng, vì vậy một máy không thể chạy bản dựng 4-bit mà không bị tràn bộ nhớ thì đơn giản là không thể chạy mô hình đó. Các mô hình không phù hợp vẫn hiển thị kèm theo lý do, để bạn biết chính xác việc nâng cấp thêm VRAM sẽ mang lại lợi ích gì.

Các quy tắc bộ nhớ giúp hệ thống vận hành ổn định

Suy luận cục bộ phụ thuộc hoàn toàn vào cách phân bổ bộ nhớ, và Hermes không để lộ các tùy chỉnh cho việc này. Các mô hình bắt đầu với cửa sổ ngữ cảnh vừa khít với GPU của bạn và mở rộng dần đến mức tối đa mặc định khi cuộc trò chuyện cần thêm không gian. Mọi mô hình được đề xuất đều đảm bảo có cửa sổ tối thiểu 64K.

Thứ tự offload (chuyển tải) là một lựa chọn thiết kế thú vị. Khi một mô hình vượt quá bộ nhớ GPU, Hermes sẽ đặt phần tràn vào RAM hệ thống theo thứ tự ít gây ảnh hưởng nhất: trọng số chuyên gia (expert weights) trước, và tuyệt đối không bao giờ là bộ nhớ đệm chú ý (attention cache). Nó đánh đổi thông lượng để bảo vệ sự đảm bảo về ngữ cảnh. Nén cuộc trò chuyện chỉ được kích hoạt khi mô hình đạt đến cửa sổ tối đa, vì vậy việc mở rộng luôn được ưu tiên trước khi tóm tắt. Các mô hình nhàn rỗi sẽ được giải phóng sau 15 phút và tải lại khi có tin nhắn tiếp theo.

Những điểm chính cần lưu ý

Hãy xem tài liệu Local Models, kho lưu trữ GitHub và trang tải xuống phiên bản desktop. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng 150k+ ML SubReddit của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Product Release hoặc Webinar, v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.

AI cục bộHermes DesktopNous ResearchLLMCông cụ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.