Chuyên gia kiến trúc AI chia sẻ cách sử dụng SGLang để thực hiện suy luận cục bộ, giúp tăng tốc tác vụ phân loại lên gấp 180 lần so với phương pháp tự hồi quy truyền thống mà không tốn phí API.
OpenJev là nền tảng chạy mô hình AI cục bộ ngay trên trình duyệt, cho phép người dùng so sánh tốc độ và độ chính xác giữa việc đọc trực tiếp logits và tạo JSON theo từng token.
Today we're open-sourcing Lily, the local inference engine we built for hybrid compute in Perplexity…
DịchPerplexity vừa mã nguồn mở Lily, công cụ suy luận được tối ưu hóa đặc biệt cho mô hình Qwen3.6-35B-A3B trên chip Apple Silicon, giúp tăng tốc xử lý tác vụ trực tiếp trên thiết bị mà không bị nghẽn hiệu năng.