Sản phẩm
Perplexity ra mắt Lily: Công cụ suy luận Rust + Metal tối ưu riêng cho Qwen3.6 trên chip Apple
(giờ Việt Nam)
Tóm tắt AI
Perplexity vừa mã nguồn mở Lily, công cụ suy luận hiệu năng cao viết bằng Rust và Metal, được thiết kế chuyên biệt để chạy mô hình Qwen3.6-35B-A3B trên chip Apple Silicon mà không cần phụ thuộc vào PyTorch hay MLX.
Bản dịch AI

Perplexity đã mã nguồn mở Lily, công cụ suy luận cục bộ đứng sau Hybrid Compute trong Perplexity Computer. Đây là một runtime đơn tiến trình: một lớp Rust tải checkpoint và điều khiển vòng lặp tạo văn bản, một API chat-completions tương thích với OpenAI thực hiện truyền phát token, và các nhân Metal được viết thủ công để thực thi mô hình. Cả PyTorch lẫn MLX đều không nằm trong đường dẫn thực thi. Lily được thiết kế có chủ đích với phạm vi hẹp, chỉ dành cho một mô hình duy nhất là Qwen3.6-35B-A3B trên một dòng phần cứng nhất định, và chính sự tinh gọn đó là lý do tạo nên hiệu năng vượt trội.
Nó có thể triển khai được không? Có. Một bản demo độc lập đã được công khai trong kho lưu trữ pplx-garden. Đây là một máy chủ suy luận Rust và Metal cung cấp khả năng tạo văn bản theo cơ chế greedy thông qua một HTTP API tối giản tương thích với OpenAI. Checkpoint 4-bit có dung lượng 19,4 GB, vì vậy một chiếc máy Mac dùng chip Apple silicon với 32 GB RAM thống nhất trở lên là mức tối thiểu thực tế; sản phẩm Hybrid Compute của Perplexity yêu cầu macOS 15+, tối thiểu 24 GB RAM và 32 GB để đạt kết quả tốt nhất.
Tại sao lại cần chuyên biệt hóa?
Stack mặc định trên Mac là MLX kết hợp với MLX-LM, vốn đã hỗ trợ triển khai Qwen với cơ chế xử lý chuyên gia theo nhóm (grouped expert), nhân Metal tái phát (recurrent) được hợp nhất và cơ chế chú ý GQA-aware. Tuy nhiên, các thao tác của nó phải đảm bảo khả năng tái sử dụng trên nhiều kiến trúc khác nhau. Lily từ bỏ điều đó để tích hợp cấu trúc mô hình, kế hoạch thực thi và lựa chọn nhân vào một runtime duy nhất.
Ba dạng khối lượng công việc
Qwen3.6-35B-A3B lưu trữ 35 tỷ tham số và kích hoạt khoảng 3 tỷ tham số cho mỗi token. Một bộ định tuyến (router) sẽ chấm điểm 256 chuyên gia và chọn ra tám người, cùng với một chuyên gia dùng chung xử lý mọi token. Nó cũng kết hợp 10 lớp chú ý toàn phần sử dụng cơ chế grouped-query attention (16 đầu truy vấn, hai đầu KV) với 30 lớp Gated DeltaNet. Điều này tạo ra ba mô hình: các nhóm chuyên gia không đồng đều, cơ chế chú ý trên bộ nhớ đệm KV đang tăng dần và cơ chế tái phát có kích thước cố định.
Prefill: giữ trọng số được đóng gói, giữ việc định tuyến trên GPU
Checkpoint sử dụng phương pháp lượng tử hóa 4-bit theo nhóm (groupwise affine), mỗi nhóm 64 trọng số chia sẻ một giá trị scale và bias kiểu bfloat16, nén khoảng 70 GB trọng số bfloat16 xuống còn 19,4 GB. Các thao tác tensor Metal 4 tiêu thụ bfloat16, vì vậy trọng số phải được tái tạo trước. Lily thực hiện việc này trên từng tile bên trong grouped GEMM, giữ kết quả trong bộ nhớ threadgroup và tích lũy ở định dạng FP32, do đó mảng mở rộng không bao giờ tràn vào bộ nhớ thống nhất. Trong thử nghiệm ablation của Perplexity, việc hợp nhất này đã tăng tốc độ prefill toàn trình lên 77,4% với prompt 512 token.
Việc giữ biểu đồ định tuyến, prefix scan, scatter và bản đồ khối bên trong một bộ đệm lệnh GPU duy nhất đã tăng 89% hiệu suất ở mức 512 token bằng cách loại bỏ sự đồng bộ hóa CPU bên trong mỗi lớp MoE. Việc chuyển từ tile 16 hàng sang 32 hàng với bốn simdgroup tăng 13,2% ở mức 2K; cơ chế Gated DeltaNet scan nằm trong thanh ghi tăng 5,6%. Các Expert GEMM chiếm khoảng 90% thời gian prefill. Các prompt dài được chạy theo từng khối giới hạn để các kích hoạt tạm thời không cạnh tranh tài nguyên bộ nhớ với trọng số và bộ nhớ đệm.
Decode: giảm thiểu số byte di chuyển trên mỗi token
Quá trình decode batch-1 hầu như không có sự tái sử dụng trọng số, vì vậy băng thông là yếu tố quyết định giới hạn. Một bước ghi nhận đã khởi chạy 795 nhân tạo thành 555 giai đoạn tuần tự; Lily ghi lại các phụ thuộc thực tế trong một lượt chạy Metal đồng thời để các nhân độc lập có thể chồng lấp lên nhau. Token được chọn sẽ được ghi thẳng vào khe đầu vào nằm trên GPU của bước tiếp theo, loại bỏ việc truyền dữ liệu qua lại với CPU trên mỗi token, và bốn chuỗi nhân được hợp nhất để giữ các giá trị trung gian trong thanh ghi.
Việc đọc bộ nhớ đệm được gộp (coalesced) đã nâng băng thông key từ 33,8 lên 47,9 GB/s và băng thông value từ 42,0 lên 61,8 GB/s. Việc đóng gói GQA, với bốn đầu truy vấn chia sẻ một threadgroup để mỗi hàng KV chỉ cần tải một lần, đã cải thiện tốc độ decode 23,8% ở mức 32K. Bố cục chú ý theo khối cố định ở mức 32K trở lên đã cải thiện tốc độ decode 7,7% ở 32K, 27,4% ở 64K và 40,2% ở 128K.
Kết quả
Trên một máy M5 Max 40 nhân, 128 GB RAM ở batch 1, khi tải cùng một checkpoint 4-bit so với đường dẫn tạo văn bản trực tiếp nhanh nhất của MLX-LM qua mười độ dài từ 256 đến 128K token, Lily đạt trung bình 4.156 token/s cho prefill so với 3.388 (1,23x) và 170,0 token/s cho decode so với 126,4 (1,35x). Ở prompt 4K và ngữ cảnh 4K, nó đạt 5.749,9 và 186,6 token/s so với 4.737,5 và 140,9, và nhanh hơn ở mọi điểm đo: 1,12–1,42x cho prefill, 1,31–1,37x cho decode. Kiểm tra teacher-forced trên 192 vị trí cho thấy độ perplexity của Lily cao hơn 0,04%, với cùng token xếp hạng cao nhất đạt 96,35% thời gian.
Những điểm chính cần lưu ý
Xem chi tiết kỹ thuật tại đây và GitHub Repo tại đây. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi cũng như đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người đọc.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.