Bằng cách tinh gọn bộ công cụ xuống còn 11 chức năng cơ bản và tích hợp MiniCPM XML tool adapter, MiniCPM5-2B đã khắc phục lỗi sai lệch lệnh, cho phép chạy mượt mà trên thiết bị cá nhân và giải thành công đề toán cao cấp.
vLLM chính thức phát hành vllm-metal v0.28.0, mang bộ lập lịch V1, paged KV cache và server tương thích OpenAI lên chip Apple Silicon thông qua MLX và Metal.
Vì sao đáng đọc: Lần đầu tiên chính thức phát hành vllm-metal, sử dụng packed varlen attention và paged KV để giải quyết vấn đề dịch vụ yêu cầu đồng thời trên Mac, đồng thời cung cấp dữ liệu chuẩn mực đồng thời có thể tái lập.
Jun Kim, cha đẻ của oMLX, đã gia nhập Hugging Face để phát triển toàn thời gian dự án này. oMLX sẽ tiếp tục là mã nguồn mở, đóng vai trò là cầu nối quan trọng giúp các mô hình Transformers sớm được tối ưu hóa cho chip Apple Silicon.
Phiên bản Laya-mlx được tối ưu trên framework MLX giúp tăng tốc độ xử lý gấp 50 lần so với Jev, chỉ chiếm tối đa 1GB RAM. Mô hình này hiện có thể điều khiển game Rắn săn mồi ngay trên chip M3 Max với tốc độ 60 khung hình/giây.
Dự án Qwen-2.5-1B-RLCD sử dụng framework MLX để trích xuất JSON trong một lần truyền duy nhất, giúp giảm đáng kể độ trễ suy luận trên thiết bị. Giải pháp này tối ưu cho các tác vụ phân loại và trích xuất dữ liệu cố định.
Interesting new on-device local AI agentic system - seems to be running an open-weights 4B model qua…
DịchThomas Wolf chia sẻ về một hệ thống AI Agent chạy cục bộ đầy hứa hẹn, dường như đang vận hành mô hình mã nguồn mở 4B đã được lượng tử hóa 4-bit thông qua framework MLX.
Karminski công bố bảng xếp hạng khả năng làm Agent của các mô hình nhỏ, trong đó Qwen3.8-27B-UD-Q4_K_XL được đánh giá cao nhất. Bài viết cũng chia sẻ cấu hình tối ưu cho lập luận và lập trình, cùng lời khuyên sử dụng MLX cho người dùng Mac để đạt tốc độ tốt hơn.
A 5-second 480P video, generated entirely on a Mac, in 30 seconds. No CUDA, no cloud, 3.9 GiB of mem…
DịchFastMetal mang mô hình FastWan-QAD lên chip Apple Silicon, cho phép tạo video 480P chỉ trong 30 giây với 3.9GB RAM mà không cần CUDA hay điện toán đám mây.