26/09

Thứ Bảy · 1 tin

23/09

Thứ Tư · 1 tin
vLLM Blog chính thức
Sản phẩmĐiểm AI 73/100

Tinh chọnvLLM ra mắt vllm-metal v0.28.0: Hỗ trợ phục vụ suy luận đồng thời trên Apple Silicon

vLLM chính thức phát hành vllm-metal v0.28.0, mang bộ lập lịch V1, paged KV cache và server tương thích OpenAI lên chip Apple Silicon thông qua MLX và Metal.


Vì sao đáng đọc: Lần đầu tiên chính thức phát hành vllm-metal, sử dụng packed varlen attention và paged KV để giải quyết vấn đề dịch vụ yêu cầu đồng thời trên Mac, đồng thời cung cấp dữ liệu chuẩn mực đồng thời có thể tái lập.

22/09

Thứ Ba · 3 tin
ModelBest OpenBMB@OpenBMB
Hướng dẫnĐiểm AI 52/100

VoxWeft: Hệ thống thông dịch trực tiếp mã nguồn mở chạy cục bộ trên Apple Silicon

🎙️ Real-time interpretation, powered locally by VoxCPM2. Developer @HenryZ30734018 built VoxWeft, …

DịchDựa trên VoxCPM2, VoxWeft cho phép thực hiện thông dịch giọng nói thời gian thực ngay trên thiết bị Apple Silicon mà không cần gửi dữ liệu ra ngoài, đảm bảo quyền riêng tư tuyệt đối.

21/09

Thứ Hai · 2 tin

16/09

Thứ Tư · 1 tin

12/09

Thứ Bảy · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 52/100

Giải mã Apple Neural Engine: Phân tích kiến trúc M1 và lý do NPU dần thoái trào

Tác giả thực hiện kỹ thuật đảo ngược Apple Neural Engine trên chip M1, khám phá chi tiết cấu trúc 16 nhân tính toán và hệ thống điều phối tác vụ, từ đó đưa ra góc nhìn chuyên sâu về sự thay đổi của công nghệ NPU.

09/09

Thứ Tư · 1 tin

03/09

Thứ Năm · 5 tin
Aravind Srinivas (Perplexity CEO)@AravSrinivas
Sản phẩmĐiểm AI 60/100

Perplexity ra mắt Lily: Công cụ suy luận cục bộ tối ưu cho Mac

We're open-sourcing Lily, Perplexity's local inference engine for serving models locally on Apple Si…

DịchPerplexity vừa mã nguồn mở Lily, công cụ suy luận được tối ưu hóa cho chip Apple Silicon để chạy mô hình Qwen3.6-35B-A3B, giúp tăng tốc các tác vụ tính toán hỗn hợp trên Mac mà không phụ thuộc vào điện toán đám mây.

Thêm 1 nguồn khác đưa tinMarkTechPost
Perplexity@perplexity_ai
Sản phẩmĐiểm AI 59/100

Perplexity ra mắt Lily: Công cụ suy luận cục bộ tối ưu cho chip Apple Silicon

Today we're open-sourcing Lily, the local inference engine we built for hybrid compute in Perplexity…

DịchPerplexity vừa mã nguồn mở Lily, công cụ suy luận được tối ưu hóa đặc biệt cho mô hình Qwen3.6-35B-A3B trên chip Apple Silicon, giúp tăng tốc xử lý tác vụ trực tiếp trên thiết bị mà không bị nghẽn hiệu năng.

Sky Computing Lab@haoailab
Sản phẩmĐiểm AI 54/100

FastVideo nâng cấp FastH3: Hỗ trợ NVIDIA DGX Spark và Apple Silicon với tốc độ nhanh gấp 8 lần

(1/7) Last week FastVideo released FastH3. Today we bring it local: @NVIDIA DGX Spark 💚 and @Apple …

DịchFastVideo vừa cập nhật FastH3, cho phép chạy mô hình tạo video cục bộ trên NVIDIA DGX Spark và chip Apple Silicon (qua MLX) với hiệu suất nhanh gấp 8 lần so với MiniMax H3 tiêu chuẩn.

Thêm 1 nguồn khác đưa tinX: MiniMax (@MiniMax_AI)

02/09

Thứ Tư · 1 tin

28/08

Thứ Sáu · 1 tin
ModelBest OpenBMB@OpenBMB
Mô hìnhĐiểm AI 49/100

MiniCPM-o 4.5 đã hỗ trợ chạy mượt mà trên chip Apple Silicon nhờ TyloQuant MFQ

MiniCPM-o 4.5 now runs efficiently on Apple Silicon with TyloQuant MFQ! 🥰 The team at @Tylogi_ai h…

DịchMô hình MiniCPM-o 4.5 hiện đã có thể chạy cục bộ trên chip Apple Silicon thông qua kỹ thuật lượng tử hóa TyloQuant MFQ, giúp tối ưu bộ nhớ mà vẫn giữ nguyên khả năng xử lý đa phương thức và tương tác thời gian thực.

21/08

Thứ Sáu · 1 tin
Kim@kimmonismus
Hướng dẫnĐiểm AI 33/100

Chiến lược AI của Apple: Kẻ bán cuốc trong cơn sốt thay vì chạy đua mô hình

While Apple does not appear to be competing to build the world's leading standalone frontier AI mode…

DịchApple chọn tập trung vào thế mạnh phần cứng thay vì cạnh tranh mô hình AI tiên phong. Tác giả kỳ vọng vào sự kiện sắp tới và vai trò của John Ternus trong việc thúc đẩy hệ sinh thái Apple Silicon.

20/08

Thứ Năm · 2 tin
Sky Computing Lab@haoailab
Sản phẩmĐiểm AI 71/100

Tinh chọnFastMetal: Tạo video ngay trên Mac chỉ trong 30 giây mà không cần GPU rời

A 5-second 480P video, generated entirely on a Mac, in 30 seconds. No CUDA, no cloud, 3.9 GiB of mem…

DịchFastMetal mang mô hình FastWan-QAD lên chip Apple Silicon, cho phép tạo video 480P chỉ trong 30 giây với 3.9GB RAM mà không cần CUDA hay điện toán đám mây.


Vì sao đáng đọc: Công nghệ đột phá cho người dùng Mac, tối ưu hóa hiệu suất cực tốt trên phần cứng Apple Silicon mà không phụ thuộc vào cloud.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Sản phẩmĐiểm AI 36/100

MicroGPT viết bằng C thuần đạt tốc độ 10 triệu token/giây trên Apple M5 Pro

Dự án microGPT-C tối ưu hóa bằng NEON đạt tốc độ suy luận ấn tượng 10,16 triệu token/giây. Với chỉ 4.192 tham số, mô hình này vượt trội hơn các mô hình nội suy truyền thống trong việc dự đoán tên gọi mà không cần phụ thuộc vào thư viện bên ngoài.

19/08

Thứ Tư · 1 tin
Kim@kimmonismus
Mô hìnhĐiểm AI 44/100

Phiên bản Qwen3.8-27B 'không kiểm duyệt' đã có thể chạy cục bộ trên chip Apple Silicon

A "refusal-removed" version of Qwen3.8-27B can now run locally on Apple Silicon. Even its creators …

DịchMô hình Qwen3.8-27B bản gỡ bỏ kiểm duyệt đã xuất hiện trên Apple Silicon, hỗ trợ cửa sổ ngữ cảnh 262K token. Người tạo cảnh báo mô hình có thể phản hồi các yêu cầu độc hại mà không bị từ chối.

18/08

Thứ Ba · 2 tin
fofr@fofrAI
Hướng dẫnĐiểm AI 28/100

TypeGPU gây ấn tượng với khả năng suy luận mô hình độ sâu đơn mắt thời gian thực

Incredible stuff. Now I need a Navi fairy companion version.

DịchChuyên gia fofr đánh giá cao TypeGPU khi chạy mô hình độ sâu 448x448 trên chip M4 Pro chỉ trong 8ms. Giải pháp này tối ưu hóa hiệu suất bằng cách hợp nhất quy trình suy luận, chiếu sáng và kết xuất vào cùng một bộ mã hóa lệnh mà không cần đồng bộ GPU.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Tối ưu hóa Nanbeige4.2-3B trên Apple Silicon: Khắc phục lỗi triển khai và giảm tải bộ nhớ

Bài viết phân tích cách khắc phục các lỗi kỹ thuật khi chạy mô hình Nanbeige4.2-3B trên Apple Silicon và giới thiệu chiến lược 'chunked-prefill' giúp tăng gấp 2.7 lần độ dài ngữ cảnh bằng cách giảm tải bộ nhớ cho kiến trúc Looped Transformer.

15/08

Thứ Bảy · 1 tin
Qwen@Alibaba_Qwen
Sản phẩmĐiểm AI 38/100

Qwen3.8-27B cập bến Ollama: Hỗ trợ gọi công cụ đa năng, tối ưu cho Apple Silicon

Qwen3.8-27B is available on @ollama! Any harness you run, the model always delivers. Let's code toge…

DịchMô hình mã nguồn mở Qwen3.8-27B đã có mặt trên Ollama, nổi bật với khả năng xử lý tác vụ thông minh và tích hợp mượt mà với các công cụ như Claude Code hay Hermes Agent.

Tổng 24 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (45 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Apple Silicon” | AIHOT.vn