Ollaya là công cụ mã nguồn mở cho phép chạy các mô hình quyết định cục bộ với tốc độ phản hồi tính bằng mili giây. Nó hỗ trợ các mô hình mở như laya, decider và tương thích hoàn toàn với TypeSafe API cùng Python SDK 0.7.1.
You can now train and run 500+ models locally with our Unsloth Docker image! 🐳 Use our new GUI or …
DịchUnsloth vừa phát hành Docker image và giao diện Desktop mới, cho phép người dùng huấn luyện và chạy hơn 500 mô hình AI cục bộ mà không cần cấu hình phức tạp, hỗ trợ cả GPU NVIDIA và AMD.
Vì sao đáng đọc: Đây là bước tiến quan trọng giúp đơn giản hóa quy trình huấn luyện AI cho người dùng cá nhân và doanh nghiệp, tối ưu hóa hiệu suất phần cứng đáng kể.
Local inference + tool calling + clinical workflows on a Mac. This is the kind of small-model deploy…
DịchMiniCPM5-2B kết hợp cùng OpenMed cho phép thực hiện suy luận cục bộ trên Mac, từ việc ẩn danh tính bệnh nhân đến trích xuất dữ liệu và tự động soạn thảo báo cáo y tế có nguồn dẫn chứng.
"your backpack is open" yes im running 100 agents by sharing internet from my phone to the macbook …
DịchMột người dùng đã chia sẻ trải nghiệm chạy đồng thời 100 AI Agent trên chiếc MacBook Max đặt trong ba lô, kết nối qua mạng di động. Đây là minh chứng thú vị về khả năng xử lý đa nhiệm của phần cứng hiện đại đối với các hệ thống AI phân tán.
The casting is now 100% accurate 🫡 Made by @cocktailpeanut on his own PC - Viggle-Animate, fully l…
DịchViggle vừa phát hành trọng số của mô hình Viggle-Animate, cho phép người dùng tự cài đặt và vận hành cục bộ trên máy tính cá nhân. Mô hình hiện đã có sẵn trên Hugging Face để cộng đồng tải về và trải nghiệm.
Portable Computer is now available on Linux for @NVIDIA RTX GPUs with 24GB of VRAM or higher.
DịchPerplexity ra mắt phiên bản Portable Computer cho Linux, cho phép vận hành toàn bộ mô hình LLM và tác nhân AI cục bộ trên phần cứng NVIDIA RTX có VRAM từ 24GB trở lên mà không cần kết nối đám mây.
Hướng dẫn chi tiết cách chạy các mô hình LLM cục bộ trên Mac mini M4 Pro 48GB RAM, kết hợp dịch vụ oMLX và Tailscale để đồng bộ hóa trải nghiệm AI trên nhiều thiết bị Apple.
Hugging Face vừa phát hành bộ thư viện @huggingface/kernels với 207 nhân WebGPU, giúp tối ưu hóa hiệu suất chạy các mô hình AI cục bộ trực tiếp trên trình duyệt web.
Vì sao đáng đọc: Đây là bước tiến quan trọng cho cộng đồng WebAI, giúp các nhà phát triển dễ dàng tích hợp AI hiệu năng cao vào ứng dụng web mà không cần server.
stop building cloud agents start building loud agents
DịchChuyên gia từ HumanLayer khuyến nghị các nhà phát triển nên ưu tiên xây dựng AI Agent chạy trực tiếp trên thiết bị thay vì phụ thuộc vào hạ tầng đám mây để tối ưu hóa quyền riêng tư và hiệu suất.
Quick reminder: in 4 hours you will be able to download and run sota AI. If you have enough compute …
DịchChỉ trong vài giờ tới, người dùng có đủ phần cứng sẽ có thể tải xuống và vận hành trực tiếp các mô hình AI đạt chuẩn SOTA (State-of-the-art) ngay trên thiết bị của mình.
Can't wait to have always-on agents running locally 24x7. Local agents are something Perplexity seem…
DịchPerplexity giới thiệu Portable Computer, nền tảng tối ưu hóa cho AI Agent chạy cục bộ trên phần cứng NVIDIA DGX Spark, giúp thiết lập suy luận AI nhanh chóng và bảo mật hơn.
2026 is shaping up to be a landmark year for open and local AI. -Zai says GLM-5.3, improved entirel…
DịchNăm 2026 đánh dấu bước ngoặt lớn với sự trỗi dậy của các mô hình mã nguồn mở mạnh mẽ như GLM-5.3 và Qwen3.8-27B, cùng mức giá API cực rẻ từ DeepSeek V4, giúp AI cục bộ trở nên phổ biến và hiệu quả hơn bao giờ hết.
Local AI is exploding! Transformers.js, that we've been building @huggingface for the past three ye…
DịchThư viện Transformers.js của Hugging Face đang dẫn đầu xu hướng chạy AI trên trình duyệt với mức tăng trưởng gấp 10 lần trong nửa năm. Khả năng bảo mật tuyệt đối và miễn phí giúp công nghệ này trở thành giải pháp thay thế quan trọng trước tình trạng thiếu hụt tài nguyên tính toán.