Tại Snapdragon Summit 2026, Qualcomm và PrismML đã giới thiệu mô hình Bonsai 1.7B sử dụng lượng tử hóa 1-bit, cho phép chạy mượt mà trên kính thông minh Snapdragon AR1 Gen 1 với mức tiêu thụ bộ nhớ chỉ bằng 1/4 so với chuẩn 4-bit truyền thống.
Google cập nhật Antigravity SDK, hỗ trợ chạy mô hình Gemma 4 26B A4B thông qua LiteRT của Google AI Edge. Người dùng có thể vận hành các tác nhân AI hoàn toàn ngoại tuyến trên thiết bị có VRAM hoặc bộ nhớ thống nhất trên 24GB.
Vì sao đáng đọc: Nhà phát hành đã công bố hỗ trợ mô hình cục bộ và ví dụ về điều phối hỗn hợp, cung cấp mã nguồn, yêu cầu phần cứng và dữ liệu token cụ thể, giúp các nhà phát triển đánh giá tính khả thi của quy trình làm việc cho tác nhân ngoại tuyến.
This is awesome! Running the whole perception stack with a Pi Zero feeding MiniCPM-o4.5 in real time…
DịchDự án thú vị kết hợp Raspberry Pi Zero với mô hình MiniCPM-o 4.5 để tạo ra hệ thống tương tác robot thời gian thực, xử lý âm thanh và hình ảnh hoàn toàn cục bộ mà không cần kết nối đám mây.
Bà Trần Thị Bảo Trân phân tích cách Edge AI giúp doanh nghiệp bán lẻ chuyển đổi từ việc thu thập dữ liệu thụ động sang đưa ra các quyết định hành động tức thời ngay tại cửa hàng và kho bãi.
Startup Thụy Điển Scaleout Systems, được NATO hỗ trợ, đã phát triển thành công giải pháp AI biên cho drone, cho phép tự động nhận diện và tấn công mục tiêu mà không cần kết nối máy chủ trung tâm.
Who need words any more Words are just human kludge AI don't need no words
DịchCactus Compute vừa trình làng Needle 3, mô hình nền tảng tự động hóa với dung lượng chỉ từ 8-29MB nhưng sở hữu khả năng gọi hàm thuần túy, được kỳ vọng cạnh tranh trực tiếp với DeepSeek V4 Flash.
Edge0 giới thiệu cơ chế dự đoán lộ trình (prerouter) giúp nạp trước dữ liệu chuyên gia từ SSD, loại bỏ độ trễ khi suy luận các mô hình MoE lớn trên phần cứng hạn chế.
Sử dụng TensorRT Edge-LLM, Jetson AGX Thor chạy mô hình Qwen3.6-27B với tốc độ 52,33 tokens/s, hoàn thành bài kiểm tra MLPerf Edge Agentic nhanh gấp 6,4 lần so với phương pháp truyền thống.
Dự án kết hợp Raspberry Pi, mô hình Gemma 4 chạy cục bộ và Gemini Flash trên đám mây để tạo ra robot để bàn DinoDesk AI với kiến trúc xử lý lai linh hoạt.
Transcend vừa giới thiệu dòng RAM công nghiệp DDR5-6400 với dung lượng lên tới 64GB mỗi thanh, tích hợp chip CKD và các tính năng bảo vệ điện áp cao cấp, tối ưu cho các hệ thống AI biên và tự động hóa công nghiệp.
Analog Devices chi 1,35 tỷ USD mua lại Alif Semiconductor nhằm tăng cường khả năng xử lý AI trực tiếp trên thiết bị (Edge AI), hiện thực hóa chiến lược "trí tuệ vật lý" thay vì phụ thuộc vào đám mây.
DịchMiniCPM5-1B được đánh giá hiệu quả trên nhiều ngôn ngữ Tây Ban Nha và tối ưu hóa thành mô hình 1.1GB, cho phép chạy offline mượt mà trên Android, iOS và các thiết bị IoT.
DFI vừa giới thiệu dòng bo mạch chủ Mini-ITX ARH171/ARH173 với kiến trúc 'một bo mạch, hai thế hệ', hỗ trợ 16 mẫu chip di động của Intel. Sản phẩm tối ưu cho các tác vụ AI tại biên, sở hữu khả năng kết nối đa dạng và độ bền cao trong môi trường công nghiệp.
Absolutely beautiful new paper from Stanford Univ + Together AI "Intelligence per Watt: Measuring …
DịchCác nhà nghiên cứu từ Stanford và Together AI giới thiệu chỉ số IPW (Intelligence per Watt), giúp đánh giá hiệu quả của AI cục bộ bằng cách so sánh độ chính xác của tác vụ với mức tiêu thụ điện năng.
Desert Ant Labs vừa công bố 18 mô hình AI nhỏ gọn cho thiết bị di động, hỗ trợ xử lý âm thanh, hình ảnh và văn bản thông qua bộ SDK thống nhất trên Swift, Kotlin và JavaScript.
LattePanda vừa giới thiệu module tính toán Mu Ultra trang bị bộ vi xử lý Intel Core Ultra 200V, tích hợp RAM LPDDR5X và hỗ trợ đa dạng cổng kết nối, hướng tới các ứng dụng nhúng hiệu năng cao với giá khởi điểm 599 USD.
Ant Group gợi mở tiềm năng của việc triển khai các mô hình AI chuyên biệt (domain-enhanced) trực tiếp trên thiết bị đầu cuối, mở ra nhiều kịch bản ứng dụng thực tế đầy thú vị trong lĩnh vực định lượng.
A 753B model reads the problem: A 4B model writes the answer. Mostik reports that its latent bridge…
DịchMostik giới thiệu giao thức cầu nối không gian ẩn cho phép mô hình 4B nhận dữ liệu trực tiếp từ mô hình 753B mà không cần tinh chỉnh. Giải pháp này giúp tăng tốc độ xử lý gấp 20 lần và tiết kiệm 2,5 lần tài nguyên tính toán trong khi vẫn duy trì 80% độ chính xác của mô hình lớn.
Even at only $399, Microduck's onboard compute is powerful enough to run some pretty amazing TUIs di…
DịchThomas Wolf vừa giới thiệu Microduck, mẫu robot giá rẻ 399 USD có khả năng chạy giao diện TUI và xử lý dữ liệu cảm biến, LiDAR trực tiếp trên thiết bị mà không cần phụ thuộc vào đám mây.
Baidu Cloud giới thiệu thiết bị tích hợp AI sử dụng mô hình đa phương thức 40B, kết hợp quy trình kiểm tra hai lớp để đạt độ chính xác trên 95% trong việc phát hiện sự cố giao thông.
Arduino, công ty con của Qualcomm, đã mở cổng đặt trước cho nền tảng AI biên VENTUNO Q với mức giá 299 USD, hứa hẹn mang sức mạnh xử lý AI chuyên sâu lên các thiết bị nhỏ gọn.
Apple ra mắt Mac mini siêu nhỏ gọn với hiệu năng mạnh mẽ, đánh dấu bước ngoặt cho các thiết bị AI cục bộ luôn sẵn sàng, hiệu suất cao và tiết kiệm điện.
In a compute and power-constrained world, a good chunk of agentic inference needs to move to local h…
DịchPerplexity vừa giới thiệu Portable Computer, phiên bản chạy cục bộ trên phần cứng NVIDIA DGX Spark, cho phép vận hành các LLM và AI Agent mà không cần kết nối đám mây, tối ưu cho môi trường hạn chế về tài nguyên.
Intel ra mắt giải pháp Edge AI toàn diện cho doanh nghiệp. Với vị thế sở hữu nhà máy lắp ráp lớn nhất thế giới tại TP.HCM, Việt Nam đứng trước cơ hội chiến lược để tham gia sâu hơn vào chuỗi giá trị AI toàn cầu.
FreeToken là hệ thống phục vụ mô hình MoE thế hệ mới, cho phép chạy linh hoạt trên các thiết bị cá nhân bằng cách tự động điều phối tài nguyên CPU-GPU theo thời gian thực thay vì phụ thuộc vào hạ tầng máy chủ.
Cactus Compute ra mắt Needle 2, mô hình AI chuyên về gọi công cụ với dung lượng chỉ 14MB, cho phép chạy mượt mà trên các thiết bị hạn chế tài nguyên với mức tiêu thụ RAM cực thấp.
Liquid AI ra mắt mô hình LFM2.5-VL-3B, tối ưu hóa khả năng xử lý thị giác cho các thiết bị biên với tốc độ vượt trội và hiệu suất cao, mở ra tiềm năng ứng dụng thực tế rộng rãi.