Google Developers Blog
85

Sản phẩm

Làm chủ Edge AI trên Raspberry Pi với LiteRT và Gemma

(giờ Việt Nam)

Tóm tắt AI

Khám phá cách triển khai mô hình Gemma nhẹ trên Raspberry Pi bằng LiteRT để tối ưu hiệu suất, giúp thực hiện suy luận AI thời gian thực ngay tại biên mà không cần kết nối đám mây.

Bản dịch AI

Mastering Edge AI on Raspberry Pi with LiteRT and Gemma

11 THÁNG 8, 2026

Hãy tưởng tượng việc chế tạo một robot tự hành hoàn toàn có khả năng nhìn, nghe và phản ứng với môi trường theo thời gian thực, hoạt động hoàn toàn ngoại tuyến trên một thiết bị nhỏ gọn như Raspberry Pi. Edge AI chính là chìa khóa mở ra khả năng tự chủ đó. Nó cho phép các nhà phát triển xây dựng các hệ thống bảo mật cao và khép kín như robot thông minh và các tác nhân AI cục bộ mà không cần phụ thuộc vào đám mây, với độ trễ cực thấp và quyền riêng tư dữ liệu tuyệt đối.

Chúng tôi đã giúp việc chạy Edge AI trên Raspberry Pi trở nên dễ dàng với LiteRT của Google AI Edge, một runtime suy luận trên thiết bị hiệu năng cao đã được kiểm chứng trong thực tế. LiteRT cho phép bạn triển khai liền mạch mọi thứ, từ các mô hình ML cổ điển đến các LLM hiện đại nhất ngay lập tức trên nhiều nền tảng. Bằng cách cung cấp khả năng thực thi được tối ưu hóa và sử dụng bộ nhớ siêu hiệu quả trên cả CPU và GPU, LiteRT giúp tối đa hóa tiềm năng tính toán của Raspberry Pi.

Rất tiếc, trình duyệt của bạn không hỗ trợ phát video này.

Reachy Mini phản ứng với các câu trả lời và chuyển động, được vận hành bởi Gemma và LiteRT trên Raspberry Pi 5.

Sự kết hợp giữa phần cứng và phần mềm này tỏa sáng nhất khi đi kèm với Gemma, dòng mô hình mở gọn nhẹ của Google. Để cho bạn thấy những gì có thể thực hiện được, chúng tôi sẽ trình diễn cách Gemma và LiteRT trên Raspberry Pi 5 có thể vận hành robot Reachy Mini để nhận diện và phản ứng với môi trường hoàn toàn cục bộ theo thời gian thực. Hãy đọc tiếp để bắt đầu triển khai dự án của riêng bạn.

Khám phá khả năng tác nhân (Agentic Capability) của Gemma

Các mô hình Gemma rất phù hợp để xây dựng các tác nhân tự hành, camera thông minh và robot xã hội có khả năng suy luận và thực hiện các quy trình làm việc phức tạp, đa bước trực tiếp trên Raspberry Pi của bạn. Để đáp ứng các hạn chế phần cứng khác nhau, dòng mô hình Gemma cung cấp một số tùy chọn hiệu quả cao:

Hiệu năng của Gemma trên CPU Raspberry Pi

Thông qua LiteRT-LM, một lớp điều phối chuyên dụng nằm trên LiteRT, các nhà phát triển có thể triển khai Gemma một cách liền mạch ngay lập tức. Về cơ bản, khả năng tăng tốc CPU tinh vi thông qua LiteRT và XNNPACK đảm bảo dòng mô hình Gemma được tối ưu hóa cao về hiệu quả tài nguyên và thực thi độ trễ thấp trực tiếp trên Raspberry Pi.

Gemma4-perf

Trên Raspberry Pi 5, LiteRT-LM mang lại hiệu năng mạnh mẽ cho Gemma 4 E2B, đạt 99 token/giây cho giai đoạn prefill và 9 token/giây cho giai đoạn decode, trong khi vẫn duy trì mức tiêu thụ bộ nhớ đỉnh cực thấp chỉ 1432 MB. Điều này mang trí tuệ đa năng, phản hồi nhanh nhạy của Gemma đến với Raspberry Pi.

Nhờ bộ tokenizer hiệu quả cao của Gemma 4 E2B, giúp nén nhiều văn bản hơn vào ít token hơn (trung bình ~4,2 ký tự mỗi token), LiteRT-LM đạt tốc độ tạo văn bản end-to-end ấn tượng là ~27,3 ký tự mỗi giây, tương đương khoảng 300 từ mỗi phút (wpm) trong bản demo giọng nói của Reachy Mini. Thông lượng này giúp Gemma 4 E2B trở nên tuyệt vời cho các tác vụ giọng nói và dịch thuật thời gian thực, cung cấp văn bản với tốc độ gấp đôi tốc độ nói bình thường của con người (~150 wpm).

Khám phá thêm các mô hình mở sẵn sàng sử dụng để chạy trên Raspberry Pi từ Cộng đồng LiteRT trên Hugging Face.

Thực thi trên GPU Raspberry Pi với LiteRT

Trên Raspberry Pi 5, CPU ARM Cortex-A76 lõi tứ là một cỗ máy tính toán thô mạnh mẽ, cung cấp ~153,6 GFLOPS (FP32) và lên tới ~2,0 TOPS (INT8). Để so sánh, GPU Broadcom VideoCore VII tích hợp có xung nhịp 800 MHz và cung cấp đỉnh điểm ~76,8 GFLOPS (FP32) và ~0,24 TOPS (INT8).

Mặc dù CPU có lợi thế về công suất lớn, GPU lại giới thiệu khả năng thực thi song song không đồng nhất, một mô hình quan trọng cho các ứng dụng biên thời gian thực. Thay vì làm quá tải CPU, các nhà phát triển có thể phân bổ tác vụ trên cả hai bộ xử lý để tối ưu hóa hiệu suất hệ thống và nhiệt độ tổng thể. Ví dụ, bằng cách chuyển các mô hình thị giác hoặc âm thanh liên tục sang GPU VideoCore VII, nó sẽ bảo toàn các chu kỳ CPU ưu tiên cao cho việc giám sát hệ thống tổng thể, điều phối đường ống (pipeline) hoặc suy luận LLM đòi hỏi tính toán cao.

Do đó, chúng tôi đã kích hoạt suy luận GPU trên Raspberry Pi với backend WebGPU (Vulkan) của LiteRT thông qua ML Drift. Sự tích hợp này cho phép bạn chạy nhiều loại mô hình thị giác máy tính, âm thanh và embedding trực tiếp từ Cộng đồng LiteRT trên Hugging Face, bao gồm hỗ trợ liền mạch cho các mô hình MediaPipe phổ biến, mô hình Ultralytics YOLO, Moonshine và nhiều hơn nữa.

Rất tiếc, trình duyệt của bạn không hỗ trợ phát video này.

Phát hiện đối tượng thời gian thực với mô hình Ultralytics YOLO26n chạy trên Raspberry Pi 5 với LiteRT. Bắt đầu với mã mẫu từ hướng dẫn YOLO.

Bảng dưới đây minh họa độ trễ CPU và GPU khi chạy các mô hình thị giác máy tính và âm thanh cổ điển thông qua LiteRT:

classic model perf

Tìm hiểu sâu: Pipeline của Reachy Mini được vận hành bởi LiteRT

Pipeline của Reachy Mini là một minh chứng mạnh mẽ cho suy luận Edge AI thời gian thực, độ trễ thấp chạy hoàn toàn trên Raspberry Pi 5. Bằng cách tận dụng LiteRT, hệ thống chia nhỏ các khối lượng công việc thị giác và ngôn ngữ chuyên sâu thành một kiến trúc xử lý kép đồng thời trên cả CPU và GPU.

Reachy pipeline

Đây là cách kiến trúc song song hoạt động để đảm bảo các tương tác liền mạch:

Xem mã nguồn đầy đủ của bản demo Reachy trong kho lưu trữ Github của LiteRT Samples.

Lập trình tác nhân (Agentic Coding) với LiteRT trên Raspberry Pi

LiteRT cung cấp một bộ công cụ toàn diện bao gồm toàn bộ chu kỳ phát triển: chuyển đổi, lượng tử hóa, đánh giá hiệu năng (benchmark) và suy luận. Để thiết lập nhanh chóng, không ma sát, cách tiếp cận đơn giản nhất là sử dụng công cụ CLI của LiteRT. Thay vì yêu cầu các nhà phát triển hoặc tác nhân lập trình phải quản lý thủ công nhiều thư viện độc lập, LiteRT CLI tổng hợp các quy trình làm việc biên cốt lõi thành một bộ lệnh thống nhất.

Rất tiếc, trình duyệt của bạn không hỗ trợ phát video này.

Hợp lý hóa chu kỳ phát triển của bạn với LiteRT CLI: chuyển đổi, lượng tử hóa, đánh giá hiệu năng và suy luận.

Giờ đây, bạn có thể tăng tốc chu kỳ phát triển của mình bằng cách thêm kỹ năng LiteRT CLI và các kỹ năng LiteRT nâng cao khác vào tác nhân lập trình AI của bạn, chẳng hạn như Google Antigravity. Điều này trao quyền cho các tác nhân tự động điều phối và thực hiện các quy trình học máy phức tạp, đa giai đoạn thay cho bạn. Ví dụ, bạn có thể dễ dàng tự xây dựng trình dịch giọng nói hoàn toàn ngoại tuyến trên Raspberry Pi, giống như Gemma Translator được hiển thị bên dưới.

Khám phá chi tiết triển khai đầy đủ trong kho lưu trữ GitHub của Gemma Translator.

Dung lượng nhị phân siêu gọn cho các thiết bị IoT

Đối với các thiết bị IoT bị hạn chế về tài nguyên, việc giảm thiểu chi phí lưu trữ và bộ nhớ là rất quan trọng. Nếu không có tối ưu hóa đặc biệt, các runtime AI thông thường thường đi kèm với các phụ thuộc nặng nề từ máy tính để bàn hoặc máy chủ. Ngược lại, LiteRT được thiết kế đặc biệt để triển khai trên thiết bị, duy trì một bản phân phối cực kỳ gọn nhẹ và mô-đun.

Bảng dưới đây so sánh dung lượng tải xuống cần thiết để chạy suy luận LLM trên Raspberry Pi (ARM64 Linux).

LiteRT_CLI vs Ollama

Chạy mô hình đầu tiên của bạn

Bạn có thể cài đặt LiteRT CLI và chạy mô hình đầu tiên của mình trên Raspberry Pi 5 chỉ với vài lệnh đơn giản.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google Developers Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.