Sản phẩm
Antigravity SDK bổ sung hỗ trợ mô hình AI cục bộ, cho phép chạy tác nhân hoàn toàn offline
(giờ Việt Nam)
Tóm tắt AI
Google cập nhật Antigravity SDK, hỗ trợ chạy mô hình Gemma 4 26B A4B thông qua LiteRT của Google AI Edge. Người dùng có thể vận hành các tác nhân AI hoàn toàn ngoại tuyến trên thiết bị có VRAM hoặc bộ nhớ thống nhất trên 24GB.
Chính văn · Bản dịch AI

23 THÁNG 9, 2026
Hôm nay, chúng tôi thông báo rằng Antigravity SDK hỗ trợ các quy trình làm việc cục bộ trên nhiều loại mô hình và tùy chọn thực thi khác nhau, với sự hỗ trợ ban đầu cho Gemma 4 26B A4B sử dụng LiteRT của Google AI Edge.
Antigravity SDK cho phép các nhà phát triển xây dựng ứng dụng với cùng các khả năng tác nhân (agentic) cung cấp sức mạnh cho Google Antigravity. Với sự hỗ trợ mới này, bạn có thể kích hoạt hỗ trợ tác nhân thông qua các mô hình cục bộ hoàn toàn ngoại tuyến. Chúng tôi đã tối ưu hóa quy trình này cho LiteRT và Gemma 4 26B, sử dụng hiệu quả GPU và RAM cục bộ để tăng cường hơn nữa khả năng xử lý của máy tính cá nhân!
Tại sao nên chạy các tác nhân cục bộ?
Việc thực thi mô hình cục bộ mang lại một số lợi thế cho trải nghiệm tác nhân:
- Hiệu quả chi phí: Thực thi các quy trình tác nhân cục bộ mà không tốn phí API hoặc bị giới hạn tốc độ.
- Quyền riêng tư: Giữ mã nguồn và các yêu cầu hoàn toàn trên máy cục bộ của bạn, lý tưởng cho các nhà phát triển đang xử lý các yêu cầu nghiêm ngặt về quyền riêng tư dữ liệu hoặc môi trường doanh nghiệp bị hạn chế về tuân thủ.
- Khả năng phục hồi ngoại tuyến: Thực thi các quy trình tác nhân của bạn một cách liền mạch, ngay cả trong môi trường không có kết nối internet ổn định hoặc liên tục.
- Quy trình làm việc kết hợp (Hybrid): Kết hợp các quy trình cục bộ tiết kiệm token với các quy trình dựa trên đám mây để tối đa hóa hiệu quả, đồng thời vẫn giữ quyền truy cập vào các mô hình lớn hơn, mạnh mẽ hơn khi cần.
Dưới đây là cách bạn có thể bắt đầu: (Chúng tôi khuyến nghị sử dụng máy có VRAM hoặc bộ nhớ hợp nhất >24GB).
Tạo môi trường ảo:
python3 -m venv .venv
source .venv/bin/activatePython
Đã sao chép
Cài đặt Antigravity SDK và LiteRT-LM, sau đó tải xuống Gemma 4 26B A4B:
pip install google-antigravity litert-lm
litert-lm import \
--from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \
gemma-4-26B-A4B-it-gpu.litertlm \
gemma4-26bPython
Đã sao chép
Trong thư mục của bạn, hãy tạo một tệp có tên agy_sample.py. Dán nội dung sau vào đó.
import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy
# UPDATE: Point to the locally downloaded model from the previous step (litert-lm import ...)
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")
async def main():
print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")
config = LiteRTAgentConfig(model_path=MODEL_PATH).lightweight()
async with Agent(config) as agent:
response = await agent.chat("What files are in the current directory?")
async for token in response:
print(token, end="", flush=True)
if __name__ == "__main__":
asyncio.run(main())Python
Đã sao chép
Điều phối kết hợp: Kiến trúc sư đám mây gặp gỡ lực lượng lao động trên thiết bị
Trong nhiều trường hợp, chúng tôi thấy rằng mô hình Kiến trúc sư-Người xây dựng (Architect-Builder) là một cách tuyệt vời để kết hợp quy mô mô hình đám mây với các lợi thế của mô hình cục bộ. Trong video demo kết hợp bên dưới, được xây dựng với Antigravity SDK đã cập nhật, một kiến trúc sư đám mây (Gemini 3.8 Flash) đóng vai trò là người lập kế hoạch và điều phối, trong khi một nhóm các phiên bản Gemma 4 26B cục bộ xử lý các công việc nặng nhọc hoàn toàn trên thiết bị.
Khi được giao nhiệm vụ kiểm tra và vá ba mô-đun dễ bị tổn thương (auth.py, billing.py và database.py), quy trình làm việc duy trì quyền riêng tư dữ liệu nghiêm ngặt và cho phép chúng ta tận dụng tối đa việc sử dụng token:
- Không tải mã nguồn lên: Gemini 3.8 Flash lập chiến lược và phân tách công việc hoàn toàn dựa trên tên tệp và mô tả tác vụ - chỉ tiêu tốn 95 token đám mây mà không có bất kỳ mã nguồn nào rời khỏi máy.
- Thử thách cục bộ tự chủ: Các mô hình Gemma 4 26B cục bộ tiếp quản trên GPU cục bộ để thực hiện vòng lặp kiểm tra đối kháng: tái tạo các lỗ hổng bảo mật, soạn thảo các bản sửa lỗi tiềm năng, phê bình các bản vá và xác thực dựa trên các bộ kiểm thử hồi quy.
- Thắng lợi lớn về chi phí và quyền riêng tư: Trong lần chạy được ghi lại này, 97,2% tổng số token (3.322 token) chạy cục bộ và ngoại tuyến mà không cần gọi API đám mây, mang lại các bản vá đã được xác minh đầy đủ trong khi vẫn giữ mã nguồn độc quyền hoàn toàn an toàn trên thiết bị.
Xem dự án ví dụ tại đây để chạy thử thách 3 tệp tích hợp sẵn hoặc trỏ nó vào các mô-đun Python và bộ kiểm thử của riêng bạn.
Tiện ích cục bộ không tốn token: Trình giám sát tài nguyên CLI
Antigravity SDK với Gemma 4 26B A4B vượt trội trong việc xây dựng các tiện ích hệ thống thiết thực. Trong ví dụ này, tác nhân đã xây dựng một trình giám sát tài nguyên cập nhật trực tiếp chạy trong terminal. Với một câu lệnh duy nhất, tác nhân tự động viết một tập lệnh Python sử dụng các thư viện psutil và rich để theo dõi mức sử dụng CPU và bộ nhớ, tạo tệp requirements.txt cần thiết và thậm chí kiểm tra mã kết quả để đảm bảo nó hoạt động - tất cả đều chạy hoàn toàn trên máy cục bộ của bạn và sử dụng Gemma 4 26B.
Công cụ giám sát tài nguyên CLI dựa trên Python được tạo trên thiết bị với Gemma 4 26B
## cli_resource_monitor.py
import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy
# UPDATE: Your prompt
PROMPT = "Build a command-line interface tool using the psutil and rich libraries that displays a live-updating terminal dashboard. It should show CPU usage, memory consumption, and a sorted table of the top 5 most memory-intensive processes. Save the script as 'monitor.py' and create a 'requirements.txt' file. Test that it works."
# UPDATE: Point to the locally imported LiteRT-LM model path
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")
# UPDATE: Give AGY-SDK a workspace to write files
WORKING_DIR = os.path.expanduser("~/agy-test")
os.makedirs(WORKING_DIR, exist_ok=True)
os.chdir(WORKING_DIR)
async def main():
print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")
config = LiteRTAgentConfig(
model_path=MODEL_PATH,
workspaces=[WORKING_DIR],
policies=[policy.allow_all()],
).lightweight()
async with Agent(config) as agent:
response = await agent.chat(PROMPT)
async for token in response:
print(token, end="", flush=True)
if __name__ == "__main__":
asyncio.run(main())Python
Đã sao chép
Antigravity SDK cũng cung cấp hỗ trợ liền mạch, cắm-và-chạy cho bất kỳ máy chủ tương thích OpenAI nào như Ollama, LM Studio hoặc vLLM thông qua LocalOpenAIAgentConfig. Điều này mang lại cho bạn sự linh hoạt để thử nghiệm với các backend suy luận cục bộ khác nhau trong khi vẫn giữ nguyên việc điều phối tác nhân, công cụ và quy trình làm việc của bạn.
Bắt đầu với AI cục bộ bằng cách xem hướng dẫn trên Antigravity Python SDK README và tìm hiểu thêm về cách bạn có thể chạy các mô hình hiệu quả trên thiết bị biên bằng cách sử dụng LiteRT. Vui lòng chia sẻ phản hồi và yêu cầu tính năng của bạn trên GitHub Issue Tracker của Antigravity Python SDK. Chúng tôi rất mong chờ những gì bạn sẽ xây dựng!
Lời cảm ơn: Abhi Patel, Ander Dobo, Ben Miles, Cormac Brick, Ian Ballantyne, Jingxiao Zheng, Jonathan Reay, Kimish Patel, Lu Wang, Marissa Ikonomidis, Matthias Grundmann, Olivier Lacombe, Omar Sanseviero, Rishika Sinha, Rody Davis, Taylor Mullen, Tyler Mullen, Wai Hon Law, Xiaoming Hu, Xu Chen, Yu-hui Chen
Trước
Tiếp theo
Bài viết được AI dịch và tổng hợp tự động từ Google Developers Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.