The Decoder: AI News
85

Sản phẩm

Google Gemini ra mắt tính năng phân tích video thông minh, giảm tới 88% lượng token tiêu thụ

(giờ Việt Nam)

Tóm tắt AI

Google nâng cấp dòng Gemini Flash với khả năng phân tích video theo cơ chế đại lý (agentic), cho phép mô hình tự quyết định khung hình và dữ liệu cần xử lý thay vì lấy mẫu cố định, giúp tối ưu hiệu suất và chi phí đáng kể.

Bản dịch AI

Google Gemini's new agent-based video analysis cuts token usage by up to 88 percent

Google đang bổ sung tính năng phân tích video dựa trên tác nhân (agent-based) vào một số mô hình Gemini. Thay vì quét video theo từng khung hình với tốc độ cố định, mô hình sẽ tự tìm kiếm các phân đoạn liên quan, điều mà Google cho biết giúp cắt giảm đáng kể lượng token sử dụng và chi phí.

Các mô hình mới nhất gồm Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite có thể nắm bắt được những khoảnh khắc ngắn dưới một giây, bao gồm cả những thay đổi trạng thái hoặc các đoạn cắt vốn dễ bị bỏ lỡ nếu chỉ quét ở tốc độ một khung hình mỗi giây. Google cho biết điều này giúp việc chỉnh sửa video tự động trở nên chính xác hơn nhiều.

Hệ thống cũng có thể truy vết các cảnh quay riêng lẻ trong hàng giờ ghi hình mà không tiêu tốn hàng triệu token. Nó phát hiện các điểm bất thường bằng cách lấy mẫu lại các khoảng thời gian nghi vấn ở tốc độ khung hình cao hơn, đồng thời đếm chính xác các chuyển động lặp lại và các đối tượng riêng lẻ theo thời gian.

Zwei Balkendiagramme vergleichen Gemini 3.7 Flash mit und ohne agentische Verarbeitung auf Minerva, 1H-VideoQA und LVBench, links Tokens pro Anfrage, rechts Genauigkeit.

Cho đến nay, Gemini vẫn dựa vào quá trình xử lý tĩnh, lấy mẫu video ở tốc độ khung hình cố định mặc định là một khung hình mỗi giây và có thể điều chỉnh thông qua API. Kể từ khi tính năng phân tích video gốc ra mắt vào năm 2025, Gemini đã thực hiện việc chuyển đổi âm thanh thành văn bản và phân tích các khung hình trên cơ sở từng giây.

Google cho biết biến thể dựa trên tác nhân này kết nối trực tiếp khả năng suy luận của mô hình với các công cụ video gốc. Mô hình tự quyết định phần nào cần xem, xem ở tốc độ bao nhiêu và thông qua phương thức nào, cho dù đó là khung hình, âm thanh hay bản ghi chép. Nó chỉ trích xuất những khoảnh khắc và tín hiệu thực sự cần thiết cho một tác vụ nhất định.

Gemini giờ đây chỉ tải những phần quan trọng của video.

Gemini hiện sử dụng một công cụ nội bộ để chỉ lấy phần liên quan của tệp video. Trước đây, các nhà phát triển có thể tự xây dựng phương pháp chọn lọc này theo cách thủ công, nhưng giờ đây mô hình đã có thể tự xử lý.

Ablaufdiagramm einer Gemini-Schleife aus Query, Think, Observation und Output mit den Werkzeugen get_transcript, get_frames(start, end, fps) und get_audio(start, end).

Phương pháp này được xây dựng dựa trên "tầm nhìn tác nhân" (agentic vision) mà Google đã triển khai cho Gemini 3 Flash vào tháng 1. Tính năng đó cho phép mô hình viết và chạy mã Python để phóng to, cắt và chú thích hình ảnh, kiểm tra từng kết quả trong vòng lặp suy nghĩ-hành động-quan sát trước khi phản hồi. Khi mới ra mắt, nó không tự động hoạt động trong mọi trường hợp, nhưng nền tảng đã được thiết lập sẵn. Khi Google công bố Gemini 3 Flash vào tháng 12, công ty đã đánh dấu khả năng suy luận hình ảnh và không gian cho video là một tính năng sắp ra mắt.

Những cải thiện về hiệu suất thể hiện rõ nhất với các video dài, từ video hướng dẫn 10 phút đến các bài giảng 90 phút và các bản ghi kéo dài nhiều giờ. Với xử lý tĩnh, các nhà phát triển phải lựa chọn giữa chi phí token cao và các phương pháp làm mất đi những chi tiết quan trọng. Theo các bài kiểm tra chuẩn của chính Google, bao gồm LongVideoBench, Gemini 3.7 Flash với phân tích dựa trên tác nhân đạt điểm chất lượng tổng thể cao nhất và mang lại sự kết hợp tốt nhất giữa độ chính xác và hiệu quả chi phí.

Streudiagramm mit Kosten pro Anfrage auf der X-Achse und Genauigkeit auf der Y-Achse; Gemini 3.7 Flash mit agentischer Verarbeitung liegt bei rund 90 Prozent über GPT 5.6 Terra, Claude Opus 5.0 und Gr

Không tính thêm phí thông qua API.

Tính năng này hiện đã khả dụng cho việc tải lên video và video YouTube thông qua Gemini API trong Google AI Studio và trên Gemini Enterprise Agent Platform. Các nhà phát triển chỉ cần đặt chế độ xử lý thành "agentic" trong cấu hình API và trả phí theo mức token Gemini API tiêu chuẩn mà không mất thêm phí. Thông tin chi tiết có trong Hướng dẫn dành cho nhà phát triển (Developer Guide).

Google cũng có kế hoạch đưa những cải tiến này vào các sản phẩm của riêng mình. Tính năng này sẽ sớm được triển khai cho tất cả người dùng ứng dụng Gemini trên các thiết bị Flash và Flash Lite. Trong những tháng tới, phân tích video dựa trên tác nhân cũng sẽ hỗ trợ tính năng "Ask YouTube" trên trang phát lại, cung cấp các câu trả lời gắn liền hơn với những gì thực sự hiển thị trong video.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người.

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về các công nghệ tiên phong "AI Radar" sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.