Sản phẩm
Google DeepMind ra mắt tính năng hiểu video thông minh cho Gemini
(giờ Việt Nam)
Tóm tắt AI
Google DeepMind cập nhật khả năng xử lý video thông minh cho dòng Gemini Flash, giúp mô hình tự động quét các phân đoạn quan trọng. Công nghệ này giúp giảm 88% lượng token, tiết kiệm 66% chi phí và tăng 7% độ chính xác so với phương pháp xử lý khung hình cố định truyền thống.
Bản dịch AI

01 tháng 09, 2026
Tính năng agentic mới của chúng tôi dành cho phân tích video giúp cắt giảm mức tiêu thụ token lên đến 88%, giảm chi phí lên đến 66% và tăng chất lượng lên đến 7%.
Rohan Doshi
Giám đốc Sản phẩm Cấp cao, Google DeepMind
Mario Lučić
Giám đốc Nghiên cứu, Google DeepMind

Trình duyệt của bạn không hỗ trợ phần tử âm thanh.
Trình duyệt của bạn không hỗ trợ phần tử âm thanh.
Nghe bài viết
[[duration]] phút
Nội dung này được tạo bởi Google AI. Generative AI là công nghệ thử nghiệm.
Nội dung này được tạo bởi Google AI. Generative AI là công nghệ thử nghiệm.
Hôm nay, chúng tôi ra mắt tính năng hiểu video theo hướng tác nhân (agentic video understanding) trên các mô hình mới nhất của mình: Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite. Khả năng mới này giúp cải thiện độ chính xác đồng thời giảm đáng kể mức sử dụng token và chi phí cho việc phân tích video. Tương tự như tầm nhìn theo hướng tác nhân (agentic vision), vốn kết hợp việc thực thi mã với khả năng hiểu hình ảnh gốc của các mô hình Gemini, tính năng hiểu video theo hướng tác nhân sử dụng các công cụ video gốc của Gemini để cải thiện hiệu suất và mở khóa các khả năng mới cho việc xử lý video như truy xuất khoảnh khắc dưới một giây, phát hiện bất thường chính xác hơn, đếm đối tượng chính xác và nhiều hơn nữa.
Tính năng này hiện đã khả dụng cho việc tải lên video và các video YouTube thông qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform.
Các điểm chuẩn (Benchmarks)
Không giống như cách xử lý 'tĩnh' hiện tại, nơi mô hình tiếp nhận video ở tốc độ khung hình cố định (mặc định là 1 FPS, có thể điều chỉnh qua API), tính năng hiểu video theo hướng tác nhân kết hợp khả năng suy luận cốt lõi của mô hình với các công cụ video gốc để tìm kiếm, quét và kiểm tra các phân đoạn video mục tiêu một cách linh hoạt thông qua các khung hình trực quan, âm thanh và bản ghi (transcript). Trên các tiêu chuẩn phân tích video phổ biến, các mô hình Gemini với tính năng hiểu video theo hướng tác nhân giúp giảm chi phí phân tích lên đến 66% và mức tiêu thụ token lên đến 88%, đồng thời cải thiện độ chính xác lên đến 7%.
Những cải thiện về hiệu suất này đặc biệt rõ rệt trên các video dài (từ hướng dẫn 10 phút đến các bài giảng 90 phút và các bản ghi kéo dài nhiều giờ), nơi cách xử lý tĩnh buộc các nhà phát triển phải lựa chọn giữa chi phí token cao hoặc các kỹ thuật làm mất đi những chi tiết quan trọng.
Việc kích hoạt tính năng hiểu video theo hướng tác nhân giúp giảm mức tiêu thụ token lên đến 88% và tăng độ chính xác lên đến 7% với Gemini 3.7 Flash.

Mặc dù những cải thiện này bao trùm cả ba mô hình được hỗ trợ, Gemini 3.7 Flash với tính năng hiểu theo hướng tác nhân mang lại chất lượng tổng thể tốt nhất và sự kết hợp tối ưu giữa chất lượng và hiệu quả chi phí, đưa nó lên biên Pareto về độ chính xác so với chi phí trong số các mô hình được thử nghiệm cho việc hiểu video.
Việc sử dụng tính năng hiểu video theo hướng tác nhân đưa Gemini 3.7 Flash lên biên Pareto về độ chính xác so với chi phí cho phân tích video.

Cách thức hoạt động
Thay vì xử lý tĩnh nơi mô hình tiếp nhận các luồng phương tiện ở tốc độ khung hình cố định, tính năng hiểu video theo hướng tác nhân cho phép Gemini đóng vai trò chủ động, có mục tiêu trong việc xác định nội dung cần xem, tốc độ xem và phương thức nào (khung hình, âm thanh hoặc bản ghi), chỉ lấy những khoảnh khắc và tín hiệu cần thiết. Mặc dù trước đây các nhà phát triển có thể thực hiện việc này theo cách thủ công, nhưng với tính năng hiểu video theo hướng tác nhân, Gemini có thể hoàn thành nó thông qua một vòng lặp tác nhân (agentic loop), gọi một công cụ nội bộ để tải phần liên quan của tệp video, giúp giảm đáng kể chi phí phát triển.

Các khả năng và trường hợp sử dụng
Tính năng hiểu video theo hướng tác nhân thay đổi cách các nhà phát triển có thể xử lý nội dung video dài trên nhiều ứng dụng đòi hỏi khắt khe.
Kết quả thực tế
Nhiều đối tác truy cập sớm của chúng tôi đã thấy hiệu suất mạnh mẽ khi thử nghiệm với tính năng hiểu video theo hướng tác nhân. Đây là những gì họ chia sẻ:

Bắt đầu sử dụng
Tính năng hiểu video theo hướng tác nhân khả dụng thông qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform, ra mắt trên Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite. Tính năng này sử dụng mức giá token Gemini API tiêu chuẩn mà không tính thêm phí tính năng.
Để kích hoạt, chỉ cần đặt chế độ xử lý thành "agentic" trong cấu hình API. Hãy đọc hướng dẫn dành cho nhà phát triển của chúng tôi để biết thêm thông tin chi tiết về tính năng này và cách bắt đầu.
Chúng tôi cũng đang mang những cải tiến về hiệu suất và chất lượng của tính năng hiểu video theo hướng tác nhân đến với hàng tỷ người dùng trên các sản phẩm của Google. Tính năng này sẽ sớm được triển khai cho tất cả người dùng trong ứng dụng Gemini trên các mô hình Flash và Flash-Lite. Và trong những tháng tới, tính năng hiểu video theo hướng tác nhân cũng sẽ hỗ trợ tính năng ‘Ask YouTube’ trên trang xem video của YouTube, tận dụng Gemini để cung cấp các câu trả lời chất lượng cao hơn dựa trên hình ảnh trực quan.
Ghi nhận đóng góp cho công trình này: Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin và nhóm Agentic Vision.
Nhận tin tức mới nhất từ Google trong hộp thư đến của bạn
Đăng ký nhận bản tin của chúng tôi để cập nhật thông tin sản phẩm, sự kiện, ưu đãi đặc biệt và nhiều nội dung khác.
Thông tin của bạn sẽ được sử dụng theo chính sách quyền riêng tư của Google. Bạn có thể hủy đăng ký bất cứ lúc nào.
Bài viết được AI dịch và tổng hợp tự động từ Google DeepMind: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.