Sản phẩm
Google nâng cấp Gemini Flash: Khả năng hiểu video thông minh giúp giảm tới 88% lượng token
(giờ Việt Nam)
Tóm tắt AI
Google giới thiệu tính năng hiểu video chủ động cho Gemini Flash, thay vì quét cố định 1 FPS, mô hình sẽ tự động trích xuất khung hình, âm thanh và văn bản theo nhu cầu, giúp tối ưu hóa hiệu suất và chi phí đáng kể.
Bản dịch AI

Video là phương thức tốn kém nhất để thực hiện suy luận. Cho đến nay, một mô hình Gemini khi nhận một bài giảng dài 90 phút vẫn phải xử lý toàn bộ nội dung với tốc độ cố định 1 khung hình/giây, bất kể câu hỏi là "tóm tắt nội dung này" hay "diễn giả chuyển sang slide về giá vào lúc nào?". Thiết kế xử lý một lượt (single-pass) đó buộc người dùng phải đánh đổi: hoặc trả phí cho toàn bộ dòng thời gian trong ngữ cảnh, hoặc chia nhỏ video từ trước và đối mặt với rủi ro bỏ lỡ các chi tiết quan trọng.
Tuần này, Google đã ra mắt tính năng hiểu video theo cơ chế tác tử (agentic video understanding) trên các mô hình Flash của mình. Thay vì nạp toàn bộ dòng thời gian, Gemini tự điều hướng, quyết định xem nên xem gì, ở tốc độ khung hình bao nhiêu và thông qua phương thức nào. Google báo cáo mức giảm tới 88% số lượng token, giảm tới 66% chi phí và tăng tới 7% độ chính xác trên các tiêu chuẩn đánh giá video phổ biến.
Tính năng này có thể triển khai được không? Có, nhưng chỉ dưới dạng tính năng API được lưu trữ (hosted API). Hiện không có open weights và không thể tự lưu trữ (self-host). Tính năng này được cung cấp thông qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform, hoạt động với cả tệp tải lên và URL YouTube công khai, đồng thời tính phí theo giá token Gemini API tiêu chuẩn mà không thu thêm phí tính năng.
Những thay đổi thực sự
Xử lý tĩnh (Static processing), vốn vẫn là mặc định trên mọi mô hình Gemini, trích xuất khung hình ở tốc độ 1 FPS trong một lượt duy nhất, xử lý âm thanh ở tốc độ 1 Kbps đơn kênh và chèn dấu thời gian mỗi giây. Xử lý theo cơ chế tác tử (Agentic processing) thay thế quy trình đó bằng một vòng lặp. Mô hình kết hợp khả năng suy luận của chính nó với các công cụ video gốc để tìm kiếm, quét và kiểm tra các phân đoạn mục tiêu trên khung hình, âm thanh và bản ghi (transcripts), chỉ tải những gì mà câu lệnh (prompt) yêu cầu. Các nhà phát triển trước đây có thể tự xây dựng quy trình này theo cách thủ công; thay đổi ở đây là Gemini tự chạy vòng lặp đó bên trong, giúp loại bỏ hoàn toàn gánh nặng phát triển.
Theo các đánh giá của Google, Gemini 3.7 Flash với khả năng hiểu theo cơ chế tác tử đã đạt đến ngưỡng Pareto về độ chính xác so với chi phí cho phân tích video trong số các mô hình được thử nghiệm. Những cải thiện về hiệu suất tập trung vào các nội dung dài, từ các video hướng dẫn dài 10 phút đến các bản ghi kéo dài nhiều giờ.
Những gì API trả về
Xử lý theo cơ chế tác tử bổ sung hai loại bước vào mảng response steps: processing_call khi mô hình yêu cầu một phân đoạn hoặc bản ghi, và processing_result tương ứng khi quá trình tải đó hoàn tất. Chúng xen kẽ với các bước suy nghĩ (thought steps) và đứng trước model_output, vì vậy chúng có thể hiển thị tiến trình trực tiếp trong giao diện người dùng (UI) của bạn. Sự hiện diện của chúng cũng là cách để bạn xác minh rằng chế độ tác tử đã thực sự hoạt động.
Việc tính toán token cũng được phân tách tương ứng. Suy luận điều hướng được tính là token suy nghĩ (total_thought_tokens); khung hình, âm thanh và bản ghi được tải theo yêu cầu sẽ được tính là token sử dụng công cụ (total_tool_use_tokens).
Việc kích hoạt tính năng này chỉ cần một trường trên phần video:
Bạn cũng có thể kết hợp các chế độ cho mỗi video trong một yêu cầu duy nhất, ví dụ: dùng chế độ tác tử cho bài giảng dài và chế độ tĩnh cho clip ngắn.
Những điểm chính cần lưu ý
Hãy xem blog của Google, tài liệu về hiểu video của Gemini API, hướng dẫn dành cho nhà phát triển trong AI Studio và thông báo về Agentic vision. Ngoài ra, hãy theo dõi chúng tôi trên Twitter, đừng quên tham gia cộng đồng 150k+ ML SubReddit và đăng ký nhận bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến (webinar), v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có giá trị thực tiễn.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.