Thủ thuật
Google ra mắt Gemini Omni 1.1 Flash: Mở rộng video 40 giây, kiểm soát khung hình và nâng cấp 4K
(giờ Việt Nam)
Tóm tắt AI
Google cập nhật Gemini Omni 1.1 Flash với khả năng mở rộng video lên 40 giây, kiểm soát khung hình đầu-cuối và hỗ trợ xuất 4K. Tốc độ tạo bản nháp tăng 60% với chi phí tối ưu, hiện đã được tích hợp vào các nền tảng như Adobe và Runway.
Bản dịch AI

Google vừa phát hành Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), một bản cập nhật sản xuất cho mô hình tạo và chỉnh sửa video đa phương thức (multimodal) gốc của họ. Bản phát hành này đưa Omni từ một công cụ tạo video đơn thuần trở thành một công cụ có thể điều khiển được: tính năng mở rộng cảnh (scene extension) hiện có thể đọc tới 10 giây ngữ cảnh trước đó thay vì chỉ một khung hình cuối cùng, khung hình đầu và cuối có thể được ghim để kiểm soát chuyển động camera, bản nháp được kết xuất ở độ phân giải 360p với chi phí bằng một phần ba so với 720p, các bản hoàn thiện có thể nâng cấp lên 4K và các đoạn video có thể được truyền vào làm tham chiếu để đảm bảo tính nhất quán của nhân vật.
Gemini Omni Flash được xây dựng dựa trên ba đặc tính mà Google phân biệt với các mô hình video trước đây: tính đa phương thức gốc (văn bản, hình ảnh, âm thanh và video được xử lý cùng nhau), chỉnh sửa hội thoại thông qua Interactions API và kiến thức thế giới được kế thừa từ Gemini. Việc chỉnh sửa có trạng thái (stateful) — bạn truyền previous_interaction_id và mô hình sẽ áp dụng thay đổi của bạn trong khi vẫn bảo toàn những gì bạn không đề cập đến, mà không cần tải lại video trước đó.
Nó có thể triển khai được không?
Mô hình này hiện khả dụng thông qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform, với Adobe, Figma Weave, GMI Cloud và Runway đã được nêu tên là những đơn vị sử dụng trong sản xuất.
Mở rộng cảnh (Scene Extension) là thay đổi chính
Omni 1.1 phân tích tới 10 giây ngữ cảnh trước đó khi tiếp tục một đoạn clip. Google cho biết các mô hình trước đây chỉ tham chiếu giây cuối cùng. Các phần mở rộng chạy theo từng khoảng 10 giây với tổng cộng tối đa 40 giây, và mô hình tạo ra một đoạn tiếp nối từ 3–10 giây cho mỗi lần gọi. Một số khung hình cuối của đầu vào được chỉnh sửa để tạo sự liền mạch.
Các hạn chế được quy định cụ thể. Phần mở rộng chỉ được thêm vào cuối clip — không có tính năng thêm vào trước (prepending) hoặc chèn vào giữa clip. Video đầu vào được tải lên phải có độ dài từ 10 giây trở xuống, trừ khi bạn đang mở rộng một video do mô hình tạo ra trong quá trình đa lượt (multi-turn). Bạn không thể thêm lời thoại mới khi mở rộng một video đã tải lên có người đang nói; lời thoại được hỗ trợ trong phần mở rộng đa lượt thông qua previous_interaction_id.
Khung hình chính (Keyframes) và Tham chiếu video
Giờ đây, bạn có thể cung cấp khung hình đầu và cuối để mô hình tạo ra video liên tục giữa chúng, đây là cơ chế đằng sau các hiệu ứng quay vòng (orbits), dolly-zoom và vòng lặp liền mạch. Các câu lệnh (prompts) liên kết phương tiện với các vai trò bằng thẻ: <FIRST_FRAME>, <LAST_FRAME>, <IMAGE_REF_N> và <VIDEO_REF_N>.
Tham chiếu video chấp nhận tối đa ba clip, mỗi clip dài tối đa ba giây và hoạt động tốt nhất cho việc mô phỏng hình dáng. Âm thanh bên trong tham chiếu video sẽ bị bỏ qua. Việc suy luận trên nhiều video không được hỗ trợ và có thể làm giảm chất lượng đầu ra.
Kiểm soát chi phí: Nháp ở 360p, Xuất bản ở 4K
Tham số độ phân giải (resolution) trong response_format chấp nhận các mức 360p, 720p (mặc định), 1080p và 4k, trong đó hai mức cao nhất được nâng cấp (upscaled). Google báo cáo rằng các bản xem trước 360p được tạo nhanh hơn tới 60% và với chi phí bằng một phần ba so với 720p, dựa trên thông lượng hệ thống của 360p so với 720p. Điều đó khiến quy trình "nháp rồi nâng cấp" trở thành mô hình sản xuất dự kiến: lặp lại với chi phí thấp, kết xuất một lần.
Định giá, nguồn gốc và giới hạn
Đầu vào có giá 1,50 USD cho mỗi 1 triệu token (văn bản, hình ảnh, video, âm thanh). Đầu ra có giá 9,00 USD cho mỗi 1 triệu token văn bản và 17,50 USD cho mỗi 1 triệu token video. Việc tính phí video được thực hiện ở mức 5.792 token mỗi giây cho độ phân giải 720p, tương đương khoảng 0,10 USD mỗi giây theo mức giá tiêu chuẩn.
Mọi video được tạo đều mang dấu bản quyền SynthID — vô hình với người xem, có thể phát hiện bằng lập trình để xác định nguồn gốc. Những thiếu sót đáng chú ý: không có hướng dẫn hệ thống (system instructions), temperature, top_p, chuỗi dừng (stop sequences) hoặc câu lệnh phủ định (negative prompts - các từ phủ định được đưa vào văn bản câu lệnh); chỉnh sửa giọng nói không được hỗ trợ; tham chiếu âm thanh không được hỗ trợ; URL YouTube không thể được sử dụng làm nguồn. Tiếng Anh được hỗ trợ đầy đủ; các ngôn ngữ khác chưa được đánh giá. Đối với đầu ra trên 4MB, hãy sử dụng delivery="uri" và thăm dò Files API cho đến khi tệp ở trạng thái ACTIVE.
Google nêu tên Adobe (Firefly), Figma Weave, GMI Cloud và Runway là những khách hàng đang chạy Omni Flash trong sản xuất. Mô hình này cũng đã hoạt động trong Google Flow cho người đăng ký AI Plus, Pro và Ultra, với tính năng mở rộng cảnh trong ứng dụng Gemini.
So sánh
Những điểm chính cần lưu ý
Hãy xem thông báo trên blog của Google, tài liệu Gemini API Omni, bảng giá Gemini API và sách hướng dẫn (cookbook) bắt đầu nhanh với Omni. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi và đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, bản phát hành sản phẩm hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.