Hướng dẫn
So sánh khả năng và chi phí tạo video từ ảnh: Veo 3.1, Seedance, Kling và Grok Imagine Video
(giờ Việt Nam)
Tóm tắt AI
OpenRouter phân tích chi tiết các mô hình tạo video từ ảnh hàng đầu hiện nay, so sánh về độ phân giải, thời lượng, khả năng kiểm soát khung hình và chi phí vận hành tính đến tháng 9/2026.
Chính văn · Bản dịch AI

Nếu bạn đã có hình ảnh để bắt đầu video, việc chọn mô hình image-to-video sẽ phụ thuộc vào những gì cần xảy ra sau khung hình đầu tiên đó. Clip có thể cần kết thúc bằng một hình ảnh chính xác thứ hai, chạy dài hơn vài giây, bao gồm âm thanh được tạo tự động hoặc nằm trong ngân sách cho mỗi giây.
Các mô hình video mà chúng tôi cung cấp xử lý những yêu cầu đó theo cách khác nhau. Bài viết này đề cập đến bốn dòng mô hình: Veo 3.1, Seedance, Kling và Grok Imagine Video. Đây không phải là toàn bộ danh mục image-to-video. Bộ sưu tập các mô hình video có danh sách đầy đủ.
Bạn gọi tất cả chúng thông qua cùng một API tạo video. Vòng đời gửi yêu cầu, thăm dò và tải xuống là như nhau cho mọi mô hình. Tuy nhiên, thời lượng, độ phân giải, vai trò khung hình, tùy chọn âm thanh và giá cả mà mỗi mô hình chấp nhận thì không giống nhau. Bài viết này so sánh các thiết lập đó, sau đó hướng dẫn cách gửi một tác vụ image-to-video bằng TypeScript SDK.
Tóm tắt
- Veo 3.1, Fast và Lite tạo ra các clip dài 4, 6 hoặc 8 giây với khả năng kiểm soát khung hình đầu và cuối cùng với âm thanh được tạo tự động. Veo 3.1 và Fast hỗ trợ lên đến 4K, Lite dừng ở 1080p.
- Seedance 2.5 tạo ra các clip dài từ 4 đến 30 giây ở độ phân giải 480p hoặc 720p, chấp nhận khung hình đầu và cuối, đồng thời nhận tối đa 50 tài nguyên tham chiếu gồm hình ảnh, video và âm thanh. Dòng Seedance 2.0 hỗ trợ từ 4 đến 15 giây.
- Kling v3.0 Standard và Pro tạo ra các clip dài từ 3 đến 15 giây ở độ phân giải 720p với khả năng kiểm soát khung hình đầu và cuối. Âm thanh là tùy chọn và sẽ làm thay đổi giá cả.
- Grok Imagine Video 1.5 tạo ra các clip dài từ 1 đến 15 giây ở độ phân giải 480p, 720p hoặc 1080p chỉ từ khung hình đầu tiên, kèm theo âm thanh được tạo tự động.
- Mọi mô hình trong bài viết này đều sử dụng POST /api/v1/videos. GET /api/v1/videos/models trả về các thiết lập được hỗ trợ và mã định danh giá (SKU) của từng mô hình.
Cách sử dụng hình ảnh trong một yêu cầu video
Một hình ảnh có thể xác định một khung hình trong video hoàn thiện hoặc đóng vai trò là tài liệu tham khảo. Chúng tôi xử lý hai trường hợp đó bằng hai trường yêu cầu khác nhau.
Text-to-video, image-to-video và reference-to-video
Với text-to-video, mô hình xây dựng cảnh quay chỉ từ câu lệnh (prompt) của bạn. Bạn không kiểm soát khung hình mở đầu ngoài những gì câu lệnh mô tả.
Với image-to-video, hình ảnh trở thành khung hình đầu tiên, khung hình cuối cùng hoặc cả hai. Nếu một video sản phẩm cần mở đầu bằng một cảnh quay sản phẩm chính xác, đây là chế độ cần sử dụng.
Với reference-to-video, mô hình nhận tài liệu nguồn mà không cố định nó vào một vị trí khung hình cụ thể. Bạn có thể cung cấp vài hình ảnh của một nhân vật để mô hình giữ nguyên ngoại hình của họ trong khi soạn thảo một cảnh quay mới.
Nếu hình ảnh phải xuất hiện tại một thời điểm cụ thể trong clip, hãy sử dụng image-to-video. Nếu nó chỉ cần để định hướng kết quả, hãy sử dụng reference-to-video.
Các trường frame_images và input_references
Chúng tôi cung cấp hai chế độ này dưới dạng các trường riêng biệt trên POST /api/v1/videos.
| Trường | Chức năng |
|---|---|
| frame_images | Sử dụng hình ảnh làm khung hình đầu tiên, cuối cùng hoặc cả hai một cách chính xác |
| input_references | Cung cấp cho mô hình tài liệu hình ảnh, video hoặc âm thanh để làm theo mà không cố định vào một khung hình |
Mỗi mục trong frame_images mang một frame_type là first_frame hoặc last_frame. Không phải mô hình nào cũng hỗ trợ cả hai vai trò. Mảng supported_frame_images trong danh mục mô hình video sẽ cho bạn biết mô hình đó chấp nhận những vai trò nào.
Nếu bạn gửi cả hai trường trong một yêu cầu, frame_images sẽ được ưu tiên và chúng tôi xử lý tác vụ đó dưới dạng image-to-video.
So sánh các mô hình image-to-video
Các bảng này bao gồm các dòng Veo, Seedance, Kling và Grok Imagine Video. Chúng tôi cũng cung cấp các mô hình image-to-video khác, và bộ sưu tập các mô hình video là danh mục hiện tại.
Độ phân giải, thời lượng, vai trò khung hình và cài đặt âm thanh được lấy từ GET /api/v1/videos/models. Giá cả được lấy từ trang của từng mô hình. Chúng tôi đã kiểm tra cả hai vào ngày 11 tháng 9 năm 2026. Giá video thay đổi tùy theo độ phân giải, âm thanh và loại đầu vào, vì vậy hãy coi các con số này là để so sánh và kiểm tra trang mô hình trước khi ước tính chi phí sản xuất.
Cài đặt đầu ra
| Mô hình | Độ phân giải | Thời lượng | Âm thanh được tạo | Kiểm soát khung hình |
|---|---|---|---|---|
| google/veo-3.1 | 720p, 1080p, 4K | 4, 6, 8 s | Tùy chọn | Đầu và cuối |
| google/veo-3.1-fast | 720p, 1080p, 4K | 4, 6, 8 s | Tùy chọn | Đầu và cuối |
| google/veo-3.1-lite | 720p, 1080p | 4, 6, 8 s | Tùy chọn | Đầu và cuối |
| bytedance/seedance-2.5 | 480p, 720p | 4 đến 30 s | Tùy chọn | Đầu và cuối |
| bytedance/seedance-2.0 | 480p, 720p, 1080p, 4K | 4 đến 15 s | Tùy chọn | Đầu và cuối |
| bytedance/seedance-2.0-fast | 480p, 720p | 4 đến 15 giây | Tùy chọn | Đầu và cuối |
| bytedance/seedance-2.0-mini | 480p, 720p | 4 đến 15 giây | Tùy chọn | Đầu và cuối |
| kwaivgi/kling-v3.0-pro | 720p | 3 đến 15 giây | Tùy chọn | Đầu và cuối |
| kwaivgi/kling-v3.0-std | 720p | 3 đến 15 giây | Tùy chọn | Đầu và cuối |
| kwaivgi/kling-video-o1 | 720p | 5 hoặc 10 giây | Tùy chọn | Đầu và cuối |
| x-ai/grok-imagine-video-1.5 | 480p, 720p, 1080p | 1 đến 15 giây | Có | Chỉ phần đầu |
| x-ai/grok-imagine-video | 480p, 720p | 1 đến 15 giây | Không liệt kê | Chỉ phần đầu |
Đầu vào tham chiếu và giá cả
| Mô hình | Đầu vào tham chiếu | Giá cả |
|---|---|---|
| google/veo-3.1 | Không liệt kê | $0.20/giây đến $0.60/giây |
| google/veo-3.1-fast | Không liệt kê | $0.08/giây đến $0.30/giây |
| google/veo-3.1-lite | Không liệt kê | $0.03/giây đến $0.08/giây |
| bytedance/seedance-2.5 | Tối đa 50 tài nguyên hình ảnh, video và âm thanh | Từ $0.1028/giây ở độ phân giải 480p |
| bytedance/seedance-2.0 | Hình ảnh, video và âm thanh | Từ $0.06726/giây ở độ phân giải 480p |
| bytedance/seedance-2.0-fast | Hình ảnh, video và âm thanh | Từ $0.04035/giây ở độ phân giải 480p |
| bytedance/seedance-2.0-mini | Hình ảnh, video và âm thanh | Từ $0.03363/giây ở độ phân giải 480p |
| kwaivgi/kling-v3.0-pro | Không liệt kê | $0.112/giây không kèm âm thanh, $0.168/giây có kèm âm thanh |
| kwaivgi/kling-v3.0-std | Không liệt kê | $0.084/giây không kèm âm thanh, $0.126/giây có kèm âm thanh |
| kwaivgi/kling-video-o1 | Không liệt kê | $0.112/giây |
| x-ai/grok-imagine-video-1.5 | Không liệt kê | $0.08/giây đến $0.25/giây cộng thêm $0.01 cho mỗi ảnh đầu vào |
| x-ai/grok-imagine-video | Tối đa 7 ảnh | $0.05/giây đến $0.07/giây cộng thêm $0.002 cho mỗi ảnh đầu vào |
Ba lưu ý khi đọc các bảng.
- Âm thanh tùy chọn nghĩa là mô hình có hỗ trợ tham số yêu cầu generate_audio. Các mô hình Grok Imagine Video không hỗ trợ tham số này. Mô tả của Grok Imagine Video 1.5 cho biết mô hình có tạo hiệu ứng âm thanh, âm thanh nền và lời thoại, vì vậy bảng đánh dấu là Có. Mô tả trước đó của Grok Imagine Video không đề cập đến âm thanh, nên bảng đánh dấu là Không liệt kê.
- Đầu vào tham chiếu phản ánh những gì mô tả mô hình trên trang OpenRouter của nó nêu rõ. Không liệt kê nghĩa là mô tả không đề cập đến ảnh, video hoặc âm thanh tham chiếu. Điều này không có nghĩa là chúng tôi đã kiểm tra và thấy rằng các tham chiếu bị từ chối. Sách hướng dẫn tham chiếu sang video giải thích cách xác nhận hỗ trợ trước khi bạn xây dựng dựa trên đó.
- Giá của Seedance được tính theo token video, không phải theo giây. Các trang mô hình Seedance 2.0 nêu rõ rằng số lượng token bằng chiều cao nhân chiều rộng nhân thời lượng nhân 24, chia cho 1.024. Các con số theo giây trong bảng là mức giá khởi điểm mà các trang mô hình hiển thị cho đầu ra 480p. Seedance 2.5 niêm yết $10.70 cho mỗi triệu token video, Seedance 2.0 niêm yết $7.00 ở độ phân giải 480p và 720p với mức giá riêng cho 1080p và 4K, Fast niêm yết $4.20, và Mini niêm yết $3.50. Các yêu cầu có đầu vào video sử dụng mức giá mỗi token thấp hơn.
Vì hầu hết các mô hình tính phí theo giây, thời lượng cũng là một yếu tố quyết định chi phí. Với mức giá khởi điểm của Seedance 2.5 là $0.1028 mỗi giây, một clip 4 giây bắt đầu ở mức khoảng $0.41 và một clip 30 giây bắt đầu ở mức khoảng $3.08. Phí sẽ cao hơn ở độ phân giải 720p hoặc với cấu hình đầu vào khác.
Cách lựa chọn
Thời lượng và kiểm soát khung hình thu hẹp danh sách trước tiên. Khi bạn đã biết clip cần dài bao nhiêu và liệu bạn có cần khung hình đầu tiên, khung hình cuối cùng cố định hay cả hai, hãy so sánh các mô hình còn lại về âm thanh, độ phân giải và chi phí.
Các clip từ 8 giây trở xuống có âm thanh được tạo
Veo 3.1, Veo 3.1 Fast và Veo 3.1 Lite tạo các clip 4, 6 hoặc 8 giây ở tỷ lệ 16:9 hoặc 9:16 với khả năng kiểm soát khung hình đầu và cuối cùng cùng tùy chọn generate_audio. Veo 3.1 và Fast chấp nhận độ phân giải 720p, 1080p và 4K. Lite chấp nhận 720p và 1080p.
Lite bắt đầu ở mức $0.03 mỗi giây cho 720p không kèm âm thanh và Veo 3.1 bắt đầu ở mức $0.20 mỗi giây không kèm âm thanh, vì vậy Lite hoặc Fast có chi phí thấp hơn trong khi câu lệnh (prompt) và chuyển động vẫn đang thay đổi. Sách hướng dẫn ảnh sang video sử dụng google/veo-3.1-lite vì lý do này.
Các mô tả mô hình Veo 3.1 Fast và Lite liệt kê tính năng đóng dấu bản quyền SynthID, một dấu hiệu không thể nhận thấy của Google dành cho nội dung do AI tạo ra. Nếu quy trình làm việc của bạn có các yêu cầu về nguồn gốc hoặc đóng dấu bản quyền, hãy kiểm tra mô tả mô hình cho biến thể Veo mà bạn dự định sử dụng.
Các clip lên đến 30 giây và nhiều tài nguyên tham chiếu
Seedance 2.5 tạo các clip từ 4 đến 30 giây ở độ phân giải 480p hoặc 720p, chấp nhận khung hình đầu và cuối, và nhận tới 50 tài nguyên tham chiếu gồm ảnh, video và âm thanh. Đây là mô hình duy nhất trong bảng so sánh này tạo ra cảnh quay 20 hoặc 30 giây trong một lần tạo.
Dòng Seedance 2.0 bao gồm các clip từ 4 đến 15 giây với mức giá khởi điểm thấp hơn. Seedance 2.0 chấp nhận 480p, 720p, 1080p và 4K. Fast và Mini chấp nhận 480p và 720p. Cả ba đều liệt kê các tham chiếu ảnh, video và âm thanh trong mô tả của chúng.
Nếu bạn không cần thời lượng 30 giây hoặc hạn mức 50 tài nguyên, dòng 2.0 bao gồm quy trình làm việc với khung hình đầu và cuối tương tự ở mức giá thấp hơn.
Mọi mô hình Seedance chỉ chạy thông qua các API được lưu trữ. Chúng tôi không tìm thấy trọng số hoặc giấy phép mô hình nào được công bố cho bất kỳ mô hình nào trong số đó, vì vậy không mô hình nào có thể chạy cục bộ hoặc trong môi trường cách ly (air-gapped).
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ OpenRouter: Announcements. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.