# Đánh giá Seedance 2.5 từ OpenRouter: Phân tích chi phí và khả năng biên tập video chuyên sâu

- Nguồn: OpenRouter: Announcements
- Thời gian phát hành: 2026-09-09 07:00 (giờ Việt Nam)
- Điểm AI: 70/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/cd957612a8451194
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtwlujuv02r1row74s96s67t
- Link gốc: https://openrouter.ai/blog/insights/seedance-2-5-review

## Lý do tinh chọn

Cung cấp thông tin thực tế về công cụ tạo video mới, phân tích chi phí và tính năng kỹ thuật hữu ích cho người dùng chuyên nghiệp.

## Tóm tắt AI

OpenRouter đánh giá mô hình video Seedance 2.5 của ByteDance, nổi bật với khả năng tạo video 4-30 giây, hỗ trợ điều khiển khung hình và tích hợp âm thanh không phát sinh thêm phí.

## Thân bài

![Seedance 2.5 Review: What It's Best At and When to Use It](https://openrouter.ai/blog/images/seedance-2-5-review.png)

Seedance 2.5 đã hoạt động trên API video của chúng tôi từ ngày 7 tháng 8 năm 2026, và tính đến ngày 3 tháng 9 năm 2026, trang thông tin của mô hình này niêm yết giá từ $0,1028 mỗi giây video được tạo ra, đây cũng là mức giá cho độ phân giải 480p. Con số mỗi giây đó là giá trị suy ra, không phải giá cố định. Việc thanh toán được tính theo token video, và số lượng token sẽ thay đổi tùy theo số lượng pixel đầu ra cũng như thời lượng, vì vậy một giây video 720p sẽ có chi phí cao hơn gấp đôi so với một giây video 480p từ cùng một mô hình.

Mô hình này cũng có cấu trúc khác biệt so với Seedance 2.0. Nó có thời lượng lên tới 30 giây thay vì 15 giây, và dừng lại ở độ phân giải 720p thay vì 4K. Dưới đây là những gì nó làm tốt, chi phí cho mỗi clip ở từng độ phân giải, cách nó so sánh với Seedance 2.0, Wan 3.0 và Veo 3.1 dựa trên dữ liệu danh mục của chúng tôi, cũng như các trường hợp chúng tôi khuyên dùng một mô hình khác.

### Seedance 2.5 là gì

Seedance 2.5 là mô hình tạo video của ByteDance, cho phép chuyển đổi nhiều loại đầu vào thành một đầu ra video duy nhất. Bạn có thể tạo video chỉ từ câu lệnh văn bản (text prompt), từ các hình ảnh cố định khung hình đầu hoặc cuối của cảnh quay, hoặc từ các tài sản tham chiếu (reference assets) giúp điều hướng kết quả mà không cần ghim một khung hình cụ thể. Trang mô hình của chúng tôi mô tả nó phù hợp cho việc kể chuyện dài, tạo video dựa trên tham chiếu, chỉnh sửa video và mở rộng video; bốn công việc này bao quát hầu hết các mục đích sử dụng của nó.

Dưới đây là bảng thông số kỹ thuật hiện tại từ endpoint các mô hình video của chúng tôi, để bạn có thể thấy rõ giới hạn thực tế của các khả năng đó.

Kiểm tra lần cuối vào ngày 3 tháng 9 năm 2026 trên endpoint các mô hình video.

Endpoint này cũng liệt kê các kích thước đầu ra chính xác, rất hữu ích khi bạn muốn gửi kích thước thay vì độ phân giải và tỷ lệ khung hình: 854x480, 752x560, 640x640, 560x752, 480x854, 992x432 ở độ phân giải 480p, và 1280x720, 1112x834, 960x960, 834x1112, 720x1280, 1470x630 ở độ phân giải 720p.

### Năm định danh (slug) Seedance và cách chọn loại bạn cần

Tên mô hình là nhãn dễ đọc cho con người, ByteDance: Seedance 2.5, trong khi slug là chuỗi bạn đặt trong trường model, bytedance/seedance-2.5. Chúng tôi cung cấp năm loại và chúng không thể thay thế cho nhau. Seedance 2.5 là phiên bản mới nhất và có thời lượng dài nhất. Seedance 2.0 là mô hình có độ phân giải cao hơn, với các clip từ 4 đến 15 giây ở độ phân giải từ 480p đến 4K với giá $0,000007 mỗi token video ở 480p và 720p. Seedance 2.0 Fast và Seedance 2.0 Mini có thời lượng lên tới 15 giây với giới hạn 720p, giá lần lượt là $0,0000042 và $0,0000035 mỗi token, khiến chúng trở thành các lựa chọn bản nháp (draft). Seedance 1.5 Pro là mô hình cũ hơn, tạo video và âm thanh trong một lần xử lý, dừng ở 1080p và 12 giây, với giá $0,0000024 mỗi token nếu có âm thanh hoặc bằng một nửa nếu không có.

### Những gì nó không làm được

Seedance 2.5 không liệt kê đầu ra 1080p và 4K. Nếu bạn cần một trong hai, hãy sử dụng Seedance 2.0 trong cùng dòng hoặc Veo 3.1 bên ngoài dòng này. Đây là thông số duy nhất mà phiên bản mới lại hạn chế hơn phiên bản cũ, vì vậy hãy kiểm tra kỹ định dạng đầu ra của bạn trước khi xây dựng hệ thống dựa trên bản 2.5.

### Thế mạnh của nó

Khoảng thời gian từ 4 đến 30 giây và các đầu vào tham chiếu mô tả những gì mô hình chấp nhận. Lý do để chọn nó thay vì các mô hình khác trong cùng dòng còn cụ thể hơn thế. Đây là mô hình Seedance tối ưu cho thời lượng dài và cho các cảnh quay bạn đã có sẵn.

Bốn tùy chọn điều khiển, mỗi tùy chọn sẽ giảm bớt khả năng tự thay đổi của mô hình. Hình ảnh khung hình (frame images) và tài sản tham chiếu (reference assets) chọn các chế độ khác nhau thay vì kết hợp, và hình ảnh khung hình sẽ được ưu tiên nếu cả hai cùng được gửi.

### Ba mươi giây trong một lần tạo

Ba mươi giây là thời lượng tạo đơn lẻ dài nhất mà chúng tôi cung cấp, chỉ ngang bằng với Wan 3.0 và Wan 3.0 Prime. Mọi mô hình khác có công bố phạm vi thời lượng đều dừng ở mức 20 giây hoặc ít hơn. Điều này quan trọng vì giải pháp thay thế cho một cảnh quay dài là ghép các cảnh ngắn, và việc ghép nối thường làm mất đi tính liên tục. Nếu sản phẩm của bạn là một đoạn quảng cáo 30 giây hoặc một cảnh quay liên tục, đây là con đường ngắn nhất để đạt được điều đó.

### Tham chiếu ở ba phương thức

input_references chấp nhận các tài sản hình ảnh, âm thanh và video trên các thế hệ Seedance từ 2 trở lên, bao gồm cả 2.5. Tham chiếu hình ảnh mang theo khuôn mặt, sản phẩm hoặc phong cách. Tham chiếu video cung cấp cho mô hình cảnh quay hiện có để chỉnh sửa hoặc mở rộng. Tham chiếu âm thanh cung cấp một bản nhạc để mô hình làm việc theo. Trang mô hình của chúng tôi liệt kê tối đa 50 tài sản tham chiếu mỗi yêu cầu; đây là con số trên trang mô hình chứ không phải giới hạn mà endpoint của chúng tôi công bố, vì vậy hãy coi giới hạn chính xác là thông tin tham khảo thay vì con số đã đo lường.

Tham chiếu video và âm thanh hoạt động trên mọi mô hình Seedance từ thế hệ 2 trở đi, vì vậy đây không phải là tính năng độc quyền của 2.5 trong cùng dòng. Tuy nhiên, nó giúp phân biệt dòng này với các mô hình còn lại trong danh mục. Wan 3.0, Veo 3.1 và Kling v3.0 Pro đều chỉ chấp nhận tham chiếu hình ảnh.

### Chỉnh sửa và mở rộng có mức phí thấp hơn

Một yêu cầu chứa tham chiếu video và không có hình ảnh khung hình sẽ được tính phí $0,0000064 mỗi token video thay vì $0,0000107, rẻ hơn khoảng 40%. Ở độ phân giải 720p, mức giá này là $0,138 mỗi giây thay vì $0,231. Vì vậy, cách rẻ nhất để có 30 giây video 720p từ mô hình này là mở rộng cảnh quay bạn đã có sẵn thay vì tạo mới hoàn toàn.

### Cả hai đầu của cảnh quay, không chỉ khung hình đầu

frame_images chấp nhận các mục được định dạng là first_frame và last_frame, cho phép bạn cố định điểm bắt đầu và kết thúc của cảnh quay và để mô hình lấp đầy chuyển động ở giữa. Wan 3.0, mô hình 30 giây còn lại, chỉ liệt kê first_frame. Nếu một yêu cầu chứa cả hình ảnh khung hình và tài sản tham chiếu, hình ảnh khung hình sẽ được ưu tiên và công việc được xử lý như dạng image-to-video, do đó các tham chiếu sẽ không có hiệu ứng hiển thị và yêu cầu sẽ được tính theo mức giá cơ bản.

generate_audio mặc định là true, và chúng tôi tính giá token video như nhau bất kể âm thanh được bật hay tắt, vì vậy việc tắt âm thanh không giúp tiết kiệm chi phí. Veo 3.1 tính phí $0,40 mỗi giây nếu có âm thanh so với $0,20 nếu không có, và Seedance 1.5 Pro giảm một nửa mức giá cho đầu ra không có âm thanh. Trang mô hình cũng liệt kê khả năng tạo âm thanh đa ngôn ngữ, vì vậy bạn nên thử một dòng lệnh bằng ngôn ngữ khác tiếng Anh trước khi lập ngân sách cho một bước lồng tiếng riêng biệt.

### Phù hợp với công việc nào, kèm theo các câu lệnh bạn có thể sao chép

Thời lượng, tham chiếu và âm thanh đi kèm phù hợp với một loại công việc cụ thể: một cảnh quay liên tục, hoặc thay đổi trên cảnh quay đã tồn tại. Ba trường hợp dưới đây mô tả rõ điều đó.

### Một cảnh quay dài

Đây là trường hợp phù hợp nhất, vì 30 giây là đủ cho một cảnh hoàn chỉnh và mô hình không yêu cầu bạn phải cắt ghép. Hãy viết các nhịp (beats) theo thứ tự và đưa ra một chỉ dẫn cho máy quay cho mỗi nhịp.

### Mở rộng hoặc chỉnh sửa cảnh quay hiện có

Gửi clip dưới dạng tham chiếu video và chỉ mô tả những gì cần thay đổi hoặc những gì sẽ xảy ra tiếp theo. Đây là dạng yêu cầu được tính phí theo mức giá đầu vào video thấp hơn.

### Đối thoại và cảnh quay cận mặt (talking heads)

Các câu thoại ngắn sẽ đồng bộ tốt hơn các câu dài, nhưng 30 giây cho phép bạn thực hiện hai hoặc ba câu thoại trong một lần quay thay vì chỉ một câu mỗi lần tạo.

### Gọi từ mã nguồn của riêng bạn

Các câu lệnh đó được đưa vào phần thân yêu cầu (request body) thay vì tin nhắn chat, vì việc tạo video không chạy trên /chat/completions. Nó có một endpoint bất đồng bộ chuyên dụng, vì vậy bạn gửi công việc đến POST /api/v1/videos, thăm dò (poll) polling_url mà chúng tôi trả về cho đến khi trạng thái là completed, sau đó tải xuống kết quả bằng khóa API của bạn. Việc tạo video thường mất từ 30 giây đến vài phút, và khoảng thời gian thăm dò 30 giây là một mặc định hợp lý. Các mô hình video cũng không xuất hiện trong danh sách mô hình thông thường, vì vậy hãy sử dụng /api/v1/videos/models hoặc bộ sưu tập mô hình video để tìm chúng.

Lệnh gọi text-to-video tối giản bao gồm một lệnh gửi và một lệnh thăm dò.

cURL

TypeScript

_Bài gốc còn tiếp._ Xem tiếp tại: <https://openrouter.ai/blog/insights/seedance-2-5-review>
