Mô hình
ByteDance ra mắt Seedance 2.5: Tạo video 30 giây, hỗ trợ đa phương thức và chỉnh sửa chuyên sâu
(giờ Việt Nam)
Tóm tắt AI
Seedance 2.5 nâng cấp khả năng tạo video lên 30 giây mỗi lần, hỗ trợ đa dạng tài liệu tham khảo (ảnh, video, âm thanh) và các công cụ chỉnh sửa chuyên nghiệp như phông xanh, giúp tạo nội dung dài và nhất quán hơn.
Bản dịch AI
Hôm nay, chúng tôi chính thức ra mắt mô hình sáng tạo video thế hệ mới Seedance 2.5. Sau khi Seedance 2.0 được phát hành, chúng tôi nhận thấy kỳ vọng của người dùng đối với các mô hình sáng tạo video đang chuyển dịch từ "tạo ra một đoạn clip" sang "hoàn thiện một tác phẩm". Seedance 2.5 kế thừa kiến trúc tạo đồng thời âm thanh và video đa phương thức thống nhất của Seedance 2.0, tập trung đột phá vào khả năng kể chuyện dài, khả năng tham chiếu đa phương thức và khả năng chỉnh sửa. Xoay quanh các kịch bản công nghiệp thực tế, mô hình giúp hoạt động sáng tạo có không gian tưởng tượng lớn hơn và giải phóng năng suất lao động mạnh mẽ hơn.
Các điểm nổi bật cốt lõi như sau:
Thời lượng tạo mỗi lần lên tới 30 giây, hỗ trợ kéo dài nhiều vòng: Seedance 2.5 có thể tạo các đoạn video chất lượng cao dài 30 giây trong một lần duy nhất và hỗ trợ kéo dài nhiều vòng. Đồng thời, mô hình đã tối ưu hóa việc kết nối các góc quay và chuyển cảnh, giúp video dài duy trì tính nhất quán tốt hơn. Mô hình cũng cải thiện đáng kể chất lượng hình ảnh, âm thanh và chất lượng chuyển động, đồng thời giảm thiểu hiệu quả "cảm giác bóng bẩy" (oily look) thường thấy trong tạo video. Người dùng có thể sản xuất các nội dung liền mạch, chất lượng cao với ngôn ngữ nghe nhìn thống nhất trong vài phút, trình bày trọn vẹn những câu chuyện hấp dẫn chỉ trong một lần.
Khả năng tham chiếu đa phương thức được nâng cấp toàn diện: Seedance 2.5 hỗ trợ người dùng nhập tối đa 30 hình ảnh, 10 đoạn video và 10 đoạn âm thanh làm tài liệu tham khảo trong một lần. Mô hình cũng nâng cao các khả năng tham chiếu như tham chiếu mô hình trắng (white model), tham chiếu chuyển động, tham chiếu sáng tạo, giúp mô hình hiểu rõ hơn ý định sáng tạo, hiện thực hóa các ý tưởng phức tạp với nhiều chủ thể, nhiều bối cảnh và nhiều thay đổi góc quay.
Khả năng chỉnh sửa chính xác và ổn định hơn: Seedance 2.5 hỗ trợ kiểm soát dấu thời gian (timestamp) chính xác, có thể chỉnh sửa nội dung video theo định hướng, nâng cao hiệu quả và khả năng kiểm soát sáng tạo. Đồng thời, mô hình tăng cường các khả năng chỉnh sửa như chỉnh sửa phông xanh, chỉnh sửa góc nhìn, chỉnh sửa tham chiếu, đáp ứng nhu cầu sáng tạo trong các lĩnh vực chuyên nghiệp và phức tạp hơn như điện ảnh, quảng cáo.
Nhờ những cải tiến về khả năng kể chuyện dài, tham chiếu đa phương thức và chỉnh sửa, mô hình không chỉ tạo được video dài hơn trong một lần mà còn hiểu rõ hơn ý định sáng tạo, hoàn thiện toàn bộ quá trình từ ý tưởng đến thành phẩm video một cách có kiểm soát. Tiếp theo, chúng tôi muốn mời bạn cùng xem một đoạn phim ngắn sáng tạo, toàn bộ được tạo độc lập bởi Seedance 2.5.
Hôm nay, Seedance 2.5 đang dần được triển khai trên các nền tảng như Jimeng AI, Doubao Pro, v.v. Dịch vụ API cũng sẽ sớm ra mắt trên Volcano Ark, hoan nghênh bạn trải nghiệm và phản hồi.
Trang chủ dự án:
https://seed.bytedance.com/seedance2_5
Cổng trải nghiệm:
1) Jimeng Web - Tạo video - Chọn Seedance 2.5
2) Doubao Pro - Tạo video - Chọn Seedance 2.5
Kể chuyện dài 30 giây, hỗ trợ kéo dài nhiều vòng, trình bày trọn vẹn câu chuyện hấp dẫn
Seedance 2.5 nâng thời lượng tạo video mỗi lần từ 15 giây lên 30 giây, đồng thời nâng cao hơn nữa khả năng kể chuyện trong các video dài. Mô hình có thể tổ chức nhiều cảnh quay có liên kết logic trong vòng 30 giây, để câu chuyện diễn tiến dần từ dẫn dắt, đẩy cao trào, chuyển biến đến kết thúc, thay vì chỉ đơn giản là kéo dài một khung hình. Ví dụ, khi tạo một đoạn clip ca sĩ biểu diễn trên sân khấu theo phong cách quay một lần (one-take), mô hình đã diễn giải trọn vẹn câu chuyện từ lúc ca sĩ tương tác với nhân viên trong phòng trang điểm, đi qua hành lang hậu trường, gặp gỡ vũ công và cùng lên sân khấu biểu diễn, thay vì chỉ là hình ảnh ca sĩ bước lên sân khấu.
T2V prompt: Quay một lần bằng gimbal cầm tay, ống kính từ từ tiến qua khe hở của tấm màn đỏ dày, tiến vào phòng trang điểm hậu trường tông màu ấm. Nữ ca sĩ trẻ quay lưng về phía ống kính chỉnh tai nghe, nhân viên nhắc cô chuẩn bị lên sân khấu. Cô quay đầu nhìn ống kính, bắt đầu hát City Pop. Ống kính lùi lại theo sau, ca sĩ đi qua tấm màn vào lối đi hậu trường, tương tác tự nhiên với vũ công, một nhân viên đưa micro cho cô. Sau đó ca sĩ và vũ công lên sân khấu, ống kính vòng ra phía sau, mỹ thuật đỏ đen, màn hình LED, đèn rọi, khói và sàn phản quang dần hiện ra. Ống kính cuối cùng kéo xa ra toàn cảnh sân vận động, thể hiện khán giả kín chỗ, bảng đèn, gậy cổ vũ và tiếng reo hò, tạo nên bầu không khí cao trào của buổi hòa nhạc trẻ trung và tự do.
Nhờ khả năng kéo dài nhiều vòng của mô hình, người dùng có thể kết nối tự nhiên các cảnh quay tiếp theo dựa trên kết quả video đã có, đồng thời duy trì sự nhất quán về đặc điểm chủ thể, môi trường bối cảnh và nhịp điệu kể chuyện trong quá trình kéo dài, cuối cùng tạo ra nội dung liền mạch dài vài phút với ngôn ngữ nghe nhìn thống nhất, giảm bớt chi phí chia nhỏ cảnh quay, ghép nối lặp đi lặp lại và xử lý kết nối.
R2V prompt: Kéo dài video, kết nối nội dung và chủ thể của @Video 1 để tiếp tục tạo một video 30 giây, giữ nguyên nhân vật chính, bối cảnh, phong cách hình ảnh, âm thanh và hiệu ứng âm thanh. Cậu bé ôm quả bóng đá chạy dọc toa tàu, sau khi tàu dừng hẳn và cửa bên mở ra, cậu lập tức lao ra ngoài, nam chính đuổi theo sát nút. Hai người chạy xuyên qua sân ga ra phố, làm kinh động người qua đường, nam chính cuối cùng đuổi kịp và tóm lấy cậu bé, cậu bé ngước nhìn đầy tủi thân, nam chính dần nguôi giận, xoa đầu cậu, lộ ra nụ cười bất lực.
Về mặt trình bày hình ảnh, mô hình có thể thực hiện kết nối chuyển động ống kính tự nhiên hơn, chủ thể vẫn ổn định trong nhiều lần cắt cảnh, âm thanh và hình ảnh luôn đồng bộ, giúp kết quả tạo video dài liền mạch hơn. Ví dụ, trong một đoạn biểu diễn Kinh kịch, ống kính theo sát động tác vung tay áo nước của nhân vật chính để hoàn thành một cú quay vòng thanh thoát, sự thể hiện của chủ thể và hậu cảnh luôn nhất quán. Đường cong của tay áo nước trong không trung tạo thành hình vòng cung tự nhiên, tuân thủ các quy luật vật lý hơn.
R2V prompt: Tỷ lệ 16:9, chất lượng điện ảnh, quay một lần (one-take), chuyển động ống kính mượt mà, không cắt ghép. Tham khảo bối cảnh @Ảnh 4. 0-5 giây: @Ảnh 2 Bá Vương cận cảnh mở đầu, ống kính chậm rãi vòng quanh nửa thân trên và chuyển sang trung cảnh; Bá Vương xoay người lộn vòng, sau đó cơ thể và cờ sau lưng lướt nhanh qua ống kính, tạo thành vật che khuất tự nhiên, ống kính theo đà vòng sang bên cạnh @Ảnh 1 Ngu Cơ. 6-10 giây: Ống kính ổn định vòng quanh trung cảnh @Ảnh 1 Ngu Cơ, theo sát động tác tay áo nước hoàn thành cú quay vòng; Ngu Cơ nâng tay, hất cổ tay, vung tay áo, xoay nửa vòng. Cuối cùng thu tay áo đứng yên, nghiêng người nhìn Bá Vương. 11-20 giây: @Ảnh 3 Võ sinh xuất hiện thực hiện động tác lộn nhào, sau đó Bá Vương ở giữa, Võ sinh tiến lùi công thủ ở phía đối diện. Ngu Cơ ở phía sau bên cạnh Bá Vương phối hợp bằng tay áo nước, tạo nên sự tương phản giữa cương và nhu. Ống kính từ trung cận cảnh Võ sinh chậm rãi kéo ra toàn cảnh sân khấu, kết thúc ba người quay mặt về phía khán giả đồng bộ ra mắt kết thúc màn Kinh kịch.
Ngoài ra, đối với vấn đề "cảm giác bóng bẩy" thường thấy trong tạo video, Seedance 2.5 đã tối ưu hóa hệ thống các chi tiết như chất liệu vật thể, làn da và ánh mắt nhân vật, ánh sáng và bóng đổ, độ bão hòa hình ảnh. Mô hình cũng giảm thiểu tình trạng phụ đề và nhạc nền không được kiểm soát, giúp thành phẩm gần với chất lượng điện ảnh quay thực tế hơn.
Khả năng tham chiếu đa phương thức được nâng cấp toàn diện, các nhiệm vụ sáng tạo phức tạp được kiểm soát tốt hơn
Seedance 2.5 tăng cường hơn nữa khả năng tham chiếu đa phương thức, hỗ trợ người dùng nhập tối đa 30 hình ảnh, 10 đoạn video và 10 đoạn âm thanh làm tài liệu tham khảo trong một lần. Số lượng tài liệu tham khảo nhiều hơn và đa dạng hơn có thể khôi phục tốt hơn ý tưởng trong tâm trí người dùng, tạo ra nội dung video phức tạp với nhiều chủ thể hơn, bối cảnh phong phú hơn và thay đổi góc quay linh hoạt hơn.
Mô hình có thể hiểu tổng hợp các yếu tố như bố cục hình ảnh, bối cảnh, phong cách, nhân vật, đạo cụ trong các tài liệu khác nhau và sử dụng các tài liệu tham khảo này để tạo video theo chỉ dẫn. Trong các kịch bản phức tạp như nhiều người cùng khung hình, kể chuyện nhóm, mô hình cũng có thể khôi phục đồng thời hình ảnh và giọng nói của nhiều nhân vật, giữ cho đặc điểm của từng chủ thể ổn định.
R2V prompt: Đoạn clip hòa nhạc 30 giây, 16:9 màn hình ngang, phong cách điện ảnh thực tế, ánh sáng phòng hòa nhạc chân thực, đèn sân khấu vàng ấm, bầu không khí hòa nhạc cổ điển trang trọng. Bối cảnh @Ảnh 1, nghệ sĩ piano tham khảo @Ảnh 2, nghệ sĩ cello tham khảo @Ảnh 3, nghệ sĩ violin tham khảo @Ảnh 4, ca sĩ chính tham khảo @Ảnh 5, dàn nhạc và các nhạc công khác tham khảo @Ảnh 6 đến Ảnh 10, dàn hợp xướng tham khảo Ảnh 11 đến Ảnh 14, khán đài tham khảo @Ảnh 15 đến Ảnh 18. Ca sĩ chính đi từ giữa sân khấu ra phía trước, nghệ sĩ piano bên cạnh đàn, dàn nhạc phân bố hai bên và phía sau, dàn hợp xướng ở phía sau sân khấu. Mở đầu quay từ trên cao toàn cảnh phòng hòa nhạc, nghệ sĩ piano nhấn phím, ca sĩ chính bước vào ánh đèn rọi để hát, ống kính tự nhiên lướt qua violin, cello và dàn nhạc, violin tươi sáng, cello ấm áp. Đoạn sau dàn hợp xướng tham gia, ca sĩ chính giao lưu ánh mắt ngắn ngủi với khán giả hàng đầu, khán giả mỉm cười gật đầu. Cuối cùng ống kính lùi lại, kết thúc buổi biểu diễn, khán giả vỗ tay theo.
Ngoài ra, mô hình còn nâng cao các khả năng tham chiếu như tham chiếu mô hình trắng, tham chiếu chuyển động, tham chiếu sáng tạo, giúp chủ thể, động tác và chuyển động ống kính trong khung hình được kiểm soát tốt hơn. Ví dụ, trong tham chiếu mô hình trắng, người dùng có thể dùng mô hình 3D không vân bề mặt để dựng cấu trúc không gian, tư thế chủ thể, quỹ đạo chuyển động và vị trí đặt máy quay, sau đó để mô hình tham khảo cấu trúc này để tạo video, giúp bố cục và điều phối các góc quay phức tạp gần với kỳ vọng hơn. Đồng thời, mô hình cũng tăng cường khả năng kiểm soát ánh sáng, thông qua thông tin không gian của mô hình trắng để tạo ra hiệu ứng ánh sáng phù hợp với quy luật vật lý thực tế, bao gồm hướng nguồn sáng, nhiệt độ màu, cường độ, đổ bóng, giúp ánh sáng và bóng đổ của hình ảnh cuối cùng tự nhiên hơn.
R2V prompt: Tham khảo chuyển động ống kính, nhịp điệu, thay đổi cỡ cảnh, quỹ đạo chủ thể và điều phối ống kính của @Mô hình trắng 1. Tham khảo hình dáng nhân vật, bối cảnh, chất liệu, ánh sáng, màu sắc và bầu không khí cổ tích của @Ảnh 2, render mô hình trắng thành phim hoạt hình 3D mơ mộng, ấm áp, cảm giác giả tưởng trẻ thơ. Cốt truyện lần lượt là: Bay trên bầu trời tưởng tượng → Thần thú biển mây bay cùng → Lao xuống biển → Cá đuối xuyên qua đáy biển → Khe nứt thời không gương → Hái sao trong vũ trụ → Hóa ảo trở về phòng → Bố đắp chăn → Đóng sách tranh lại và dừng hình.
Khả năng chỉnh sửa chính xác và ổn định hơn, nâng cao hiệu quả sáng tạo một cách hiệu quả
Trong sáng tạo video, người dùng thường cần kiểm soát nhịp điệu khi tạo và tiếp tục trau chuốt các chi tiết sau khi tạo. Một động tác xuất hiện ở giây thứ mấy, ống kính chuyển cảnh vào thời điểm nào, hoặc nhân vật, động tác trong một đoạn có cần điều chỉnh hay không, đều ảnh hưởng đến hiệu quả của thành phẩm cuối cùng. Khả năng chỉnh sửa chính xác và ổn định hơn có thể giúp người dùng khôi phục chính xác ý tưởng, nâng cao hiệu quả sáng tạo và giảm chi phí tạo lại nhiều lần.
Seedance 2.5 hỗ trợ chỉnh sửa nội dung âm thanh và video chính xác thông qua dấu thời gian. Khi tạo, người dùng kiểm soát câu chuyện, góc nhìn hình ảnh, chuyển động ống kính và nhịp điệu tổng thể của một khoảng thời gian nhất định thông qua prompt, giúp nó gần với ý định sáng tạo hơn. Sau khi tạo, người dùng còn có thể chỉnh sửa định hướng cho nhân vật, động tác, âm thanh hoặc cốt truyện trong đoạn được chỉ định, đồng thời duy trì tính liền mạch và chân thực trước và sau khi chỉnh sửa.
Mô hình còn nâng cao hơn nữa các khả năng chỉnh sửa như chỉnh sửa phông xanh, chỉnh sửa góc nhìn và chuyển động ống kính, chỉnh sửa tham chiếu, nhằm đáp ứng các kịch bản sáng tạo chuyên nghiệp và phức tạp hơn như điện ảnh, quảng cáo. Ví dụ, về chỉnh sửa phông xanh, mô hình không chỉ có thể thay thế các bối cảnh khác nhau, kể những câu chuyện khác nhau trong khi vẫn giữ nguyên chủ thể, mà còn có thể render tốt hơn các hiệu ứng vật lý trên cơ thể nhân vật dựa trên quy luật vật lý của các bối cảnh khác nhau, bao gồm hướng bay của quần áo, trạng thái tóc, nhịp điệu dáng đi, ánh sáng và bóng đổ, giúp chủ thể và bối cảnh hài hòa hơn.
R2V prompt: Render bối cảnh, chướng ngại vật, trang phục và nhân vật phụ cho phông xanh của @Video 1: 0-4 giây: Huấn luyện ngoài trời, chướng ngại vật đổi thành đá, gạch, lốp xe, thùng gỗ; 4-10 giây: Phòng nghỉ, bạn bè cổ vũ; 10-15 giây: Sân thi đấu quốc tế, cột huấn luyện đổi thành cầu thủ phòng ngự và thủ môn gốc, nhân vật chính ghi bàn. Tổng thể chất lượng điện ảnh thực tế.
R2V prompt: Chỉnh sửa @Video 1, giữ nguyên nhân vật, động tác và phong cách hình ảnh, chỉ điều chỉnh chuyển động ống kính. Thiết kế chuyển động ống kính phân đoạn 15 giây: 0–4 giây, FPV siêu nhỏ xuyên qua chảo, theo lát bánh mì nảy lên rồi văng ngang sang cà phê; 4-7 giây, đẩy gần và di chuyển ngang dọc theo mép chảo, theo trứng ốp la lật lên rồi rơi xuống; 7-11 giây, nhanh chóng nâng lên góc nhìn từ trên xuống, nhấn xuống tốc độ đều quét qua đĩa ăn và chìa khóa; 11-15 giây, cận cảnh cầm tay theo hai tay văng ngang nhanh, cuối cùng đẩy gần vào bữa sáng, rồi kéo lại trung cảnh hai người. Toàn bộ quá trình liền mạch và ổn định.
Đi sâu vào các kịch bản công nghiệp rộng lớn hơn, tiếp tục khám phá giá trị ứng dụng
Cùng với sự nâng cao năng lực của mô hình, Seedance 2.5 cũng đang đi sâu vào các kịch bản công nghiệp rộng lớn hơn như giáo dục, công nghiệp. Trong lĩnh vực giáo dục, mô hình đã bắt đầu đi vào các kịch bản học tập thực tế. Ví dụ, Seedance 2.5 có thể chuyển đổi bối cảnh lịch sử, nhân vật và tình tiết đằng sau bài học thành nội dung video, chuyển đổi nội dung học tập từ giải thích tĩnh thành hình ảnh sống động và đắm chìm hơn. Đồng thời, mô hình có thể giúp giáo viên sản xuất video giảng dạy hiệu quả hơn, chuyển đổi các nội dung trừu tượng như nguyên lý khoa học, sự kiện lịch sử, quá trình thí nghiệm thành trình diễn động, không chỉ giảm ngưỡng sản xuất tài liệu giảng dạy mà còn hỗ trợ tùy chỉnh nội dung linh hoạt.
Ví dụ kịch bản "Lớp học Doubao" trên ứng dụng Doubao Aixue
R2V prompt: Phong cách tả ý phương Đông. Cảnh phố Lâm An thời Nam Tống, trên con phố nhộn nhịp vài đứa trẻ vừa chạy vừa đùa nghịch, miệng đọc "Mạc nhiên hồi thủ, na nhân khước tại, đăng hỏa san san xứ". Ống kính luôn theo sát lũ trẻ chạy, lướt qua cảnh phố nhộn nhịp. Ống kính hướng lên, người đó chính là @Ảnh 1 Tân Khí Tật. Tân Khí Tật quay đầu lại, phía xa là người đàn ông trong ánh đèn mờ ảo, ống kính liền mạch.
Trong các ngành công nghiệp như sản xuất công nghiệp, trí tuệ hiện thân (embodied AI) và lái xe tự động, Seedance 2.5 cũng bắt đầu đi vào các khâu sản xuất cụ thể hơn. Mô hình có thể tạo dữ liệu video tổng hợp chất lượng cao, giúp huấn luyện khả năng nhận thức và thao tác của robot; cũng có thể được sử dụng cho mô phỏng công nghiệp, đào tạo quy trình và trình diễn thiết bị. Trong kịch bản lái xe tự động, mô hình còn có thể mô phỏng các kịch bản tần suất thấp như thời tiết khắc nghiệt, điều kiện đường xá phức tạp, cung cấp thêm mẫu cho việc kiểm thử và huấn luyện hệ thống.
R2V prompt: Tham khảo chuyển động ống kính, bố cục, cỡ cảnh, quan hệ không gian, vị trí linh kiện, cấu trúc mô hình, trình tự lắp ráp và quỹ đạo chuyển động của @Mô hình trắng 1. Tham khảo chất liệu, ánh sáng, màu sắc, phản chiếu và bầu không khí của @Ảnh 1, render mô hình trắng thành đoạn lắp ráp ô tô chân thực cao cấp.
Tổng kết và triển vọng
Seedance 2.5 tăng cường hơn nữa khả năng hiểu và trình bày thế giới thực, đưa việc tạo video từ đầu ra cấp độ đoạn clip, tiến tới quy trình sáng tạo hoàn chỉnh hơn. Chúng tôi cũng thấy rằng, về tính hợp lý vật lý của chuyển động phức tạp, sự ổn định trong các kịch bản tương tác nhiều chủ thể, mô hình vẫn còn không gian để cải thiện.
Bài viết được AI dịch và tổng hợp tự động từ Seed: Research Feed (Dữ liệu nhúng trên web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.