Sản phẩm
Seedance 2.5 ra mắt: Tạo video 30 giây, hỗ trợ đa phương thức và chỉnh sửa chuyên sâu
(giờ Việt Nam)
Tóm tắt AI
Seedance 2.5 cho phép tạo video chất lượng cao dài 30 giây trong một lần xuất, hỗ trợ tham chiếu đa phương thức (ảnh, video, âm thanh) và kiểm soát chỉnh sửa theo thời gian thực, giúp tạo nội dung dài liền mạch.
Bản dịch AI
Hôm nay, chúng tôi chính thức ra mắt Seedance 2.5, mô hình sáng tạo video thế hệ mới. Kể từ khi phát hành Seedance 2.0, chúng tôi nhận thấy sự thay đổi trong kỳ vọng của người dùng đối với các mô hình tạo video: từ việc chỉ đơn thuần tạo ra một đoạn clip ngắn sang việc hoàn thiện một tác phẩm sáng tạo. Dựa trên kiến trúc tạo đồng thời âm thanh-hình ảnh đa phương thức thống nhất của Seedance 2.0, Seedance 2.5 tập trung vào khả năng tạo nền tảng và tạo dựa trên tham chiếu, mang đến những đột phá lớn trong kể chuyện dài hơi, tham chiếu đa phương thức và chỉnh sửa. Được xây dựng dựa trên các trường hợp sử dụng thực tế, mô hình này mở ra khả năng sáng tạo và quyền kiểm soát lớn hơn, đồng thời thúc đẩy năng suất làm việc.
Những điểm nổi bật chính bao gồm:
Thời lượng lên đến 30 giây mỗi lần tạo, hỗ trợ mở rộng nhiều vòng: Seedance 2.5 có thể tạo các đoạn clip âm thanh-hình ảnh chất lượng cao dài 30 giây trong một lần thực hiện và hỗ trợ nhiều vòng mở rộng. Mô hình cũng cải thiện quá trình chuyển cảnh và thay đổi bối cảnh để tăng tính liên tục cho các video dài hơn, đồng thời mang lại những cải tiến đáng kể về chất lượng hình ảnh, âm thanh và chuyển động, tạo ra chất lượng hình ảnh tự nhiên và trau chuốt hơn so với các video do AI tạo ra thông thường. Nhờ đó, người dùng có thể sản xuất nội dung chất lượng cao dài nhiều phút với ngôn ngữ nghe nhìn nhất quán, hiện thực hóa một câu chuyện hoàn chỉnh chỉ trong một lần quay.
Nâng cấp toàn diện khả năng tham chiếu đa phương thức: Người dùng hiện có thể nhập tối đa 30 hình ảnh, 10 đoạn video và 10 đoạn âm thanh làm tài liệu tham chiếu trong một lần thực hiện. Mô hình cũng tăng cường hàng loạt khả năng tham chiếu, bao gồm kết xuất đất sét (clay render), chuyển động và tham chiếu sáng tạo, giúp nắm bắt ý đồ của người sáng tạo tốt hơn và hiện thực hóa các ý tưởng phức tạp trải dài trên nhiều chủ thể, bối cảnh và thay đổi góc quay.
Khả năng chỉnh sửa chính xác và ổn định hơn: Seedance 2.5 cung cấp khả năng kiểm soát theo mốc thời gian (timestamp) để chỉnh sửa có mục tiêu nội dung âm thanh và video, giúp cải thiện đáng kể hiệu quả và khả năng kiểm soát. Mô hình cũng tăng cường các tính năng chỉnh sửa nâng cao như phông xanh (green screen), góc máy quay và chỉnh sửa dựa trên tham chiếu để đáp ứng các yêu cầu khắt khe của các lĩnh vực chuyên nghiệp, phức tạp như điện ảnh và quảng cáo.
Với những tiến bộ trong kể chuyện dài hơi, tham chiếu đa phương thức và chỉnh sửa, Seedance 2.5 vượt xa khả năng tạo video dài trong một lần thực hiện. Mô hình hiểu rõ hơn ý đồ sáng tạo và mang lại hành trình từ ý tưởng đến video hoàn chỉnh với khả năng kiểm soát tốt hơn. Bây giờ, chúng tôi xin mời bạn xem một bộ phim sáng tạo ngắn, được sản xuất từ đầu đến cuối bởi Seedance 2.5.
Hôm nay, Seedance 2.5 đang được triển khai trên Jimeng AI, Doubao Pro và các nền tảng khác, với quyền truy cập API sẽ sớm ra mắt thông qua BytePlus ModelArk. Chúng tôi mời bạn trải nghiệm và chia sẻ phản hồi của mình.
Trang chủ dự án:
https://seed.bytedance.com/seedance2_5
Truy cập:
Jimeng Web -> Video Generation -> Chọn Seedance 2.5
Doubao Pro -> Video Generation -> Chọn Seedance 2.5
Kể chuyện dài hơi 30 giây với các vòng mở rộng: trình bày câu chuyện hoàn chỉnh trong một lần thực hiện
Seedance 2.5 mở rộng khả năng tạo video từ 15 lên 30 giây và tăng cường hơn nữa khả năng kể chuyện trong các video dài. Trong vòng 30 giây, mô hình có thể sắp xếp nhiều cảnh quay có liên kết logic để câu chuyện diễn ra qua các giai đoạn thiết lập, phát triển, cao trào và giải quyết, thay vì chỉ đơn thuần kéo dài một khoảnh khắc. Ví dụ, trong một clip quay liền mạch về buổi biểu diễn trên sân khấu của một ca sĩ, mô hình khắc họa toàn bộ câu chuyện từ lúc ca sĩ tương tác với nhân viên trong phòng thay đồ, sau đó đi qua hành lang hậu trường, gặp gỡ các vũ công và bước lên sân khấu cùng họ để biểu diễn, thay vì chỉ tập trung vào khoảnh khắc bước lên sân khấu.
T2V prompt: Cú máy quay cầm tay (handheld gimbal) theo dõi liền mạch. Máy quay từ từ đẩy vào qua khe hở của tấm rèm đỏ dày và tiến vào phòng thay đồ hậu trường tông màu ấm. Một nữ ca sĩ trẻ, quay lưng về phía máy quay, đang chỉnh tai nghe khi một nhân viên nhắc cô đã đến giờ lên sân khấu. Cô quay lại phía máy quay và bắt đầu hát nhạc citypop. Máy quay lùi lại và theo dõi cô khi cô đi qua tấm rèm vào hành lang hậu trường mờ ảo, tương tác tự nhiên với các vũ công trên đường đi; một nhân viên đưa cho cô micro. Sau đó, cô và các vũ công bước lên sân khấu, máy quay lượn vòng ra phía sau, dần dần để lộ thiết kế sân khấu đỏ-đen, màn hình LED, đèn sân khấu, khói và sàn phản chiếu. Cuối cùng, máy quay lùi ra thành cú máy toàn cảnh (wide shot) của nhà thi đấu, cho thấy khán giả đông đúc, bảng đèn, gậy phát sáng và đám đông đang cổ vũ, ghi lại cao trào trẻ trung, đầy tự do của buổi hòa nhạc.
Nhờ khả năng mở rộng nhiều vòng của mô hình, người dùng có thể thêm các cảnh quay tiếp theo vào các video đã xuất một cách mượt mà. Trong suốt quá trình mở rộng, mô hình duy trì sự nhất quán của các nhân vật chính, môi trường và nhịp độ kể chuyện. Điều này cho phép người dùng xuất các video dài vài phút cùng lúc, giảm bớt công sức cắt ghép, nối cảnh và sửa lỗi chuyển cảnh.
R2V prompt: Mở rộng video. Tiếp tục từ hình ảnh và chủ thể trong @Video 1 và tạo thêm một clip 30 giây nữa, giữ cho các chủ thể nhân vật, bối cảnh, phong cách hình ảnh và hiệu ứng âm thanh nhất quán. Cậu bé chạy dọc theo toa tàu, tay cầm quả bóng đá. Khi tàu điện ngầm dừng lại, cửa bên mở ra và cậu bé lao ra ngoài ngay lập tức, nam chính đuổi theo sau. Cả hai chạy băng qua sân ga và ra ngoài đường phố, khiến người qua đường và xe cộ giật mình. Nam chính cuối cùng cũng đuổi kịp và tóm lấy cậu bé. Cậu bé ngước nhìn lên, vẻ mặt ấm ức. Sự giận dữ của nam chính dần tan biến; anh vỗ đầu cậu bé và nở một nụ cười bất lực.
Về mặt trình diễn hình ảnh, mô hình đạt được sự chuyển tiếp mượt mà hơn giữa các chuyển động máy quay. Chủ thể chính vẫn ổn định qua nhiều lần cắt cảnh, âm thanh và hình ảnh vẫn đồng bộ, tạo ra các video dài có tính liên kết cao. Ví dụ, trong một cảnh Kinh kịch, máy quay thực hiện một cú lia vòng duyên dáng theo tà áo dài thướt tha của diễn viên chính, trong khi chủ thể chính và hậu cảnh vẫn hoàn toàn nhất quán. Sự đung đưa của tà áo tạo thành những đường cong tự nhiên trong không trung, tuân thủ chặt chẽ các quy luật vật lý thực tế.
R2V prompt: Màn hình rộng 16:9, kết cấu điện ảnh, quay liền mạch (single continuous take), chuyển động máy quay mượt mà, không cắt cảnh. Tham chiếu bối cảnh: @Image 4. 0–5s: Mở đầu bằng cận cảnh Bá Vương từ @Image 2. Máy quay từ từ xoay quanh phần thân trên của anh ấy và chuyển sang trung cảnh. Bá Vương xoay người, cờ sau lưng quét nhanh qua ống kính tạo thành vật cản tự nhiên, và máy quay theo đó chuyển sang phía Ngu Cơ trong @Image 1. 6–10s: Máy quay xoay đều quanh Ngu Cơ ở trung cảnh từ @Image 1, theo sát dải lụa nước của cô qua vòng cung. Cô giơ tay, búng cổ tay, tung dải lụa và xoay nửa người. Sau đó, cô thu dải lụa lại, giữ tư thế và nhìn nghiêng về phía Bá Vương. 11–20s: Võ tướng từ @Image 3 xuất hiện với cú lộn nhào trên không. Bá Vương chiếm vị trí trung tâm trong khi võ tướng tiến và lùi ở phía đối diện trong một màn giao đấu. Ngu Cơ đứng hơi lùi về phía sau và bên cạnh Bá Vương, đan xen các động tác múa lụa để lấy sự mềm mại đối lập với sự mạnh mẽ. Máy quay từ từ lùi lại từ cận trung cảnh của võ tướng ra toàn cảnh sân khấu. Cuối cùng, cả ba hướng về phía khán giả và thực hiện tư thế kết thúc Kinh kịch đồng bộ.
Ngoài ra, để giải quyết vẻ ngoài quá nhân tạo thường thấy trong các video do AI tạo ra, Seedance 2.5 tối ưu hóa một cách hệ thống các chi tiết như kết cấu vật thể, đặc điểm da và mắt, ánh sáng và độ bão hòa màu sắc. Mô hình cũng giảm thiểu các hiện tượng không kiểm soát được trong phụ đề và nhạc nền, mang lại sản phẩm cuối cùng có chất lượng điện ảnh gần giống với cảnh quay thực tế.
Nâng cấp toàn diện về tham chiếu đa phương thức, mang lại khả năng kiểm soát lớn hơn cho các tác vụ sáng tạo phức tạp
Seedance 2.5 tăng cường hơn nữa khả năng tạo tham chiếu đa phương thức. Nó cho phép người dùng nhập tối đa 30 hình ảnh, 10 đoạn video và 10 đoạn âm thanh làm tài liệu tham chiếu trong một lần thực hiện. Khối lượng lớn hơn và sự đa dạng hơn của các tham chiếu có thể nắm bắt ý đồ của người dùng tốt hơn, tạo ra các video phức tạp với nhiều chủ thể hơn, bối cảnh phong phú hơn và kỹ thuật quay linh hoạt hơn.
Mô hình hiểu toàn diện các yếu tố như bố cục hình ảnh, bối cảnh, phong cách, nhân vật và đạo cụ trên tất cả các tài liệu, áp dụng chúng vào quá trình tạo video theo hướng dẫn. Ngay cả trong các tình huống phức tạp như cảnh quay nhiều nhân vật hoặc kể chuyện nhóm, nó có thể bảo toàn ngoại hình và giọng nói của nhiều nhân vật trong khi vẫn giữ cho đặc điểm của từng chủ thể ổn định.
R2V prompt: Một chuỗi hòa nhạc 30 giây ở định dạng ngang 16:9, với độ chân thực điện ảnh, ánh sáng và bóng đổ của phòng hòa nhạc đích thực, ánh sáng sân khấu vàng ấm áp và bầu không khí của một buổi hòa nhạc cổ điển trang trọng. Sử dụng @Image 1 cho địa điểm. Tham chiếu @Image 2 cho nghệ sĩ piano. Tham chiếu @Image 3 cho đàn cello. Tham chiếu @Image 4 cho đàn violin. Ca sĩ chính phải tuân thủ nghiêm ngặt @Image 5. Tham chiếu @Images 6 đến 10 cho phần còn lại của dàn nhạc. Tham chiếu @Images 11 đến 14 cho dàn hợp xướng. Tham chiếu @Images 15 đến 18 cho chỗ ngồi của khán giả. Ca sĩ chính đi từ trung tâm sân khấu về phía mép trước. Nghệ sĩ piano đứng cạnh đàn piano. Dàn nhạc được sắp xếp ở cả hai bên và phía sau. Dàn hợp xướng đứng ở phía sau sân khấu. Mở đầu bằng cú máy toàn cảnh từ trên cao của toàn bộ phòng hòa nhạc. Nghệ sĩ piano nhấn phím, ca sĩ chính bước vào ánh đèn sân khấu và bắt đầu hát. Máy quay di chuyển tự nhiên qua violin, cello và dàn nhạc khi họ biểu diễn cùng nhau, với tiếng violin tươi sáng và tiếng cello ấm áp. Ở phần sau, dàn hợp xướng tham gia. Ca sĩ chính giao tiếp bằng mắt ngắn gọn với khán giả hàng ghế đầu, họ đáp lại bằng nụ cười và cái gật đầu nhẹ. Trong cảnh quay cuối, máy quay lùi lại. Tiếng hát kết thúc và khán giả cùng vỗ tay.
Seedance 2.5 cũng nâng cao các khả năng tham chiếu cụ thể bao gồm kết xuất đất sét, chuyển động và tham chiếu sáng tạo, giúp người dùng kiểm soát tốt hơn các chủ thể, hành động và kỹ thuật quay trong khung hình. Ví dụ, với tham chiếu kết xuất đất sét, người dùng có thể xây dựng cấu trúc không gian của bối cảnh, tư thế nhân vật, đường chuyển động và góc máy bằng các mô hình 3D không có kết cấu. Sau đó, mô hình sử dụng cấu trúc này để tạo video, đảm bảo rằng bố cục và cách dàn dựng các cảnh quay phức tạp khớp chặt chẽ với kỳ vọng của người sáng tạo. Ngoài ra, Seedance 2.5 cải thiện khả năng kiểm soát ánh sáng. Bằng cách tận dụng thông tin không gian từ kết xuất đất sét, nó tạo ra các hiệu ứng ánh sáng chân thực tuân theo các quy luật vật lý, chẳng hạn như hướng nguồn sáng, nhiệt độ màu, cường độ và sự đổ bóng. Điều này dẫn đến ánh sáng và bóng đổ tự nhiên hơn trong kết quả đầu ra cuối cùng.
R2V prompt: Tham chiếu @Clay Render 1 cho chuyển động máy quay, nhịp độ, chuyển đổi kích thước cảnh quay, quỹ đạo chủ thể và cách dàn dựng. Tham chiếu @Image 2 cho thiết kế nhân vật, bối cảnh, vật liệu, ánh sáng, màu sắc và bầu không khí cổ tích, và kết xuất mô hình trắng thành một bộ phim hoạt hình 3D ngắn mơ mộng, ấm áp với cảm giác giả tưởng trẻ thơ. Câu chuyện diễn ra như sau: bay qua bầu trời giả tưởng → các loài thú thần thoại bay cùng qua biển mây → lặn xuống đại dương → len lỏi qua vùng nước sâu cùng cá đuối → đi qua một vết nứt phản chiếu trong không gian-thời gian → hái sao từ vũ trụ → biến hình trở lại phòng ngủ → cha đắp chăn → cuốn sách tranh đóng lại và dừng ở khung hình cuối cùng.
Chỉnh sửa chính xác và đáng tin cậy hơn để đạt hiệu quả sáng tạo cao hơn
Trong sáng tạo video, người dùng thường cần kiểm soát nhịp độ trong quá trình tạo và tinh chỉnh chi tiết sau đó. Giây chính xác mà một hành động xảy ra, thời điểm chính xác của một cú cắt cảnh và việc liệu chuyển động của nhân vật trong một clip cụ thể có cần điều chỉnh hay không đều ảnh hưởng sâu sắc đến kết quả cuối cùng. Khả năng chỉnh sửa chính xác và đáng tin cậy hơn cho phép người sáng tạo hiện thực hóa ý tưởng của họ một cách chính xác, cải thiện hiệu quả và giảm chi phí tạo lại nhiều lần.
Seedance 2.5 hỗ trợ chỉnh sửa nội dung chính xác thông qua mốc thời gian. Trong giai đoạn tạo, người dùng có thể sử dụng các câu lệnh (prompt) để kiểm soát câu chuyện, góc máy quay, chuyển động và nhịp điệu tổng thể cho một khung thời gian cụ thể, giúp kết quả đầu ra phù hợp hơn với ý đồ sáng tạo. Sau khi tạo, người dùng có thể thực hiện các sửa đổi có mục tiêu đối với nhân vật, hành động hoặc các yếu tố cốt truyện trong các clip cụ thể, tất cả trong khi vẫn duy trì tính liên tục và chân thực trước và sau khi chỉnh sửa.
Seedance 2.5 cũng nâng tầm nhiều tính năng chỉnh sửa, chẳng hạn như chỉnh sửa phông xanh, chỉnh sửa góc máy quay và chỉnh sửa dựa trên tham chiếu, để đáp ứng các yêu cầu khắt khe của các lĩnh vực chuyên nghiệp như điện ảnh và quảng cáo. Ví dụ, trong chỉnh sửa phông xanh, mô hình có thể thay thế hậu cảnh và kể những câu chuyện hoàn toàn khác biệt trong khi vẫn giữ nguyên chủ thể chính. Hơn nữa, nó xuất sắc trong việc kết xuất cách chủ thể phản ứng với các quy luật vật lý của môi trường mới. Điều này bao gồm hướng bay của quần áo, trạng thái của tóc, nhịp điệu dáng đi và sự tương tác ánh sáng, đảm bảo chủ thể hòa hợp với bối cảnh.
R2V prompt: Sử dụng @Video 1, kết xuất hậu cảnh phông xanh, chướng ngại vật, trang phục và các nhân vật phụ. 0–4s: huấn luyện ngoài trời, thay thế các chướng ngại vật bằng đá, gạch, lốp xe và thùng gỗ. 4–10s: phòng thay đồ, bạn bè đưa ra lời động viên. 10–15s: trận đấu quốc tế, thay thế các cột huấn luyện bằng các hậu vệ và thủ môn thực thụ, và nhân vật chính ghi bàn. Tổng thể chân thực, chất lượng điện ảnh.
R2V prompt: Chỉnh sửa @Video 1. Giữ nguyên các nhân vật, hành động và phong cách hình ảnh. Chỉ điều chỉnh chuyển động máy quay. Kế hoạch máy quay phân đoạn 15 giây: 0–4s, một cú di chuyển micro-FPV lướt sát qua chảo, sau đó theo sát bánh mì nướng đang nảy lên và lia nhanh (whip-pan) sang cà phê; 4–7s, đẩy vào và theo dõi theo chiều ngang dọc theo vành chảo, theo sát quả trứng ốp la khi nó lật lên và rơi trở lại vị trí cũ; 7–11s, nhanh chóng nâng lên góc nhìn từ trên xuống (top-down), sau đó hạ xuống với tốc độ ổn định, quét qua đĩa và phím đàn; 11–15s, sử dụng cận cảnh cầm tay để theo dõi đôi bàn tay với một cú lia ngang nhanh, sau đó đẩy vào bữa sáng và lùi lại thành trung cảnh hai người. Giữ cho toàn bộ chuỗi cảnh mượt mà, liên tục và ổn định.
Đi sâu hơn vào các kịch bản công nghiệp rộng lớn hơn, không ngừng khám phá giá trị thực tế
Khi khả năng của mô hình phát triển, Seedance 2.5 đang vươn sâu hơn vào các kịch bản công nghiệp rộng lớn hơn như giáo dục và sản xuất. Trong giáo dục, mô hình đã bắt đầu đi vào các môi trường học tập thực tế. Ví dụ, Seedance 2.5 có thể biến bối cảnh lịch sử, nhân vật và cốt truyện đằng sau một bài học thành hình ảnh sống động và nhập vai hơn. Nó cũng giúp giáo viên sản xuất video hướng dẫn hiệu quả hơn, biến nội dung trừu tượng — nguyên lý khoa học, sự kiện lịch sử, quy trình thí nghiệm — thành các minh họa động. Điều này không chỉ hạ thấp rào cản sản xuất tài liệu giáo dục mà còn cho phép tùy chỉnh nội dung linh hoạt.
Một ví dụ về kịch bản "Lớp học Doubao" của ứng dụng Doubao Learning
R2V prompt: Phong cách hội họa phương Đông biểu cảm. Một cảnh đường phố ở Lâm An thời Nam Tống. Vài đứa trẻ chạy và hét vang qua con phố nhộn nhịp, hô vang: "Ta quay đầu lại, và anh ấy ở đó, nơi ánh đèn lồng mờ dần". Máy quay theo chân những đứa trẻ khi chúng chạy, quét qua con phố sống động. Sau đó, máy quay nghiêng lên để lộ Tân Khí Tật từ @Image 1. Tân Khí Tật quay đầu lại, và ở phía xa, một người đàn ông đứng giữa ánh đèn lồng đang mờ dần. Cảnh quay được giữ liên tục xuyên suốt.
Trong các lĩnh vực như sản xuất công nghiệp, trí tuệ hiện thân (embodied intelligence) và lái xe tự động, Seedance 2.5 đang được tích hợp vào các quy trình sản xuất rất cụ thể. Mô hình có thể tạo ra dữ liệu video tổng hợp chất lượng cao giúp huấn luyện các kỹ năng nhận thức và thao tác của robot. Nó cũng đang được sử dụng cho mô phỏng công nghiệp, đào tạo quy trình và trình diễn thiết bị. Đối với lái xe tự động, mô hình có thể mô phỏng các kịch bản đuôi dài (long-tail scenarios), chẳng hạn như thời tiết khắc nghiệt và điều kiện giao thông phức tạp, cung cấp các mẫu đa dạng hơn để kiểm tra và huấn luyện hệ thống.
R2V prompt: Tham chiếu kỹ thuật quay, bố cục, quy mô cảnh quay, mối quan hệ không gian, vị trí bộ phận, cấu trúc mô hình, thứ tự lắp ráp và đường chuyển động từ @Clay Render 1. Tham chiếu vật liệu, ánh sáng, màu sắc, phản chiếu và bầu không khí từ @Image 1, và biến kết xuất đất sét thành một chuỗi lắp ráp ô tô cao cấp, chân thực.
Tóm tắt và hướng tới tương lai
Seedance 2.5 đánh dấu một bước tiến quan trọng trong việc hiểu và kết xuất thế giới thực, nâng tầm việc tạo video từ các đầu ra cấp độ clip sang các quy trình sáng tạo toàn diện. Đồng thời, chúng tôi nhận thấy vẫn còn dư địa để cải thiện, đặc biệt là về tính hợp lý vật lý của các chuyển động phức tạp và sự ổn định của các cảnh liên quan đến tương tác giữa nhiều chủ thể.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.