KrASIA
85

Tin ngành

Seedance: Vũ khí giúp ByteDance trở lại đường đua AI

(giờ Việt Nam)

Tóm tắt AI

Mô hình video Seedance đang trở thành minh chứng thuyết phục cho khả năng thương mại hóa AI của ByteDance, sánh ngang với Claude của Anthropic.

Bản dịch AI

How Seedance put ByteDance back in the AI race

Vào cuối năm 2025, trong một bữa tối cùng nhóm phát triển mô hình, Zeng Yan, người đứng đầu mô hình Seedance, đã nói với quản lý của mình rằng cô vẫn muốn thử huấn luyện một mô hình lớn hơn, ít nhất là mô hình có 200 tỷ tham số.

Zeng là một nhà nghiên cứu trẻ trong nhóm Seed của ByteDance. Cô gia nhập công ty thông qua chương trình tuyển dụng sinh viên năm 2021, và nghiên cứu của cô tập trung vào lĩnh vực hiểu và tạo video. "Cô ấy luôn có khả năng đánh giá kỹ thuật rất tốt," một người từng làm việc với Zeng chia sẻ với 36Kr. "Cô ấy cũng rất chủ động. Khi tin tưởng vào điều gì đó, cô ấy khá kiên trì và sẽ tìm mọi cách để đấu tranh giành nguồn lực nhằm hiện thực hóa nó."

Nhận định đó phản ánh chính xác tình hình của Zeng trong quá trình huấn luyện Seedance 2.0. "Cô ấy muốn huấn luyện một mô hình có nhiều tham số hơn, nhưng lúc đó trong nhóm vẫn còn những bất đồng. Một số người cho rằng việc mở rộng quy mô mô hình trực tiếp lên mức 200–300 tỷ tham số là hơi mạo hiểm. Nguồn lực huấn luyện cũng rất hạn hẹp, vì vậy họ nghĩ rằng sẽ an toàn hơn nếu huấn luyện một mô hình ở mức khoảng 100 tỷ trước," một người am hiểu vấn đề chia sẻ với 36Kr.

Người này cho biết một lãnh đạo cấp cao tình cờ tham dự bữa tối đó. Sau khi biết về ý tưởng của Zeng, vị lãnh đạo này nói rằng có thể điều phối nguồn lực cho việc huấn luyện Seedance 2.0. "Sau đó, tại cuộc họp đánh giá nội bộ chính thức cuối cùng của Seed, người đứng đầu Seed là Wu Yonghui và Zhou Chang, người phụ trách mảng tạo đa phương thức hình ảnh, đã thảo luận và cuối cùng chọn ủng hộ ý tưởng của Zeng."

Lựa chọn kỹ thuật vốn bị coi là mạo hiểm vào thời điểm đó sau này đã được kiểm chứng. "Seedance 2.0 thành công chỉ vì Zeng kiên quyết rằng mô hình phải đủ lớn và dữ liệu huấn luyện phải đủ phong phú," người này cho biết.

36Kr đã phỏng vấn nhiều chuyên gia trí tuệ nhân tạo trong và ngoài ByteDance. Hầu hết đều cho rằng sự xoay chuyển về danh tiếng của ByteDance trong lĩnh vực mô hình nền tảng bắt đầu từ Seedance 2.0. Đối với các mô hình ngôn ngữ lớn (LLM), Doubao không được coi là gia nhập nhóm dẫn đầu tại Trung Quốc cho đến khi mô hình nền tảng của nó cập nhật lên phiên bản 1.6 vào giữa năm 2025. Khả năng lập trình của nó chưa có bước đột phá lớn trước khi Doubao 2.1 ra mắt, và tại Trung Quốc, nó vẫn tụt hậu so với các mô hình hàng đầu của các startup như Z.ai, Moonshot AI và DeepSeek. Ngược lại, Seedance 2.0 có thể được coi là mô hình đầu tiên, và hiện là mô hình duy nhất của ByteDance, đạt được ưu thế rõ rệt về hiệu suất.

Mô hình dẫn đầu này cũng là mô hình đầu tiên tạo ra doanh thu đáng kể cho ByteDance. 36Kr trước đó đã đưa tin độc quyền rằng, kể từ năm 2026, Volcano Engine đã liên tục nâng cao mục tiêu doanh thu cho mảng kinh doanh mô hình dịch vụ (MaaS) của mình. Tan Daize, người đứng đầu Volcano Engine, chia sẻ với 36Kr rằng hơn một nửa doanh thu MaaS của Volcano Engine trong năm nay đến từ Seedance.

ByteDance đã tìm thấy một mảng kinh doanh đầy hứa hẹn.

Có nhiều thông tin khác nhau về biên lợi nhuận của Seedance 2.0. LatePost trước đó đưa tin rằng biên lợi nhuận gộp của mô hình đạt 70%, trong khi một số chuyên gia AI chia sẻ với 36Kr rằng họ ước tính biên lợi nhuận gộp của Seedance 2.0 là 90%. Tuy nhiên, Tan cho biết thế giới bên ngoài đã quá chú trọng vào lợi nhuận của Seedance, và con số thực tế không cao đến vậy. Dù sao đi nữa, so với các LLM ở giai đoạn hiện tại, các mô hình video là một mảng kinh doanh tốt hơn ở Trung Quốc: chúng có thể đạt mức giá cao hơn và sự cạnh tranh ít gay gắt hơn.

ByteDance cũng đã xây dựng được một chu kỳ đặc trưng trên nhiều dòng kinh doanh. Các nền tảng nội dung như Hongguo và Douyin đang hỗ trợ các bộ phim do AI tạo ra nhiều hơn trước. Nhiều công ty sản xuất nội dung đang mua các mô hình từ Volcano Engine để sản xuất các bộ phim ngắn chất lượng cao do AI tạo ra. Sự bùng nổ của phim do AI tạo ra đang mang lại nhiều doanh thu quảng cáo hoặc lưu lượng truy cập trả phí hơn cho Hongguo và Douyin. Một vòng lặp đang hình thành.

Khi năng lực mô hình cải thiện theo từng bước nhảy vọt, chúng thường mở ra các kịch bản năng suất mới, và dòng tiền thay đổi theo đó. Điều này đã được kiểm chứng một lần sau khi Claude Opus 4.6 ra mắt. Với Seedance 2.0, điều này lại một lần nữa được xác nhận.

Seedance không chỉ là bước ngoặt lớn đầu tiên của ByteDance sau hơn ba năm trong lĩnh vực mô hình nền tảng. Nó còn cho ngành công nghiệp mô hình nền tảng rộng lớn hơn của Trung Quốc thấy một điều quan trọng: Các mô hình nền tảng đòi hỏi chi phí vốn khổng lồ, nhưng với biên lợi nhuận đủ cao, chúng cũng có thể kiếm ra tiền.

Tài năng và dữ liệu thúc đẩy bước ngoặt

ByteDance từ lâu đã sẵn sàng đầu tư mạnh mẽ vào AI. GPU, dữ liệu và nhân tài đều nhận được nguồn vốn đáng kể.

Nhân tài được ưu tiên hàng đầu.

ByteDance từ lâu đã thành thạo trong việc giao phó các mảng kinh doanh mới cho những nhân sự giàu kinh nghiệm, và ban đầu họ áp dụng cách tiếp cận này cho Seed. Nhưng sau hơn một năm, tiến độ vẫn còn hạn chế. Vào giữa năm 2024, ByteDance bắt đầu đặt cược lớn hơn vào việc tuyển dụng nhân tài AI. Đây là thay đổi lớn đầu tiên sau khi đội ngũ quản lý cốt lõi tham gia sâu vào mảng kinh doanh AI: săn lùng nhân tài mô hình nền tảng trên khắp thế giới, ngay cả với mức lương cực cao.

Vào giữa năm 2024, ByteDance thành lập một nhóm tuyển dụng chuyên phục vụ mảng kinh doanh AI. Điểm đặc biệt của nhóm này là nhiều nhân viên nhân sự có nền tảng kinh doanh vững chắc, giúp họ giao tiếp tốt hơn với các nhân tài AI cấp cao. Cả hai người lãnh đạo nhóm đều từng làm việc tại các mảng kinh doanh quan trọng của ByteDance và có kinh nghiệm chiến lược. ByteDance cũng dành cho nhóm này mức đãi ngộ cao. Nhân viên nhân sự làm công tác tuyển dụng cấp cao thường kiếm được hơn 1 triệu RMB (147.534 USD) một năm.

Một danh sách nhân tài cũng bắt đầu hình thành. Nó bao gồm những nhân tài AI hàng đầu tại Trung Quốc và nước ngoài. "Có vài trăm người trong danh sách này và nó được cập nhật liên tục," một nhân viên nhân sự tham gia tuyển dụng cấp cao cho biết. "Bộ phận Seed về cơ bản không cần tuân theo hệ thống lương của ByteDance khi đưa ra lời mời làm việc. Chỉ cần chúng tôi muốn tuyển ai đó, gói đãi ngộ có thể được tùy chỉnh."

Zhang Yiming, nhà sáng lập ByteDance, cũng quay trở lại vai trò chủ động hơn, thường xuyên gặp gỡ các nhân tài mô hình nền tảng để "trò chuyện trực tiếp". Nhiều nhà nghiên cứu cấp cao đã chọn gia nhập khi nhận được cả tiền bạc lẫn sự chân thành.

Con người rất quan trọng vì, như nhiều người trong ngành nhận định, "Nếu một nhà lãnh đạo giàu kinh nghiệm có khả năng đưa ra các đánh giá đúng đắn về định hướng dẫn dắt một nhóm những người trẻ đủ thông minh để thực hiện các thí nghiệm huấn luyện một cách ổn định, và được cung cấp đủ nguồn lực, thì kết quả khó mà tệ được."

Khi Zhou Chang và Wu Yonghui lần lượt gia nhập, Seed đã giảm bớt sự cạnh tranh nội bộ trong cùng các định hướng kỹ thuật, và các đánh giá của họ về định hướng kỹ thuật cũng như phương pháp huấn luyện trở nên hội tụ và chính xác hơn. Điều này đặc biệt rõ ràng ở Seedance.

Trước đó, ByteDance có hai nhóm độc lập huấn luyện các mô hình tạo video. Zeng Yan, tại phòng thí nghiệm AI, đang làm việc với PixelDance, trong khi Jiang Lu, tại Seed, đang làm việc với Seaweed. "Vào thời điểm đó, các phe phái khác nhau đã hình thành bên trong ByteDance. Các nhóm video khác nhau ban đầu đã chọn sai kiến trúc," một người am hiểu tình hình ban đầu cho biết.

Lấy phiên bản đầu tiên của PixelDance làm ví dụ. Nó chọn một kiến trúc mở rộng từ 2D U-Net sang 3D, có thể hiểu là biến một mô hình khuếch tán hình ảnh thành một mô hình video thay vì sử dụng một kiến trúc video gốc. Vào thời điểm mà con đường kỹ thuật cho việc tạo video còn lâu mới được xác định, điều này trông có vẻ nhanh hơn và an toàn hơn. Nhìn lại, nó đã chứng minh có trần hiệu suất thấp hơn.

Trong cùng giai đoạn đó, nhóm Kling AI của Kuaishou đã chọn cùng kiến trúc diffusion transformer (DiT) như Sora của OpenAI, và họ sử dụng phương pháp video gốc, vốn có trần hiệu suất cao hơn và cũng khó hơn. "Nếu con người và dữ liệu không kìm hãm nó, hiệu suất huấn luyện của mô hình sẽ không tệ," một người am hiểu vấn đề cho biết. Khoảng cách thời gian hình thành trong giai đoạn này đã cho phép Kling dẫn đầu trong gần một năm sau đó.

Vào cuối năm 2024, Jiang rời ByteDance để gia nhập Apple. Zeng gia nhập Seed sau những thay đổi về tổ chức tại phòng thí nghiệm AI và trở thành người chịu trách nhiệm chính của Seedance, mô hình tạo hình ảnh. Đó là một nhóm tinh gọn, chỉ với hơn mười kỹ sư thuật toán cốt lõi. Kể từ thời điểm đó, nhóm mô hình tạo video và con đường kỹ thuật của ByteDance bắt đầu hội tụ.

Trong quá trình chuyển đổi từ giai đoạn sau của PixelDance sang Seedance, thay đổi lớn nhất là sự điều chỉnh trong kiến trúc huấn luyện. Nhóm đã chuyển từ kiến trúc U-Net sang định hướng kiến trúc dựa trên DiT. Kiến trúc này có khả năng hiện thực hóa tốt hơn quy luật mở rộng (scaling law) của các mô hình nền tảng: Khi tham số, khối lượng dữ liệu và sức mạnh tính toán tăng lên, hiệu suất mô hình cải thiện đáng kể.

Nhưng cả Seedance 1.0 và 1.5 đều không thể coi là thành công. Cả hai phiên bản đều có khoảng cách rõ rệt với Veo của Google. Thị phần toàn cầu của chúng xếp hạng khoảng thứ tư, và tại Trung Quốc, chúng cũng đứng sau Kling. Một nhân viên Volcano Engine cho biết các đối thủ mà ByteDance theo dõi sát sao trong giai đoạn đó là Kling và Runway. "Nó đã đấu với Kling AI trong một thời gian khá dài," người này nói, nhưng vẫn không thể bắt kịp. Một giám đốc tiếp thị tại một công ty đại lý video chia sẻ với 36Kr rằng Kling từng nắm giữ gần 80% thị trường tạo video.

Cuộc cạnh tranh kéo dài giữa ByteDance và Kuaishou đã chuyển từ video ngắn, phát trực tiếp và thương mại điện tử sang các mô hình video.

Vào tháng 12 năm 2025, không lâu sau khi Seedance 1.5 lên sóng, nhóm đã bắt đầu đầu tư vào việc huấn luyện phiên bản 2.0. Điều đó sẽ dẫn đến bước ngoặt của Seedance.

"Seedance rất coi trọng dữ liệu huấn luyện và kiến trúc mô hình," một nhân viên Seed cho biết. Trong một so sánh đơn giản về số lượng GPU, ByteDance vẫn đi sau OpenAI và Google cả về số lượng lẫn chất lượng. Các công ty nước ngoài nhìn chung đã bắt đầu sử dụng các cụm lớn GPU dòng B của Nvidia, nghĩa là các cụm tính toán AI lớn được xây dựng với GPU Nvidia B200 và B300, để huấn luyện mô hình video. Bên trong ByteDance, mặc dù Seedance cũng có mức độ ưu tiên cao, nhưng nó vẫn xếp sau các mô hình ngôn ngữ và sử dụng các GPU ít tiên tiến hơn để huấn luyện. Kết quả là, nhóm chỉ có thể tập trung vào kiến trúc và dữ liệu.

Về con người và tổ chức, một doanh nhân mô hình nền tảng từng tiếp xúc với nhóm Seedance chia sẻ với 36Kr:

"Sự đổi mới công nghệ lớn thường đòi hỏi các nhà nghiên cứu thông minh và một môi trường nghiên cứu thoải mái để kích thích họ. Nhưng một khi con đường kỹ thuật đã được xác định, điều cần thiết là quản lý lịch trình nghiêm ngặt để đảm bảo mọi bước huấn luyện đều được thực hiện đúng cách. Nhóm Seedance thực sự đã làm tốt từng chi tiết. Hiệu quả chiến đấu của họ như một lực lượng phối hợp là rất mạnh mẽ."

Yếu tố được coi là quan trọng nhất đối với sự thành công của Seedance 2.0 chính là dữ liệu được sử dụng để huấn luyện.

Giai đoạn tiền huấn luyện của các mô hình nền tảng đòi hỏi nhiều thí nghiệm quy mô nhỏ. Nó cần nhiều người để xử lý các tiêu chuẩn dữ liệu, tổng hợp, tìm nguồn, chú thích, làm sạch, đánh giá và các công việc khác. Nó cũng đòi hỏi một lượng dữ liệu phong phú và đa dạng.

"Việc chú thích dữ liệu của Seedance được thực hiện rất mạnh mẽ. Điều đó cho phép các câu lệnh (prompt) của người dùng được khớp rất chính xác với dữ liệu cụ thể," một người am hiểu vấn đề chia sẻ với 36Kr. Bên trong ByteDance, chỉ riêng nhóm thực hiện đánh giá dữ liệu mô hình cho Seedance đã có hơn 1.000 người.

Để so sánh, đối với nhiều startup hàng đầu trong lĩnh vực video, một nhóm đánh giá nội bộ gồm vài chục người đã được coi là một khoản đầu tư tương đối lớn. Đằng sau mỗi kỹ sư thuật toán Seedance thường có hơn mười nhân viên dữ liệu hỗ trợ. Nhóm dữ liệu khổng lồ này cần nhanh chóng cung cấp dữ liệu cần thiết cho các kỹ sư thuật toán để thử nghiệm và huấn luyện, đồng thời thu thập phản hồi của người dùng để đảm bảo nhân sự thuật toán có thể nhanh chóng nắm bắt bất kỳ tín hiệu nào hữu ích cho việc lặp lại mô hình.

Trong nhóm thuật toán Seedance, cũng có một người chịu trách nhiệm cụ thể về việc kết nối với nhóm dữ liệu. Nhiều người thân cận với Seed chia sẻ với 36Kr rằng vai trò này giống như một quản lý sản phẩm dữ liệu trong một nhóm huấn luyện và cực kỳ quan trọng. Người này hiểu rõ loại dữ liệu nào cần cho việc huấn luyện, có thể đưa ra các yêu cầu rõ ràng và hiệu quả cho nhóm dữ liệu, và nhóm thuật toán thậm chí còn tự xây dựng dữ liệu và tự thực hiện làm sạch dữ liệu tinh chỉnh.

Về lựa chọn dữ liệu cụ thể, Seedance hầu như không sử dụng dữ liệu Douyin. Thay vào đó, họ đã mua một lượng lớn tài nguyên phim và truyền hình, đặc biệt là số lượng lớn các tài liệu điện ảnh chất lượng cao. Sau đó, họ sử dụng các mô hình ngôn ngữ để chia nhỏ chúng thành kịch bản và bảng phân cảnh. "Hiệu quả giống như đưa một nhóm bậc thầy điện ảnh vào mô hình vậy."

Nhóm thực hiện huấn luyện dữ liệu có mục tiêu cho các kịch bản khác nhau. Ví dụ: "Seedance 2.0 đã nghiên cứu một cách hệ thống các tác phẩm điện ảnh và truyền hình giàu các chuyển động chạy và nhảy vì chúng có thể tái tạo nhiều kịch bản chuyển động thực tế. Nhóm cũng mô phỏng hoặc quay màn hình các trò chơi để học hỏi từ chúng, và sử dụng dữ liệu kịch bản chuyên nghiệp để giúp mô hình học các không gian trong nhà khác nhau," một nhân viên dữ liệu của ByteDance chia sẻ với 36Kr. Dữ liệu từ các kịch bản đa dạng này đã tạo nên tập dữ liệu huấn luyện khổng lồ của Seedance 2.0.

ByteDanceSeedanceAI VideoThương mại hóa AICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ KrASIA. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.