Sản phẩm
Funeral AI ra mắt Meme Bench: Bộ tiêu chuẩn mới đánh giá năng lực mô hình video
(giờ Việt Nam)
Tóm tắt AI
Funeral AI vừa giới thiệu Meme Bench, bộ tiêu chuẩn được phát triển trong nửa tháng nhằm đánh giá toàn diện và khách quan hiệu suất của các mô hình tạo video hiện nay.
Bản dịch AI

"🤡meme bench đã ra mắt"
Để đánh giá tốt hơn năng lực của các mô hình video, Zang AI đã dành nửa tháng cho một dự án lớn: meme bench.
Hầu hết mọi người không nhận ra một điểm mù ở đây — việc một mô hình lớn có "tốt" hay không là vấn đề của định nghĩa. Benchmark (bộ tiêu chuẩn đánh giá) chính là quyền lực.
Mô hình video Seedance 2.0 của ByteDance đã bất bại trong sáu tháng qua. Seedance 2.5 đã cải thiện ở một số khía cạnh, nhưng liệu điều đó có nhất thiết đồng nghĩa với việc 2.5 tốt hơn 2.0?
Không hẳn.
Seedance 2.5 đã tăng cường đặc biệt về chất lượng điện ảnh, đi kèm với mức giá tăng vọt. Tuy nhiên, về khả năng tuân thủ chỉ dẫn, chuyển động phức tạp và các khía cạnh khác, nó thực sự đã thụt lùi.
meme bench là một bài kiểm tra mù (blind test) về tạo video ngắn. Nó bao gồm 50 câu lệnh (prompt), tất cả đều là các meme hot trên Bilibili và Douyin. Chúng tôi yêu cầu tất cả các mô hình tạo video từ cùng một hình ảnh và câu lệnh, sau đó mời 400 sinh viên đại học và khách quen tại các tiệm internet bình chọn mù trên một trang web — chỉ đơn giản là chọn video nào trông đẹp hơn.
Niềm tin cốt lõi của chúng tôi: định nghĩa về việc điều gì tạo nên một mô hình video tốt nên thuộc về số đông, chứ không phải một vài nhà nghiên cứu.
Bởi vì đây là thứ bạn có thể nhìn thấy ngay lập tức. Tạo một video AI, và ai giỏi hơn là điều hiển nhiên.
meme bench sử dụng hệ thống xếp hạng Elo phổ biến trong các giải đấu cờ vua: đánh bại một mô hình mạnh sẽ kiếm được nhiều điểm hơn, thua một mô hình yếu sẽ mất nhiều điểm hơn, và tất cả các cặp đối đầu đều được kết nối để tính toán sức mạnh tương đối giữa các mô hình. Điều này ngăn chặn việc bảng xếp hạng bị sai lệch do quá nhiều hoặc quá ít nhãn trên bất kỳ mô hình đơn lẻ nào.
Chỉ có một mục tiêu cốt lõi: Các mô hình SOTA (hiện đại nhất) phải được lựa chọn bởi người dân! Việc đánh giá phải phục vụ đại chúng!
Rất bất ngờ, MiniMax H3 đã giành vị trí đầu bảng, với số điểm gần bằng Seedance 2.0 — và cả hai đều vượt qua Seedance 2.5 một chút.

Ban đầu chúng tôi nghĩ rằng có thể do quy mô mẫu không đủ lớn. Sau khi mở rộng khối lượng kiểm tra, khoảng cách dẫn trước của H3 và Seedance 2.0 thực sự đã nới rộng — H3 cuối cùng duy trì tỷ lệ thắng 55% trước Seedance 2.5.
Đây là trang web kiểm tra của chúng tôi. Bạn có thể tự mình thực hiện bài kiểm tra và điểm số của bạn sẽ được đưa vào bảng xếp hạng. Hãy xem bạn cuối cùng sẽ chọn mô hình nào.
https://video-arena.com (khuyến khích mở bằng trình duyệt)
Lưu ý đặc biệt: meme bench không nhận bất kỳ khoản tài trợ nào. Chúng tôi cũng không thể dự đoán được rằng hàng trăm khách quen tại các tiệm internet lại tạo ra kết quả này.
Hãy để tôi giải thích cách meme bench được xây dựng.
Ý định ban đầu là đo lường năng lực của mô hình video theo một cách thú vị hơn.
Vì vậy, chúng tôi đã tự tay tuyển chọn 50 meme phổ biến từ Bilibili và Douyin, đồng thời viết các câu lệnh cường điệu cho mỗi hình ảnh để kiểm tra các tình huống mà các mô hình có khả năng chưa được đào tạo cụ thể.
Ví dụ như yêu cầu Brother Crow xoay người như một chiếc trực thăng.
Lợi ích của việc làm cho việc đánh giá mô hình trở nên dễ tiếp cận hơn là chúng ta có thể khai thác sức mạnh của quần chúng. Qiu Mu thường xuyên lui tới các tiệm internet hơn tôi, vì vậy cậu ấy đã huy động đội ngũ tại tiệm, và thông qua các nhóm việc làm cho sinh viên đại học cùng các kênh khác, cuối cùng đã tuyển được 400 lượt người tham gia dán nhãn, tức là hoàn thành một vòng câu hỏi kiểm tra đầy đủ.
Thách thức lớn nhất trong các nhóm việc làm cho sinh viên đại học: những người này đã quen với việc nhận phong bì đỏ cho các khảo sát, nên khi chúng tôi cố gắng trả tiền trực tiếp cho họ, chúng tôi liên tục bị loại vì bị coi là kẻ lừa đảo.
Trước khi Seedance 2.5 và H3 ra mắt, bảng xếp hạng meme bench rất đơn giản — Seedance 2.0 dẫn đầu áp đảo tất cả các mô hình khác. Các video ngắn do nó tạo ra có chất lượng hoàn thiện cao nhất, khả năng tuân thủ chỉ dẫn tốt nhất và rõ ràng là chiếm ưu thế.
Ví dụ, trong video "núm vú của một người đàn ông biến thành hợp kim titan và bắn tia laser cắt một ngôi nhà thành bốn mảnh", gần như chỉ có Seedance 2.0 tuân thủ đúng các chỉ dẫn. Các mô hình khác quá rụt rè, với các tia laser bắn ra từ các vị trí sai lệch.
Đặc biệt trong các cảnh phức tạp, cảnh quay của Seedance 2.0 mượt mà và phong phú hơn đáng kể, thậm chí còn tự biên tập và điều khiển camera. Nhưng vấn đề là: Seedance 2.0 đôi khi có chuyển động không liên tục, bỏ qua các bước trung gian. Trong video "điện thoại của một người đàn ông đột nhiên phóng điện, giật chết cả người đàn ông và cá dưới sông", Seedance 2.0 nhảy thẳng từ cảnh điện thoại phóng điện sang một cánh đồng cá chết, mà không hiển thị đường dẫn điện.
Đây cũng là cách MiniMax H3 vượt lên từ phía sau: khả năng tuân thủ chỉ dẫn cực kỳ mạnh mẽ.
Trong meme bench của chúng tôi, MiniMax H3 gần giống như một phiên bản nâng cấp của Seedance 2.0. Qua nhiều bài kiểm tra, H3 đạt được cảnh quay mạch lạc, mượt mà — tốt hơn đáng kể so với Seedance 2.0, vốn thường bỏ qua các quy trình trong các chuyển động phức tạp.
Ví dụ, trong cảnh "một đám người bò trên mặt đất trong những tư thế vặn vẹo, kết nối thành hình con rết", Seedance 2.0 đã bỏ qua quá trình mọi người kết nối thành hình con rết, khiến cảnh quay trở nên cực kỳ kỳ quái.
H3 cũng cho thấy khả năng tốt hơn trong việc tạo ra các cảnh phức tạp. Trong video "màn hình xanh với hàng tấn chim nhỏ xuất hiện", chuyển động của H3 tự nhiên hơn của Seedance 2.0. Đặc biệt là cách đàn chim xuất hiện — H3 có sự tiến triển dần dần, trong khi Seedance 2.0 tạo ra một khối chim ùa ra vi phạm vật lý.
So với các mô hình video hạng hai, lợi thế của H3 thậm chí còn rõ rệt hơn. Đặc biệt trong các cảnh hành động cường độ cao, các mô hình hạng hai thường khá giật lag.
Đối với Seedance 2.5 ở vị trí thứ ba — điểm mạnh và điểm yếu của nó đều rất nổi bật.
Seedance 2.5 là mô hình chân thực nhất, có kết cấu điện ảnh nhất.
Trong video "cửa xe tải đông lạnh mở ra, và gà, vịt, cá, lợn đuổi theo một người đàn ông", các mô hình khác cho thấy các lỗi AI rõ ràng, trong khi Seedance 2.5 trông hoàn toàn giống cảnh quay phim gốc.
Nhưng ngoài việc chỉnh màu và kết cấu điện ảnh, các khả năng khác của Seedance 2.5 không cải thiện đáng kể, và sự mạch lạc trong chuyển động ở các cảnh phức tạp thực sự đã thụt lùi. Trong các kịch bản hoang dã kiểm tra khả năng sáng tạo của mô hình, Seedance 2.5 thể hiện kém đến mức khiến chúng tôi nghi ngờ rằng nó đã được đào tạo đặc biệt để kìm hãm trí tưởng tượng.
Chỉ khi không liên quan đến chuyển động phức tạp, Seedance 2.5 mới tạo ra các cảnh chi tiết hơn, trông thực tế hơn.
Trong các kịch bản tương tự, đầu ra của MiniMax H3 thiếu kết cấu thực tế đó, giống như một video shitpost trên Bilibili hơn. Trong video "một người đàn ông bị gạch đập trúng nhưng viên gạch vỡ thành bột, đầu anh ta tỏa sáng rực rỡ, và 100 vị bồ tát xuất hiện phía sau anh ta", Seedance 2.5 cho thấy các chuyển cảnh mượt mà, mạch lạc, với các chi tiết như bồ tát và vết cắt của lưỡi dao là những điểm mạnh đặc biệt.
Kết luận sau kiểm tra của chúng tôi: Seedance 2.5 là một mô hình bị lệch nghiêm trọng. Vấn đề nghiêm trọng nhất của nó là chuyển động phức tạp không liên tục. Ví dụ, trong cảnh "một người đàn ông quay người và đi đến bức tường, nhanh chóng lấy gạch bằng một tay và chuyền sang tay kia, rồi phóng chúng đi như đạn đại bác từng viên một, làm nổ tung các tòa nhà ở xa", đầu ra của Seedance 2.5 lệch hoàn toàn so với câu lệnh, với các cú nhảy cắt (jump cut) khó chịu giữa các cảnh quay gần và xa.
Điều này cho thấy Seedance 2.5 xuất sắc trong việc tạo ra các cảnh lớn mang tính điện ảnh và các chi tiết con người cụ thể, nhưng thiếu sự chuyển động mạch lạc kết nối các cảnh lớn với các chi tiết. Về cơ bản, nó giống như một bản PowerPoint nâng cao.
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.