Mô hình
Black Forest Labs ra mắt Flux 3: Bước tiến đột phá với khả năng tạo video kèm âm thanh gốc
(giờ Việt Nam)
Tóm tắt AI
Flux 3 là mô hình đa phương thức mới nhất từ Black Forest Labs, cho phép tạo video dài 20 giây tích hợp âm thanh đồng bộ. Công ty đang hướng tới mục tiêu xây dựng mô hình thế giới và ứng dụng công nghệ này vào lĩnh vực robot.
Bản dịch AI

Công ty AI của Đức, Black Forest Labs (BFL), vừa ra mắt Flux 3, một mô hình nền tảng đa phương thức (multimodal) có khả năng học hỏi đồng thời từ hình ảnh, video và âm thanh. Trong các thử nghiệm ban đầu của BFL, mô hình này đã vượt qua nhiều đối thủ trong lĩnh vực tạo video.
BFL mô tả Flux 3 là một bước tiến tới "trí tuệ thị giác thế giới thực", được định nghĩa là các mô hình có khả năng "nhận thức, dự đoán và hành động trong cả môi trường vật lý lẫn kỹ thuật số". Công ty này là một phần trong nỗ lực rộng lớn hơn nhằm xây dựng cái gọi là mô hình thế giới (world models).
BFL lập luận rằng không một phương thức đơn lẻ nào có thể nắm bắt trọn vẹn thực tế. Hình ảnh thể hiện cấu trúc không gian, video ghi lại sự thay đổi theo thời gian, còn âm thanh có thể tiết lộ mối liên hệ giữa các sự kiện cơ học và âm thanh mà chúng tạo ra. Việc huấn luyện trên cả ba phương thức cùng lúc cho phép chúng bổ trợ cho nhau, cung cấp cho mô hình nhiều thông tin hơn so với việc huấn luyện riêng lẻ từng phương thức.
Flux 3 bổ sung âm thanh gốc cho các video có độ dài lên đến 20 giây.
Lần đầu tiên, Flux 3 có thể tạo video kèm âm thanh gốc với các đoạn clip dài tối đa 20 giây. Mô hình hỗ trợ chuyển đổi văn bản thành video, hình ảnh thành video, video thành video, chuyển cảnh dựa trên khung hình chính (keyframe), đối thoại đa ngôn ngữ và các liên kết do tác nhân (agent) điều khiển giữa các clip để tạo ra các chuỗi cảnh quay dài hơn. BFL cho biết mô hình này đặc biệt xuất sắc trong việc thể hiện biểu cảm khuôn mặt con người và khớp âm thanh với các sự kiện vật lý.
Trong các đánh giá ban đầu sử dụng clip 10 giây ở độ phân giải 720p, BFL báo cáo rằng Flux 3 được ưu tiên hơn Luma Ray 3.2 trong 93% các so sánh, hơn Runway Gen-4.5 trong 77% và hơn Grok Imagine Video trong 69%. Khoảng cách này thu hẹp lại khi đối đầu với các đối thủ mạnh hơn. Flux 3 được ưu tiên hơn Kling v3 Pro trong 60% trường hợp, hơn Happy Horse v1 ở mức 59%, hơn Happy Horse 1.1 ở mức 57%, và hơn cả Seedance 2.0 lẫn Gemini Omni Flash ở mức 52% mỗi loại.
BFL cho biết đây mới chỉ là kết quả sơ bộ và chưa có các bài kiểm tra độc lập nào. Việc bắt kịp các hệ thống hàng đầu như Seedance (đã được ứng dụng tại Hollywood) và Gemini Omni Flash sẽ đưa Flux 3 vào nhóm các mô hình video hàng đầu.

BFL cũng kỳ vọng Flux 3 sẽ cải thiện khả năng tạo hình ảnh, đặc biệt đối với các câu lệnh (prompt) phức tạp và khả năng hiển thị văn bản chính xác bằng nhiều ngôn ngữ. Công ty dự kiến sẽ phát hành Flux 3 Image dưới dạng truy cập sớm trong vài tuần tới.
BFL cho biết mô hình này còn có thể dự đoán hành động dựa trên sự hiểu biết về thế giới. Công ty đã hợp tác với Mimic Robotics để phát triển Flux-mimic, một mô hình hành động-video hiện đang được thử nghiệm cho các tác vụ sản xuất tại Audi.
Flux 3 dựa trên Self-Flow, phương pháp của BFL nhằm dạy một mô hình vừa tạo ra vừa hiểu nội dung cùng một lúc. Một bộ biến đổi đa phương thức (multimodal transformer) sử dụng các thành phần chuyên biệt để chuyển đổi hình ảnh, video và âm thanh thành một biểu diễn nội bộ chung, sau đó chuyển đổi ngược lại thành kết quả đầu ra.

Một thành phần dành cho hành động cung cấp nền tảng cho các ứng dụng robot. BFL cho biết quy trình học tập thống nhất này mang lại kết quả tốt hơn so với phương pháp khớp luồng (flow-matching) tiêu chuẩn trước đây, cả về chất lượng tạo nội dung lẫn khả năng nắm bắt thế giới vật lý của mô hình.
BFL lên kế hoạch triển khai theo từng giai đoạn với quyền truy cập mã nguồn mở (open-weight).
BFL đang triển khai tất cả các tính năng theo từng giai đoạn, với các đợt truy cập sớm để thu thập phản hồi và kiểm tra an toàn. Flux 3 Video hiện đã có sẵn, và Flux 3 Image dự kiến sẽ ra mắt trong những tuần tới. Dự đoán hành động ban đầu sẽ được cung cấp thông qua các đối tác chọn lọc.
BFL cũng có kế hoạch phát hành quyền truy cập mã nguồn mở cho khung đa phương thức (multimodal backbone) dưới tên gọi "Flux 3 Dev". Về lâu dài, công ty đang nghiên cứu các mô hình thế hệ tiếp theo nhằm kết hợp nhận thức, hành động và dự đoán ngôn ngữ vào trong một mô hình duy nhất.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người.
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về các công nghệ tiên phong sáu lần mỗi năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.