MarkTechPost
95

Mô hình

Black Forest Labs ra mắt FLUX 3: Mô hình đa phương thức hợp nhất hình ảnh, video, âm thanh và điều khiển robot

(giờ Việt Nam)

Tóm tắt AI

FLUX 3 là mô hình nền tảng đầu tiên tích hợp khả năng tạo video 20 giây kèm âm thanh gốc và dự đoán hành động robot trong cùng một kiến trúc, vượt trội hơn Luma Ray 3.2 trong các bài kiểm tra chất lượng.

Bản dịch AI

Black Forest Labs Releases FLUX 3: A Multimodal Flow Model for Image, Video, Audio and Robot Action Prediction

Black Forest Labs (BFL) vừa ra mắt FLUX 3, một mô hình nền tảng đa phương thức (multimodal) có khả năng học từ hình ảnh, video và âm thanh trong cùng một kiến trúc duy nhất. Đây cũng là mô hình FLUX đầu tiên cung cấp khả năng dự đoán video, âm thanh và hành động từ một bộ trọng số (weights) duy nhất.

Đội ngũ nghiên cứu tại Black Forest Labs (BFL) lập luận rằng không một phương thức đơn lẻ nào có thể mô tả đầy đủ thế giới. Hình ảnh ghi lại cấu trúc không gian tại một thời điểm. Video khôi phục thời gian và bộc lộ các động lực vật lý. Âm thanh tiết lộ mối quan hệ nhân quả giữa các sự kiện cơ học và tiếng động. Mỗi loại hình được coi là một phép chiếu mất dữ liệu (lossy projection) của cùng một thực tại cơ bản.

Việc huấn luyện trên tất cả các phương thức này cùng lúc đồng nghĩa với việc chúng sẽ ràng buộc lẫn nhau. Âm thanh phải khớp với tác động. Chuyển động phải tuân theo khối lượng. Đội ngũ nghiên cứu gọi FLUX 3 là mô hình đầu tiên của họ được xây dựng hoàn toàn dựa trên nguyên tắc đó.

Phương pháp nền tảng: Self-Flow

FLUX 3 được xây dựng dựa trên Self-Flow, phương pháp của BFL nhằm hợp nhất việc tạo và hiểu đa phương thức trong một kiến trúc duy nhất. Self-Flow kết hợp mục tiêu khớp dòng (flow matching) với mục tiêu tái tạo đặc trưng tự giám sát (self-supervised feature reconstruction). Bản triển khai tham chiếu trên GitHub được cấp phép Apache-2.0 và sử dụng SiT-XL/2 với điều kiện hóa timestep theo từng token (per-token timestep conditioning). Mô hình được huấn luyện với tỷ lệ mask 25% mỗi token và tự chưng cất (self-distillation) từ một mô hình giáo viên EMA ở lớp 20 sang mô hình học viên ở lớp 8.

Điểm kiểm tra (checkpoint) được phát hành đó là một mô hình nghiên cứu ImageNet 256×256, không phải FLUX 3. BFL tuyên bố rằng họ đã "tăng đáng kể tài nguyên tính toán và dữ liệu" dựa trên cùng phương pháp tiếp cận để huấn luyện FLUX 3 trên video, hình ảnh và âm thanh đồng thời. Bản thân Self-Flow đã được giới thiệu vào tháng 3 năm 2026, vì vậy đây không phải là điều mới mẻ trong lần ra mắt này. Điểm mới chính là quy mô.

Khả năng của FLUX 3 Video

FLUX 3 Video tạo ra các đoạn clip dài tối đa 20 giây trong một lần tạo, kèm theo âm thanh gốc. Các chế độ được hỗ trợ bao gồm văn bản thành video (text-to-video), hình ảnh thành video (image-to-video), video thành video từ clip tham chiếu, khung hình chính thành video (keyframe-to-video) để chuyển cảnh có kiểm soát, và tiếp nối video-âm thanh tạo sinh từ video và âm thanh đầu vào.

BFL cũng liệt kê các khả năng như đối thoại đa ngôn ngữ, chuỗi tác vụ (agentic chaining) các clip thành các trình tự nhiều cảnh quay, và tạo kiểu chữ mạnh mẽ với các thiết kế hoạt họa. Đội ngũ BFL báo cáo thế mạnh đặc biệt trong việc thể hiện biểu cảm khuôn mặt người và liên kết âm thanh với các sự kiện vật lý.

Hiệu suất

Đội ngũ BFL đã công bố kết quả sơ bộ về sự ưu tiên của con người. Thiết lập thử nghiệm là các đoạn clip văn bản thành video dài 10 giây ở độ phân giải 720p kèm âm thanh. FLUX 3 được ưa chuộng hơn Luma Ray 3.2 trong 93% các so sánh và hơn Runway Gen-4.5 trong 77%. So với Grok Imagine Video, con số này lên tới 69%, tiếp theo là Kling v3 Pro ở mức 60%, Happy Horse v1 ở mức 59% và Happy Horse 1.1 ở mức 57%. So với Seedance 2.0 và Gemini Omni Flash, kết quả là 52%, gần như ngang ngửa.

Trình khám phá tương tác (Interactive Explorer)

bfl@flux-3:~/real-world-models

Truy cập sớm

Lệnh

Nhập lệnh bên dưới, hoặc nhấn ↑ / ↓ trong dấu nhắc để xem lại lịch sử. Mọi số liệu đều được lấy từ Black Forest Labs hoặc mimic robotics.

Nhập lệnh enter

Những điểm chính cần lưu ý

Hãy xem thông báo về FLUX 3, bài viết kỹ thuật FLUX 3 x mimic và bài báo về Self-Flow. Mọi công lao cho nghiên cứu này đều thuộc về các nhà nghiên cứu của dự án.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.

FLUX 3Black Forest LabsĐa phương thứcAI tạo sinhRobot
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.