Mô hình
Black Forest Labs ra mắt FLUX 3: Mô hình đa phương thức vượt mặt Gemini và Grok
(giờ Việt Nam)
Tóm tắt AI
Black Forest Labs vừa tạo nên cú hích lớn với FLUX 3, mô hình đa phương thức mạnh mẽ vượt qua các đối thủ sừng sỏ như Seedance 2.0, Gemini Omni và Grok Imagine, đồng thời giới thiệu FLUX-mimic cho robot.
Bản dịch AI
![[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model](https://substackcdn.com/image/fetch/$s_!3n0x!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F__ss-rehost__tw-video-preview-13_2080308957898481664.jpg)
Thứ Năm là ngày bận rộn nhất cho các đợt phát hành AI, và mặc dù OpenAI đã giành chiến thắng trước Anthropic khi ra mắt ChatGPT Voice (cho người dùng cá nhân) và OpenAI Presence (cho doanh nghiệp) và đạt được nhiều lượt hiển thị hơn Claude Voice hôm nay (chúng tôi chắc chắn đây hoàn toàn là sự trùng hợp ngẫu nhiên về thời điểm), nhưng không có gì có vẻ hoành tráng bằng việc BFL ra mắt FLUX 3 Video hôm nay:

Black Forest Labs@bfl_ai
Giới thiệu FLUX 3. Một mô hình đa phương thức (multi-modal) dành cho Hình ảnh, Video, Âm thanh và Dự đoán hành động. Các sản phẩm tạo ra chân thực hơn trong mọi phong cách. FLUX 3 Video hiện đã có quyền truy cập sớm (liên kết bên dưới). Được huấn luyện chung trong một kiến trúc thống nhất, mô hình của chúng tôi có thể được mở rộng sang
3:08 CH · 23 tháng 7, 2026 · 576K Lượt xem
238 Lượt trả lời · 676 Lượt đăng lại · 4.72K Lượt thích
Lần gần nhất chúng tôi đề cập đến BFL là trong podcast rất được đón nhận của Anjney Midha:
Hầu hết những người làm trong lĩnh vực GenMedia sẽ nhớ trang chủ của BFL khi họ lần đầu ra mắt Flux 1 vào năm 2024, với gợi ý về các mô hình video tiếp theo, cùng logo hình khu rừng của họ. Chà, 2 năm sau, điều đó cuối cùng đã trở thành hiện thực:

Bài đăng trên blog phác thảo về Self Flow, bao gồm TẤT CẢ các phương thức của họ cùng với những tuyên bố ưu tiên mạnh mẽ:

“Các khả năng cốt lõi bao gồm những điều sau (tất cả đầu ra đều đi kèm với khả năng tạo âm thanh gốc):
Tạo văn bản thành video (Text-to-video).
Tạo hình ảnh thành video (Image-to-video), tiếp nối từ khung hình bắt đầu (“hoạt ảnh”) hoặc sử dụng hình ảnh làm tham chiếu trực quan.
Tạo video từ video (Video-to-video) dựa trên clip tham chiếu, mang các yếu tố trung tâm của video nguồn - ví dụ như cùng một nhân vật - vào một bối cảnh hoặc khung cảnh mới.
Tiếp nối video-âm thanh tạo sinh từ video và âm thanh đầu vào.
Tạo video từ khung hình chính (Keyframe-to-video) để chuyển cảnh có kiểm soát giữa các thời điểm xác định.
Đối thoại đa ngôn ngữ.
Nhiều phong cách hình ảnh và tỷ lệ khung hình đa dạng, vượt xa các đầu ra điện ảnh thông thường.
Kết nối các clip riêng lẻ thành các chuỗi dài hơn, nhiều cảnh quay theo kiểu tác nhân (agentic chaining).
Sự đa dạng phong cách cao -- FLUX 3 Video dễ dàng xử lý các dải phong cách từ cảnh quay máy quay cầm tay chân thực đến hoạt ảnh và điện ảnh.
Khả năng tạo kiểu chữ và thiết kế hoạt họa mạnh mẽ.”
Một số tính năng trên là các tính năng SOTA (tiên tiến nhất) từ các mô hình của các phòng thí nghiệm tiên phong khác, như chúng tôi đã thảo luận trong podcast Grok Imagine, vì vậy cộng đồng đã được thông báo rằng hiện đã có sự tái tạo độc lập, có lẽ là SOTA, của các khả năng này, với phiên bản Dev mở trọng số (open weights) sắp ra mắt.
Như thể đợt phát hành này vẫn chưa đủ, nhóm còn công bố FLUX3-mimic, chứng minh rằng mô hình FLUX 3 đang học một mô hình thế giới đủ khả năng để điều khiển robot…
Black Forest Labs@bfl_ai
Hành động: Một phiên bản sớm của FLUX 3 hiện đang chạy trên robot. @mimicrobotics là một trong những đối tác đầu tiên có quyền truy cập sớm vào FLUX 3. Cùng nhau, chúng tôi đã phát triển FLUX-mimic, một mô hình video-hành động kết hợp xương sống FLUX 3 với chuyên môn của mimic trong việc học tập cho robot để thực hiện các thao tác khéo léo
3:08 CH · 23 tháng 7, 2026 · 14.5K Lượt xem
2 Lượt trả lời · 7 Lượt đăng lại · 138 Lượt thích
… và dự đoán tác động của chúng trong các môi trường nhà máy thực tế…

Tin tức AI từ 22/7/2026-23/7/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm Discord nào khác. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một phần của Latent Space. Bạn có thể chọn nhận/hủy nhận email theo tần suất!
Mã nguồn mở, Mô hình mở và Ranh giới tư tưởng xung quanh việc chưng cất (Distillation)
The Stack v3 là bản phát hành dữ liệu mở quan trọng nhất trong ngày: @anton_lozhkov đã công bố The Stack v3, hiện là tập dữ liệu mã nguồn mở lớn nhất được phát hành công khai: 114 TB dữ liệu thô, 224 triệu kho lưu trữ, 44 tỷ tệp, 770 ngôn ngữ và khoảng 5 nghìn tỷ token đã được lọc/khử trùng lặp. So với v2, kho dữ liệu đã lọc tăng từ ~550 tỷ lên ~5 nghìn tỷ token, với mức tăng đặc biệt lớn ở C++ (x15), TypeScript (x7.5), Rust (x7) và Python (x4.8). Những thay đổi vận hành đáng chú ý là v3 cung cấp nội dung trực tiếp thay vì ID Software Heritage, bao gồm bản thu thập dữ liệu GitHub mới đến tháng 8 năm 2025, loại trừ mã có giấy phép hạn chế và cung cấp cả tập dữ liệu sẵn sàng để huấn luyện và một kho lưu trữ đầy đủ để tùy chỉnh khử trùng lặp/lọc. Các nhà nghiên cứu của Hugging Face đã định hình nó một cách rõ ràng như cơ sở hạ tầng cho thế hệ mô hình mã nguồn mở và công cụ phòng thủ mạng tiếp theo: xem @LoubnaBenAllal1, @lvwerra và bình luận từ @eliebakouch lưu ý rằng các phiên bản Stack trước đó đã được sử dụng trong nhiều hỗn hợp huấn luyện mô hình mã nguồn đã được công bố.
Chưng cất (Distillation) vẫn là ranh giới tư tưởng nóng hổi: một số bài đăng có sức ảnh hưởng đã phản đối nỗ lực tách biệt rõ rệt giữa “tiền huấn luyện quy mô internet” và chưng cất ở cấp độ đầu ra. @GergelyOrosz so sánh việc kiểm tra mô hình thông qua nhắc lệnh (prompting) với kỹ thuật đảo ngược sản phẩm của đối thủ cạnh tranh, trong khi @SchmidhuberAI nhấn mạnh lịch sử lâu đời của việc chưng cất. @Suhail lập luận rằng phản ứng thực tế không phải là cấm đoán mà là đầu tư mạnh mẽ hơn vào các mô hình nội địa có trọng số mở, và @garrytan nói đơn giản hơn: trọng số mở có tầm quan trọng chiến lược. Thông điệp ngầm trong các bài đăng này là các tập dữ liệu mở như The Stack v3 nâng cao đáng kể tiêu chuẩn cho mọi phòng thí nghiệm muốn xây dựng các mô hình mã nguồn cạnh tranh mà không cần dựa vào các hệ sinh thái đóng.
Biên giới đa phương thức: FLUX 3, Chuyển giao Robot và Hệ thống Âm thanh/TTS mới
FLUX 3 của Black Forest Labs mở rộng biên giới đa phương thức vượt ra ngoài hình ảnh/video: @bfl_ai đã ra mắt FLUX 3, một mô hình đa phương thức thống nhất bao gồm hình ảnh, video, âm thanh và dự đoán hành động, với quyền truy cập sớm cho FLUX 3 Video và khẳng định rõ ràng rằng cùng một kiến trúc có thể được mở rộng sang lĩnh vực robot. Các thành viên trong nhóm đã kết nối nó với nghiên cứu Self-Flow trước đó, bao gồm @hila_chefer và @robrombach. Điều quan trọng về mặt kỹ thuật là câu chuyện huấn luyện thống nhất: không phải là một nhóm các bộ tạo chuyên biệt rời rạc, mà là một kiến trúc duy nhất nhằm kết nối việc tạo nội dung truyền thông và điều khiển.
FLUX-mimic của mimic là một hiện thực hóa cụ thể về robot của luận điểm đó: @mimicrobotics mô tả FLUX-mimic là một Mô hình Video-Hành động được xây dựng trên nền tảng FLUX 3, được huấn luyện trên dữ liệu robot và dữ liệu đeo được cho khả năng khéo léo đa năng và có thể triển khai trên một GPU tại chỗ duy nhất. Tuyên bố trung tâm của họ là việc mô hình hóa thế giới bằng video tốt hơn sẽ chuyển trực tiếp thành chất lượng điều khiển robot và hiệu quả mẫu; họ đã thử nghiệm với Audi. Điều này khớp với @GeneralistAI, nơi GEN-1 hiện hỗ trợ các thiết bị đầu cuối đa dạng và có thể thích ứng khi “bàn tay” thay đổi giữa chừng, củng cố ý tưởng rằng các chính sách tổng quát về hiện thân có thể đến từ việc điều kiện hóa theo hình thái thay vì chuyên biệt hóa cho từng bộ phận thao tác.
Âm thanh chứng kiến hai đợt ra mắt đáng chú ý ở hai đầu đối lập của hệ thống: @Alibaba_Qwen đã giới thiệu Qwen-Audio-3.0-TTS với các biến thể Flash và Plus, hỗ trợ 16 ngôn ngữ, các thẻ điều khiển nội dòng như [whisper] / [angry], điều hướng phong cách bằng ngôn ngữ tự nhiên, khả năng chống nhiễu tham chiếu và tạo âm thanh một lần lên đến 3 phút; họ cũng tuyên bố giành vị trí số 1 trên bảng xếp hạng TTS của Artificial Analysis. Riêng biệt, @HuggingApps đã làm nổi bật WordVoice TTS, một mô hình nhỏ hơn với khả năng kiểm soát theo từng từ về thời lượng, độ lớn, cao độ và tông giọng—thú vị không phải như một trò chơi bảng xếp hạng mà như một thử nghiệm bề mặt điều khiển cho các công cụ âm thanh.
Cơ sở hạ tầng tác nhân (Agent): Hệ thống hỗ trợ, Quy trình làm việc động, Bộ nhớ lập trình và Điểm chuẩn
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.