Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
92

Mô hình

Ra mắt Flux 3: Mô hình đa phương thức tiên phong tích hợp hình ảnh, video và âm thanh

(giờ Việt Nam)

Tóm tắt AI

Flux 3 chính thức trình làng với khả năng học tập đồng thời trên hình ảnh, video và âm thanh để tạo ra biểu diễn thế giới thống nhất. Mô hình hiện đã mở quyền truy cập sớm cho người dùng.

Bản dịch AI

FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.

FLUX 3 hiện đã có sẵn trong giai đoạn Early Access (Truy cập sớm).

FLUX 3 là mô hình nền tảng đa phương thức mới của chúng tôi. Nó học hỏi đồng thời từ hình ảnh, video và âm thanh trong một kiến trúc thống nhất, bởi vì những gì nó cần học không phải là bất kỳ yếu tố nào trong số này một cách riêng lẻ. Thay vào đó, một mô hình phải học được cách biểu diễn thế giới: cách các vật thể gắn kết với nhau, cách mọi thứ chuyển động và cách các sự kiện tạo ra âm thanh.

Không một phương thức đơn lẻ nào cung cấp được mô tả đầy đủ. Mỗi phương thức là một hình chiếu của cùng một thực tại cơ bản, được ghi lại bởi các cảm biến khác nhau, và mỗi cảm biến đều làm mất đi một phần thông tin trong quá trình đó. Hình ảnh ghi lại cấu trúc không gian và các mối quan hệ tại một thời điểm cụ thể. Video khôi phục chiều thời gian và tiết lộ các động lực học theo thời gian cũng như các quy luật vật lý. Âm thanh tiết lộ các mối quan hệ nhân quả giữa các hiện tượng cơ học và âm học mà thị giác đơn thuần không thể phát hiện được. Ngôn ngữ liên kết những nhận thức này với các mục tiêu, khái niệm trừu tượng và hướng dẫn.

Học từ một phương thức, bạn sẽ có một mô hình tốt về hình chiếu đó. Học từ tất cả chúng cùng lúc, các ràng buộc lẫn nhau sẽ cho bạn biết nhiều hơn: âm thanh phải khớp với tác động, chuyển động phải tuân theo khối lượng, tương lai phải tiếp nối từ quá khứ. Các phương thức không còn tách biệt mà trở thành bằng chứng về một thực tại cơ bản duy nhất.

FLUX 3 là mô hình đầu tiên của chúng tôi được xây dựng hoàn toàn dựa trên nguyên tắc đó, và là một cột mốc trong sứ mệnh phát triển trí tuệ thị giác thế giới thực: những mô hình có khả năng nhận thức, dự đoán và hành động trên cả môi trường vật lý và kỹ thuật số. Những kết quả ban đầu trong lĩnh vực sáng tạo nội dung và AI vật lý cho thấy đây là con đường đúng đắn.

FLUX 3: Một mô hình, đa năng lực.

FLUX 3 được xây dựng dựa trên Self-Flow, phương pháp của chúng tôi nhằm căn chỉnh hiệu quả việc tạo và hiểu đa phương thức trong cùng một kiến trúc cơ bản. Dựa trên phương pháp này, chúng tôi đã mở rộng đáng kể tài nguyên tính toán và dữ liệu để huấn luyện FLUX 3 trên video, hình ảnh và âm thanh cùng một lúc.

Self-Flow so với Flow Matching (FM). Bên trái: lỗi tạo (khoảng cách Fréchet) trên mỗi phương thức, mỗi loại được chuẩn hóa về FM = 100 (thấp hơn là tốt hơn). Bên phải: tỷ lệ thành công trong các tác vụ thao tác được tính trung bình trên bốn nhóm tác vụ thông qua tinh chỉnh (cao hơn là tốt hơn).

Năng lực & Đánh giá ban đầu

Kết quả là, FLUX 3 có khả năng kết hợp các phương thức và tạo hình ảnh cũng như video+âm thanh đồng thời; cả từ các câu lệnh văn bản thuần túy lẫn khi cung cấp các tham chiếu đầu vào như hình ảnh và video. Chúng tôi nêu bật một vài năng lực chính của mô hình dưới đây.

Video

FLUX 3 có thể tạo ra các video có độ đa dạng cao kèm âm thanh với thời lượng lên đến 20 giây trong một lần tạo.

Các năng lực cốt lõi của nó bao gồm những điều sau (tất cả đầu ra đều đi kèm với khả năng tạo âm thanh gốc):

Đối với phân tích sơ bộ dưới đây, chúng tôi đã tạo các đoạn video từ văn bản dài 10 giây ở độ phân giải 720p kèm âm thanh.

Các đánh giá vẫn còn ở giai đoạn đầu và chúng tôi mong đợi những cải tiến hơn nữa.

Vì mô hình và các công cụ hỗ trợ xung quanh nó vẫn đang trong quá trình phát triển, các kết quả này chỉ mang tính sơ bộ và chúng tôi kỳ vọng sẽ có thêm những cải tiến trong giai đoạn truy cập sớm. Qua các đánh giá ban đầu, FLUX 3 được ưu tiên hơn Grok Imagine Video trong tối đa 69% các so sánh, Kling v3 Pro trong 60%, Happy Horse v1 trong 59%, Happy Horse 1.1 trong 57%, Seedance 2.0 và Gemini Omni Flash trong 52%. FLUX 3 được ưu tiên hơn Runway Gen-4.5 trong 77% các so sánh và hơn Luma Ray 3.2 trong 93% các so sánh.

Dù vẫn đang trong quá trình phát triển, FLUX 3 Video đã đặc biệt mạnh mẽ trong việc nắm bắt biểu cảm khuôn mặt con người, liên kết âm thanh với các sự kiện vật lý và các năng lực đa ngôn ngữ. Hơn nữa, những năng lực này có thể được kết hợp để tạo ra các chuỗi kéo dài vài phút, nơi các tham chiếu hình ảnh giúp đảm bảo rằng các nhân vật vẫn nhất quán trong tất cả các cảnh quay.

FLUX 3 Video hiện đã có sẵn trong giai đoạn Early Access tại đây.

Hình ảnh

FLUX 3 có thể tổng hợp và chỉnh sửa hình ảnh theo nhiều phong cách, tỷ lệ khung hình và độ phân giải khác nhau. Trong các đánh giá sơ bộ được thực hiện trong quá trình huấn luyện, FLUX 3 đã cho thấy sự cải thiện đáng kể so với các phiên bản FLUX trước đó: khả năng xử lý các câu lệnh phức tạp và tạo văn bản đã được cải thiện rõ rệt. Mô hình tạo ra nhiều phong cách đầu ra (xem các mẫu sau) và có khả năng hiển thị văn bản có độ chính xác cao bằng nhiều ngôn ngữ.

Như với các đánh giá video, đây là những kết quả sơ bộ và chúng tôi mong đợi những cải tiến hơn nữa trước khi phát hành chính thức. Chúng tôi sẽ mở giai đoạn truy cập sớm cho FLUX 3 Image trong những tuần tới.

Hành động

Sự hiểu biết về thế giới của FLUX 3 mở rộng sang cả dự đoán hành động. Chúng tôi đã thực hiện hai hướng tiếp cận: tích hợp trực tiếp dự đoán hành động gốc vào FLUX 3, mở rộng công trình ban đầu của chúng tôi về Self-Flow; và sử dụng nền tảng video đã được huấn luyện trước như một nền tảng nhận biết động lực học, từ đó các mô hình hành động chuyên biệt có thể được tinh chỉnh với dữ liệu hạn chế theo từng tác vụ.

Đối với hướng thứ hai, mimic robotics là một trong những đối tác đầu tiên có quyền truy cập sớm vào FLUX 3. Cùng nhau, chúng tôi đã phát triển FLUX-mimic, một mô hình video-hành động kết hợp nền tảng FLUX 3 với chuyên môn của mimic trong việc học tập cho robot để thao tác khéo léo và triển khai sản xuất. Hãy đọc luận điểm của chúng tôi về lý do tại sao AI vật lý và sáng tạo nội dung lại chạy trên cùng một nền tảng, và cách nó đang được thử nghiệm trên các tác vụ sản xuất thực tế tại Audi.

Kế hoạch ra mắt

Trong vài tuần và vài tháng tới, chúng tôi sẽ cung cấp các năng lực sau, mỗi năng lực sẽ trải qua giai đoạn truy cập sớm để đảm bảo triển khai suôn sẻ, thu thập phản hồi và kiểm tra an toàn nghiêm ngặt. Tất cả các năng lực đều được xây dựng từ cùng một mô hình flow matching đa phương thức cơ bản. Các năng lực và mô hình này bao gồm:

Chúng tôi cũng sẽ công bố thêm các chi tiết kỹ thuật về phương pháp tiếp cận cơ bản.

Yêu cầu truy cập sớm tại đây.

Tiếp theo là gì?

Chúng ta mới chỉ bắt đầu khám phá bề nổi của các mô hình đa phương thức thống nhất, có năng lực và linh hoạt, cũng như những gì chúng sẽ mang lại. Từ chỉnh sửa hình ảnh & video tương tác, mô phỏng cho đến sử dụng máy tính và AI vật lý, biên giới này đang mở rộng. Trong khi chúng tôi dần dần triển khai các năng lực mới này, chúng tôi đã bắt đầu làm việc trên các mô hình thế hệ tiếp theo. Mục tiêu của chúng tôi là thống nhất việc dự đoán nhận thức, hành động và ngôn ngữ trong cùng một mô hình duy nhất.

Nếu bạn quan tâm đến việc khám phá và xây dựng cùng FLUX 3, hãy liên hệ tại đây. Nếu bạn muốn đóng góp cho sứ mệnh của chúng tôi, hãy tham gia cùng chúng tôi! Chúng tôi đang tuyển dụng tại Đức và Mỹ.

Flux 3Đa phương thứcAI tạo sinhVideo AICông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.