Mô hình
FLUX 3 x mimic: Bước tiến mới của mô hình AI tạo video hành động
(giờ Việt Nam)
Tóm tắt AI
Black Forest Labs ra mắt FLUX 3, mô hình đa phương thức tập trung vào dự đoán hành động, được ứng dụng thực tế trong dây chuyền sản xuất của Audi thông qua hợp tác với mimic.
Bản dịch AI
Một phiên bản sơ khởi của FLUX 3, mô hình nền tảng đa phương thức mới của chúng tôi, hiện đang được vận hành trên các robot. Chúng tôi đã cung cấp quyền truy cập sớm FLUX.3 cho mimic robotics. Thế mạnh của họ trong việc học tập và triển khai robot, kết hợp với kiến thức về thế giới của mô hình và chuyên môn về mô hình nền tảng của BFL, đã tạo ra FLUX-mimic: thế hệ tiếp theo của các mô hình video-hành động.
FLUX
FLUX 1 và FLUX 2 tạo ra hình ảnh. FLUX 3 mở rộng sang đa phương thức và tạo nội dung nghe nhìn một cách đồng thời - đồng thời cung cấp nền tảng cho FLUX-mimic: một mô hình video-hành động, được phát triển với sự hợp tác của mimic, vận hành các robot đã được thử nghiệm và triển khai tại Audi.
Thoạt nhìn, việc tạo ra nội dung hình ảnh thuyết phục và điều khiển robot dường như không có nhiều điểm chung. Một bên đòi hỏi tạo ra các điểm ảnh, bên kia đòi hỏi sự hiểu biết về cách thế giới vật lý phản ứng khi bạn chạm vào và thao tác với nó. Nếu một mô hình có thể làm cả hai, thì nó chưa bao giờ chỉ là một mô hình tạo nội dung. Đó là một mô hình về cách thế giới vận hành, và tạo nội dung chỉ là một trong những việc mà nó có thể thực hiện.
Đó chính là FLUX 3.
Video là phần khó nhất
FLUX 3 là một mô hình duy nhất, được huấn luyện đồng thời trên hình ảnh, video và âm thanh ngay từ đầu. Phần đòi hỏi khắt khe nhất của quá trình huấn luyện đó - chiếm hơn 95% tổng chi phí tính toán - chính là dự đoán video. Để tạo ra các video chân thực, mô hình không còn cách nào khác là phải học về sự tiếp xúc, chuyển động, trọng lượng, nguyên nhân và kết quả; chỉ cần sai sót ở bất kỳ yếu tố nào, kết quả trông sẽ không tự nhiên. Học cách hiển thị thế giới một cách chính xác đồng nghĩa với việc học cách thế giới vận hành.
Tương đối mà nói, âm thanh là phương thức dễ dàng hơn. Với chiều dữ liệu thấp và ít chi tiết hơn nhiều so với video, nó chiếm chưa đến 0,5% số lượng token trong một video 720p có âm thanh. Khi mô hình đã hoàn thành công việc khó khăn là học cách hiểu video, nó sẽ học được mối quan hệ nhân quả giữa video và âm thanh để dự đoán lời nói đồng bộ với cử động môi và các hiệu ứng âm thanh đồng bộ với các sự kiện vật lý gây ra chúng.
Các hành động cũng tuân theo hình thái tương tự: một biểu diễn chiều thấp về trạng thái của robot, gắn kết chặt chẽ với các quan sát thị giác. Hành động, âm thanh và khung hình video đều là những biểu diễn một phần của một thực tại vật lý duy nhất. Sau khi mô hình đã học về các quá trình vật lý đằng sau video và âm thanh, việc dự đoán hành động không phải là một bước đi mới - đó chỉ là một góc nhìn khác về thực tại mà nó đã mô hình hóa.
Một xương sống duy nhất
Nếu khung tư duy đó là đúng, việc dạy FLUX 3 dự đoán hành động sẽ không gây ra chi phí lâu dài: chúng tôi dự đoán một giai đoạn xáo trộn ngắn khi mô hình phải học cấu trúc của không gian hành động và căn chỉnh biểu diễn nội tại của nó về thế giới cho phù hợp, trước khi quay trở lại hiệu suất tối đa. Đó chính xác là những gì chúng tôi quan sát được.
Trong một đợt huấn luyện quy mô lớn, chúng tôi đã thêm dự đoán hành động vào chương trình huấn luyện và quan sát tác động đến chất lượng tạo video. Đánh giá của con người về khả năng chuyển đổi văn bản thành video và hình ảnh thành video ban đầu giảm tới 10% khi mô hình bắt đầu kết hợp phương thức hành động mới. Sau 3500 bước, mô hình đã lấy lại được chất lượng đầy đủ như trước đây trong các tác vụ tạo video, đồng thời hiện đã có thể dự đoán hành động.
Mỗi chuỗi được chuẩn hóa theo chất lượng riêng trước khi dự đoán hành động được thêm vào. Chỉ số càng cao càng tốt.
Mô hình phải tích hợp các hành động vào đầu vào và đầu ra của nó - nhưng việc làm đó không làm tiêu tốn năng lực của nó vĩnh viễn. Nó chỉ đơn giản là phải học cách phương thức mới này liên quan đến mô hình thế giới hiện có của nó như thế nào. Một khi đã hiểu được điều này, sự sụt giảm hiệu suất đối với các khả năng hiện có sẽ biến mất. Tạo video và dự đoán hành động không cần các nền tảng riêng biệt. Cùng một xương sống đảm nhận cả hai.
Điều này làm cho Physical AI trở thành một phần mở rộng tự nhiên trong lộ trình của chúng tôi tại Black Forest Labs thay vì là một sự thay đổi về hướng đi. Tạo nội dung là những gì xương sống đa phương thức FLUX 3 của chúng tôi thực hiện với hình ảnh, video và âm thanh. Physical AI là những gì nó thực hiện với các hành động. Một mô hình nền tảng, với trí tuệ thị giác làm cốt lõi, cho phép triển khai hai nhóm ứng dụng. Chúng tôi không xây dựng một mô hình nền tảng riêng biệt. Chúng tôi tập trung vào việc khó: xây dựng một mô hình hiểu được thế giới. Hành động trong đó là những gì sự hiểu biết đó tạo điều kiện thực hiện.
Từ phòng thí nghiệm đến thực tế: FLUX-mimic
Điều gì sẽ xảy ra khi chúng tôi áp dụng xương sống FLUX 3 vào các tác vụ tự động hóa thực tế trên các dây chuyền sản xuất thực?
Đó là câu hỏi mà mimic và BFL đã tạo ra FLUX-mimic để trả lời. mimic tự chế tạo robot và mang đến chuyên môn về học tập cho robot, thao tác khéo léo và triển khai sản xuất; BFL xây dựng các mô hình nền tảng thị giác và mang đến chuyên môn về huấn luyện và mô hình hóa đa phương thức. Cùng nhau, chúng tôi đã xây dựng một mô hình thế hệ tiếp theo cho thao tác đa năng - thích ứng với các yêu cầu công nghiệp và tích hợp vào hệ thống triển khai toàn diện của mimic. FLUX-mimic là một mô hình video-hành động được xây dựng trên xương sống FLUX 3.
Giải mã mô hình thế giới đã học
Luận điểm của chúng tôi là FLUX 3 phải học một biểu diễn nội tại của thế giới để có thể tạo ra video. FLUX-mimic tuân theo luận điểm này và giải mã các hành động từ biểu diễn thế giới đã học của xương sống FLUX. Cách tiếp cận này, tiên phong trong mimic-video, huấn luyện một bộ giải mã hành động nhẹ trên các đặc trưng trung gian được trích xuất từ đường dẫn dự đoán video của FLUX.
Tổng quan kiến trúc cách FLUX-mimic được xây dựng trên FLUX 3
Sự thành công của cách tiếp cận này phụ thuộc vào hai khía cạnh liên quan nhưng khác biệt: chất lượng của mô hình thế giới mà FLUX học được và chất lượng của biểu diễn đặc trưng của mô hình thế giới này. Chất lượng của mô hình thế giới liên quan trực tiếp đến chất lượng tạo: nếu một mô hình không hiểu cách thế giới vận hành, nó không thể mô phỏng nó. Tuy nhiên, ngay cả mô hình thế giới tốt nhất cũng không giúp ích gì cho bộ giải mã hành động nếu nó không thể truy cập được: nếu không gian đặc trưng giữ các mối quan hệ nhân quả giữa các phương thức bị vướng mắc phi tuyến tính, việc hiểu các mối quan hệ đó từ biểu diễn đặc trưng vẫn khó khăn như hiểu chúng từ dữ liệu đầu vào thô - chất lượng biểu diễn là rất quan trọng.
Chất lượng tạo và chất lượng biểu diễn từ lâu đã được nghiên cứu và tiếp cận một cách riêng biệt. Các phương pháp tạo dẫn đến các mô hình thế giới chất lượng cao cho phép mô phỏng và chúng thể hiện các định luật quy mô cho lợi nhuận có thể dự đoán được từ các khoản đầu tư tính toán. Tuy nhiên, so với các phương pháp chuyên biệt hơn cho việc học biểu diễn, chúng tạo ra các biểu diễn ít tách biệt hơn, điều này đặt ra giới hạn cho tính hữu dụng của chúng đối với các tác vụ đòi hỏi sự hiểu biết về thế giới.
Vì bản thân các mô hình tạo dựa vào các đặc trưng của chính chúng, sự khác biệt này trong chất lượng biểu diễn của chúng có vẻ trái ngược với trực giác. Các biểu diễn được cải thiện trong các mô hình tạo sẽ cải thiện chất lượng mô hình thế giới của chúng và làm cho chúng dễ sử dụng hơn cho các tác vụ hạ nguồn. Trong công trình của chúng tôi, Self-Flow, chúng tôi đã chứng minh cách hợp nhất việc tạo và học biểu diễn trong một khung duy nhất và quan sát chính sự cải thiện tương hỗ này: mô hình thế giới được cải thiện - được đo bằng chất lượng tạo trên video, hình ảnh và âm thanh - và chất lượng biểu diễn của nó được cải thiện - được đo bằng tỷ lệ thành công cho các tác vụ điều khiển robot trong mô phỏng.
Self-Flow so với Flow Matching (FM). Trái: lỗi tạo (khoảng cách Fréchet) trên mỗi phương thức, mỗi phương thức được chuẩn hóa theo FM = 100 (thấp hơn là tốt hơn). Phải: tỷ lệ thành công trên các tác vụ thao tác được tính trung bình trên bốn nhóm tác vụ thông qua tinh chỉnh (cao hơn là tốt hơn).
Mở rộng quy mô mô hình thế giới
Các định luật quy mô vẫn đúng với Self-Flow, và FLUX 3 là ứng dụng của điều đó: phiên bản mở rộng của Self-Flow. Nó được huấn luyện trên hàng chục triệu giờ nội dung video chung để học động lực học thế giới rộng nhất có thể ngay từ ngày đầu tiên, và trên hàng trăm nghìn giờ nội dung video tập trung vào các tác vụ thao tác của con người và robot để sẵn sàng làm xương sống cho trí tuệ thị giác. Việc mở rộng quy mô này là thứ chuyển đổi thành công của Self-Flow từ phòng thí nghiệm ra thực tế. mimic đã triển khai FLUX-mimic trong các trường hợp sử dụng thực tế tại nhà máy bao gồm thực tế hàng ngày của công việc sản xuất và hậu cần: xếp các bộ phận vào khay có cấu trúc, lắp các bộ phận điều khiển điện tử vào các thiết bị cố định chật hẹp, lắp ráp các thành phần lại với nhau và xử lý các vật liệu mềm, linh hoạt như gioăng và cáp mà tự động hóa thông thường chưa bao giờ có thể chạm tới.
Các điểm chuẩn chứng minh rằng bộ giải mã hành động vượt trội hơn các mô hình thị giác-ngôn ngữ-hành động trước đây, ngay cả với xương sống FLUX hoàn toàn đóng băng - một thiết lập mà các mô hình thị giác-ngôn ngữ-hành động trước đây không thể thành công. Điều này làm nổi bật cách việc mở rộng quy mô mang lại cho xương sống của chúng tôi kiến thức vững chắc về thế giới và cách hành động trong đó, và cách Self-Flow làm cho kiến thức này dễ dàng giải mã từ các biểu diễn đặc trưng của xương sống. Khi tinh chỉnh xương sống cùng với bộ giải mã hành động, FLUX-mimic đạt được tỷ lệ thành công hiện đại nhất.
Đường đứt nét đánh dấu tỷ lệ thành công trung vị của mỗi mô hình qua 20 lần thử nghiệm tự động. Cao hơn là tốt hơn.
Từ kiến thức thế giới đến một tác vụ thực tế
Một xương sống bộc lộ kiến thức thế giới trong các biểu diễn có thể giải mã làm thay đổi những gì cần thiết để dạy một robot một tác vụ mới. Nếu vật lý đã nằm trong biểu diễn và dễ dàng truy cập, việc thích ứng với một tác vụ không còn là vấn đề dạy mô hình cách thế giới vận hành - nó chỉ phải học cách tác vụ cụ thể này ánh xạ vào những gì nó đã biết. Phần tốn kém đã được thực hiện trước khi robot thực hiện bất kỳ chuyển động nào.
Điều này thể hiện trực tiếp ở lượng dữ liệu trình diễn mà một tác vụ mới yêu cầu. Trong các thí nghiệm Self-Flow của chúng tôi, dự đoán hành động đạt được tỷ lệ thành công nhất định trong một nửa số bước huấn luyện so với mô hình video không có Self-Flow - các biểu diễn tốt hơn giúp kiến thức thế giới dễ trích xuất hơn, vì vậy cần ít dữ liệu hơn để đạt được cùng một khả năng. Bài báo mimic-video báo cáo hiệu quả mẫu lên tới 10 lần cho các mô hình video-hành động so với các mô hình thị giác-ngôn ngữ-hành động; FLUX-mimic kết hợp cả hai hiệu ứng.
Lợi ích tương tự cũng xuất hiện trong hành vi. FLUX-mimic tự nhiên phục hồi sau thất bại: một robot bỏ lỡ một lần nắm sẽ tự sửa lỗi, nắm lại và hoàn thành tác vụ. Không tập hợp trình diễn nào có thể bao quát mọi cách có thể xảy ra sai sót trong một tác vụ. Sự phục hồi chưa từng được trình diễn phải đến từ nơi khác - từ một mô hình đã biết cách thế giới vận hành.
Tương lai được dự đoán bởi xương sống (trên), cùng với quá trình thực thi mà robot tạo ra từ các hành động đã giải mã (dưới).
Đủ nhanh để hành động
Việc triển khai trong thế giới thực đặt ra một ràng buộc cứng: mô hình phải hành động nhanh như thế giới chuyển động. Chi phí tính toán chủ yếu cho FLUX-mimic nằm ở xương sống. Đây là thành phần lớn nhất của mô hình và trong ngăn xếp triển khai được tối ưu hóa của mimic, độ trễ của nó thực sự đặt ra giới hạn cho toàn bộ hệ thống.
Đây là nơi phương pháp luận của chúng tôi mang lại hiệu quả lần thứ hai. Các biểu diễn tốt hơn có nghĩa là nhiều khả năng hơn trên mỗi tham số: một mô hình đã học được một mô hình thế giới có cấu trúc tốt cần ít năng lực hơn để đạt được một mức hiệu suất nhất định so với mô hình chưa học. Đối với việc triển khai, điều này chuyển trực tiếp thành khả năng chạy một xương sống nhỏ hơn - và một xương sống nhỏ hơn là một xương sống nhanh hơn.
Điểm CLIP tại 1,0 triệu bước huấn luyện; cao hơn là tốt hơn. Độ sâu của xương sống là yếu tố chính thúc đẩy độ trễ triển khai, vì vậy ít lớp hơn có nghĩa là mô hình nhanh hơn.
Kết quả là, xương sống của FLUX-mimic có thể được tối ưu hóa để chạy từ đầu vào đến biểu diễn thế giới trong vòng chưa đầy 80ms trên một GPU NVIDIA RTX 5090 duy nhất - điều này đặt nó vào cùng bậc độ lớn với thời gian phản ứng thị giác của con người.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.