# Black Forest Labs ra mắt FLUX 3 Action: Mô hình hành động thế giới 7B mã nguồn mở

- Nguồn: Black Forest Labs: Blog (Web)
- Thời gian phát hành: 2026-09-24 01:11 (giờ Việt Nam)
- Điểm AI: 53/100
- Link AIHOT.vn: https://aihot.vn/items/ebef01f946ac84c2
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmufvz66a03hkro19yo8nxmij
- Link gốc: https://bfl.ai/blog/flux-3-action

## Tóm tắt AI

Black Forest Labs giới thiệu FLUX 3 Action, mô hình 7B tham số với trọng số mở, giúp chuyển đổi trí tuệ thị giác của FLUX thành khả năng thực thi hành động cho robot, trình mô phỏng và trò chơi.

## Thân bài

![FLUX 3 Action: A 7B World Action Model for Robot Control](https://cdn.sanity.io/images/2gpum2i6/production/1f041401bdd8d65b8bd70cb808904b73a9cf9dcd-1200x630.jpg)

Hình ảnh, video và âm thanh đại diện cho các khía cạnh khác nhau của thực tế cơ bản. Việc huấn luyện trên các phương thức này cho phép chúng ta xây dựng dựa trên nguồn dữ liệu rộng lớn hơn nhiều so với chỉ các minh họa hành động, dẫn đến khả năng tổng quát hóa tốt hơn. Sau đó, chúng tôi điều chỉnh nền tảng này thông qua huấn luyện kết hợp video-hành động và tinh chỉnh (finetuning) cho một hiện thân mục tiêu và không gian hành động tương ứng của nó.

Trong lĩnh vực robot, công thức tinh chỉnh cũng quan trọng không kém gì các trọng số. Chúng tôi công bố báo cáo này cùng với các trọng số để làm cho quy trình này trở nên minh bạch; từ các giai đoạn tiền huấn luyện và huấn luyện trung gian đến tinh chỉnh và tối ưu hóa suy luận cho dự đoán hành động - nơi mà hiệu suất đặc biệt là một khả năng quan trọng và cần thiết cho các triển khai cục bộ. Ngoài ra, chúng tôi phân tích các hệ thống lai kết hợp dự đoán hành động nhanh với khả năng lập kế hoạch của các mô hình suy luận tiên tiến - và nhận thấy rằng việc điều khiển nhanh giúp suy luận hiện thân đạt hiệu quả cao hơn về chi phí và thời gian - tăng tới 53,64% tỷ lệ thành công trên mỗi đô la.

Trọng tâm của báo cáo này là dự đoán hành động được áp dụng cho robot - nhưng dự đoán hành động cũng mở rộng sang cả các môi trường kỹ thuật số. Chúng tôi khám phá trò chơi điện tử như một môi trường thử nghiệm cho việc điều hướng, dự đoán việc sử dụng máy tính và các tác nhân nhạy cảm với độ trễ khác cũng như các khả năng lập kế hoạch dựa trên thông tin thị giác.

### Các chính sách hành động

Các chính sách hành động mở hiện nay buộc bạn phải lựa chọn: World Action Models (WAMs), mô hình dự đoán các hành động tương lai cùng với video, dẫn đầu các bảng xếp hạng như [RoboLab](https://research.nvidia.com/labs/srl/projects/robolab/leaderboard.html). Cosmos 3 Nano thành công ở 36,8% các tác vụ, trong khi Pi0.5, mô hình Vision Language Action (VLA) mở mạnh mẽ nhất, đạt tỷ lệ thành công 28,0%. Tuy nhiên, việc dự đoán video cùng với hành động khiến WAMs trở nên đắt đỏ. Trên GPU B200, Cosmos 3 Nano ở định dạng FP8 yêu cầu thời gian xử lý trên mỗi giây chuyển động của robot gấp khoảng 4,7 lần so với Pi0.5 ở định dạng BF16. Khi chọn WAM, bạn phải trả giá bằng độ trễ và chi phí phần cứng; khi chọn VLA, bạn từ bỏ gần một phần tư các lần thực thi thành công.

Việc chạy dự đoán đồng thời trên video và hành động cho phép WAMs chuyển giao hiểu biết về thế giới của chúng - thu được thông qua tiền huấn luyện video quy mô lớn - sang dự đoán hành động với sự giám sát dữ liệu hành động bổ sung hạn chế. Nhưng nó cũng dẫn đến độ dài chuỗi lớn làm tăng chi phí tính toán. Ngoài ra, chúng thường dựa vào các kỹ thuật hướng dẫn làm tăng gấp đôi chi phí cho mỗi lần truyền tiến (forward pass), và chạy trên các kiến trúc nền (backbone) với nhiều tham số hơn, chẳng hạn như Cosmos 3 có số lượng tham số gấp 4,85 lần so với Pi0.5. Các giải pháp hiện tại cố gắng hạn chế sự tương tác giữa video và hành động nhưng khi làm như vậy lại thay đổi cơ bản kiến trúc và khả năng của WAMs. Các phương pháp khác dựa vào việc song song hóa hướng dẫn nhưng dẫn đến chi phí phần cứng tăng cao và ngay cả khi đó vẫn không đạt được tốc độ như VLAs do dấu chân tính toán của các kiến trúc lớn hơn.

FLUX 3 Action (F3A) đơn giản hóa sự lựa chọn này. Điểm kiểm tra (checkpoint) 7B một bước của chúng tôi vượt trội hơn mọi chính sách mở khác trên RoboLab với 38,3% ± 0,38 so với 36,8% của Cosmos 3 Nano, đồng thời cải thiện tốc độ từ 1,34x đến 2,28x trên mỗi giây chuyển động của robot so với Pi0.5 trên các GPU máy trạm và trung tâm dữ liệu, mặc dù vẫn dự đoán video và hành động cùng nhau. Lưu ý rằng lợi thế tốc độ này nằm ở hệ số thời gian thực, không phải độ trễ trên mỗi lệnh gọi: Là một WAM, nó có thể dự đoán một khoảng thời gian chuyển động dài hơn là 2,13 giây so với 1,0 giây của Pi0.5. Khi độ trễ ít quan trọng hơn, điểm kiểm tra được chưng cất hướng dẫn (guidance-distilled) của chúng tôi nâng tỷ lệ thành công tiên tiến nhất trên RoboLab lên 42,2% ± 0,36. Các điểm kiểm tra cơ sở và được chưng cất hướng dẫn của chúng tôi ở định dạng FP8 cung cấp tốc độ nhanh hơn từ 1,52x đến 3,95x so với Cosmos 3 Nano ở định dạng FP8 trên các GPU người dùng, máy trạm và trung tâm dữ liệu.

| Mô hình | Nguồn đóng | Loại | Tỷ lệ thành công (SR%) | Tham số |
| --- | --- | --- | --- | --- |
| FLUX 3 Action | Không | WAM | 42.92% | 7B |
| OASIS WAM | Có | VLM + WAM | 39.0% | – |
| Cosmos3-Nano-Policy | Không | WAM | 36.8% | 16B |
| Phoenix | Có | TAMP+FM | 34.4% | – |
| BiMind v0.1 | Có | VLA | 33.3% | – |
| π0.5 | Không | VLA | 28.0% | 3.3B |
| DreamZero | Không | WAM | 25.7% | 14B |
| Cosmos3-Edge-Policy | Không | WAM | 22.9% | 4B |
| π0-FAST | Không | VLA | 15.5% | 3B |
| GR00T N1.6 | Không | VLA | 7.2% | 3B |
| π0 | Không | VLA | 5.0% | 3.3B |
| paligemma-binning | Không | VLA | 3.4% | 3B |

Bảng 1: Tỷ lệ thành công tổng thể RoboLab-120. Các loại và tính khả dụng của trọng số tuân theo [bảng xếp hạng RoboLab](https://research.nvidia.com/labs/srl/projects/robolab/leaderboard.html).

Hai thay đổi chính dẫn đến những kết quả này: Thứ nhất, một kiến trúc nền nhỏ hơn một nửa so với Cosmos 3 Nano, điều này có thể thực hiện được nhờ quá trình tiền huấn luyện Self-Flow đa phương thức của chúng tôi, mang lại các biểu diễn mạnh mẽ. Thứ hai, quá trình chưng cất (distillation) loại bỏ nhu cầu về một bước hướng dẫn và giảm số lượng bước lấy mẫu xuống còn một bước duy nhất, mà không tách rời video khỏi hành động.

Mặc dù điều này dịch chuyển biên Pareto của các chính sách hành động trên cả tốc độ và độ chính xác, vẫn có những tác vụ mà tất cả các chính sách, bao gồm cả của chúng tôi, không thể tự giải quyết. Mặt khác, GPT 6 Astra có thể giải quyết tất cả các tác vụ trong tiêu chuẩn của Su et al. (2026) khi sử dụng nỗ lực suy luận tối đa. Nhưng một lệnh gọi suy luận đơn lẻ cộng thêm khoảng 35,77 giây trên mỗi giây chuyển động của robot, và mỗi thành công tiêu tốn trung bình 13,47 đô la và 16 phút. Ngược lại, F3A tự nó chỉ mất 21,08 mili giây trên mỗi giây chuyển động của robot và mỗi thành công tiêu tốn trung bình 0,09 đô la và dưới hai phút khi chạy trên GPU H200 với giá 3 đô la mỗi giờ. Trong phần lớn thời gian hai phút đó, F3A ở trạng thái nhàn rỗi, chờ đợi trong khi robot di chuyển. Trong thiết lập này, F3A thậm chí có thể phục vụ 47 lần thực thi khác cùng lúc mà không tốn thêm chi phí. Lưu ý chính là nó không thể giải quyết mọi tác vụ riêng lẻ.

Một giải pháp đầy hứa hẹn là để một bộ suy luận, GPT 6 Astra, ủy quyền kiểm soát cho một chính sách hiệu quả như F3A hoặc Pi0.5 và chỉ can thiệp khi cần thiết. Trong thiết lập của Su và cộng sự (2026), chính sách lai như vậy hầu như không cải thiện tình hình khi sử dụng Pi0.5. Chính sách lai tốt nhất có chi phí 12,28 USD cho mỗi lần thành công so với 13,47 USD cho suy luận thuần túy, và mất 13,5 phút thay vì 14 phút.

Tuy nhiên, với F3A làm chính sách, chiến lược ủy quyền này mang lại hiệu quả. Chính sách lai vẫn giải quyết được 90% tổng số tập lệnh, bao gồm cả các tác vụ phức tạp mà không chính sách hành động thuần túy nào có thể tự giải quyết, đồng thời giảm chi phí xuống còn 8,77 USD và 8 phút cho mỗi lần thành công, giúp rẻ hơn 29% và nhanh hơn 40% so với cấu hình thay thế tốt nhất. Suy luận thuần túy với nỗ lực tối đa vẫn đạt độ chính xác cao nhất, vì vậy sự đánh đổi giữa độ tin cậy và chi phí vẫn tồn tại, nhưng các chính sách cải tiến như F3A đã thay đổi vị trí của sự đánh đổi này.

Chính sách nhanh càng tốt thì hệ thống càng ít phải suy luận. Những khám phá này chỉ là cái nhìn đầu tiên về sự tích hợp sâu hơn giữa suy luận và các hệ thống dự đoán hành động nhanh, và chúng tôi kỳ vọng rằng vẫn còn nhiều dư địa để cải thiện theo hướng sử dụng suy luận nhiều nhất có thể khi cần và ít nhất có thể khi không cần. Dưới đây, chúng tôi mô tả quá trình phát triển của FLUX 3 Action và những phát hiện của chúng tôi trong suốt quá trình này.

### Từ Dự đoán Video đến Dự đoán Hành động

Ý tưởng sử dụng các mô hình dự đoán về các quan sát trong tương lai để ra quyết định đã có lịch sử lâu đời, bao gồm các minh chứng ban đầu về điều khiển robot kết hợp dự đoán video có điều kiện hành động với điều khiển dự đoán mô hình. Thay vào đó, UniPi tạo ra một video về tác vụ đang được thực hiện bằng trình tạo video có điều kiện văn bản và khôi phục các hành động có thể thực thi từ các khung hình được tạo bằng mô hình động lực học nghịch đảo (IDM). Một lập luận chính của UniPi là việc tiền huấn luyện mô hình video trên dữ liệu phi robot quy mô lớn sẽ chuyển đổi sang chính sách robot và cải thiện khả năng tổng quát hóa cho các tác vụ chưa từng thấy.

Các công trình sau đó vẫn giữ cách sử dụng tiền huấn luyện video quy mô lớn này nhưng kết hợp dự đoán video và hành động chặt chẽ hơn so với quy trình hai giai đoạn gồm tạo video rồi đến IDM. Việc dự đoán chung các khung hình và hành động tương lai trong một mô hình tạo duy nhất đã được khám phá bởi GR-1, GR-2, WorldVLA, Cosmos Policy và LingBot-VA; DreamZero đã giới thiệu thuật ngữ World Action Model (WAM) cho phương pháp này, mà các hệ thống sau đó như GigaWorld-Policy và các biến thể chính sách của Cosmos 3 cũng áp dụng. Ngược lại, mimic-video giữ lại mô hình động lực học nghịch đảo nhưng điều kiện hóa nó trên các đặc trưng tiềm ẩn của mô hình video thay vì các khung hình đã giải mã, tránh việc tổng hợp video đầy đủ khi suy luận và tạo ra cái mà các tác giả gọi là Video-Action Model (VAM). Một hướng đi khác coi dự đoán video là một tác vụ đồng huấn luyện bổ trợ và bỏ qua việc tạo video khi suy luận.

Trước đây, chúng tôi đã khám phá hiệu suất của FLUX 3 dưới dạng VAM với bộ giải mã hành động riêng biệt trong [nghiên cứu thiết kế FLUX-mimic](https://bfl.ai/blog/flux-3-mimic). Xem thêm [nghiên cứu tiếp theo của mimic về hiệu quả dữ liệu của flux-mimic](https://www.mimicrobotics.com/blog/video-action-models-for-data-efficient-industrial-manipulation). Tại đây, chúng tôi nghiên cứu hiệu suất của FLUX 3 dưới dạng WAM với dự đoán video-hành động chung như trong Hình 3.

### Thử nghiệm Vòng lặp Điều khiển

Với một chỉ dẫn như “đặt khối màu đỏ vào thùng bên trái,” mô hình sử dụng hình ảnh camera và vị trí khớp để dự đoán các lệnh động cơ và kết quả hình ảnh của chúng cùng nhau. Robot thực hiện một số lượng các hành động đó, sau đó quan sát lại và lập kế hoạch từ quan sát mới.

Bắt đầu một nhiệm vụ, thả một khối và xem cánh tay robot phục hồi. Thay đổi tần suất quan sát lại để xem điều đó ảnh hưởng thế nào đến phản ứng của nó.

### Phát hiện

### Tiền huấn luyện và Huấn luyện trung gian

Tiền huấn luyện tuân theo FLUX 3 và sử dụng hỗn hợp dữ liệu hình ảnh, video và âm thanh, trong đó video chiếm hơn 95% token huấn luyện. Để đánh giá khả năng dự đoán hành động của các checkpoint tiền huấn luyện, chúng tôi tuân theo giao thức tương tự Cosmos 3: chúng tôi thêm các đầu hành động được khởi tạo ngẫu nhiên và sau đó tinh chỉnh trên DROID. Checkpoint thu được được đánh giá trên RoboLab.

Đối với các kết quả trong Hình 4, chúng tôi đã sử dụng các thiết lập sơ bộ với kích thước batch và tốc độ học nhỏ. Do đó, chúng không đại diện cho hiệu suất tối đa có thể đạt được bởi một checkpoint. Nhưng vì tất cả các lần chạy đều sử dụng các thiết lập tương đương, điều này vẫn cho phép chúng tôi so sánh khả năng tương đối của chúng đối với việc dự đoán hành động.

Lưu ý rằng nếu không có tiền huấn luyện, hiệu suất vẫn dưới 1%. Với tiền huấn luyện, con số này tăng lên 11,6% và tiếp tục cải thiện chậm nhưng ổn định lên 12,4%. Hiệu suất thấp của checkpoint không được tiền huấn luyện cho thấy việc huấn luyện hành động DROID thuần túy bị hạn chế dữ liệu nghiêm trọng, và nó cho thấy rằng tiền huấn luyện đa phương thức nặng về video thực sự có thể vượt qua hạn chế đó.

Tiếp theo, chúng tôi xem xét giai đoạn huấn luyện trung gian tập trung vào hành động, nơi chúng tôi tiếp tục huấn luyện trên hỗn hợp dữ liệu tiền huấn luyện cùng với dữ liệu hành động mới được giới thiệu. Chúng tôi phân bổ 36,95% mẫu huấn luyện cho video có âm thanh từ dữ liệu tiền huấn luyện và 63,05% còn lại cho dữ liệu video đi kèm với các hành động đã được căn chỉnh. Trong tổng số mẫu huấn luyện, 19,55% đến từ các bản ghi trò chơi, 13,54% từ video góc nhìn thứ nhất với chú thích tư thế tay, 14,03% từ thiết bị cầm tay và 15,93% từ điều khiển từ xa qua 14 hiện thân. Tỷ lệ token tương ứng khác nhau một chút do độ phân giải và thời lượng khác nhau; xem Bảng 2.

| Danh mục | Tỷ lệ mẫu (%) | Tỷ lệ token (%) |
| --- | --- | --- |
| Video/âm thanh chung | 36.95 | 39.00 |
| Trò chơi | 19.55 | 21.85 |
| Tay người góc nhìn thứ nhất | 13.54 | 13.78 |
| Cầm tay | 14.03 | 13.99 |
| Điều khiển từ xa | 15.93 | 11.37 |

Bảng 2: Hỗn hợp dữ liệu huấn luyện trung gian hành động theo mẫu và token.

Các hành động trong trò chơi được biểu diễn với 64 chiều. Hai chiều đầu tiên mã hóa chuyển động chuột dọc theo trục x và y, hai chiều tiếp theo mã hóa các nút chuột trái và phải, và 60 chiều còn lại mã hóa các nút bàn phím. Các kênh nút nhị phân được giải lượng tử hóa trong quá trình huấn luyện.

Hầu hết các tập dữ liệu dựa trên tư thế góc nhìn thứ nhất, cầm tay và điều khiển từ xa sử dụng không gian hành động 50 chiều, EE50. 25 chiều đầu tiên được sử dụng cho thiết bị đầu cuối trái hoặc chính và 25 chiều cuối cho thiết bị đầu cuối phải hoặc phụ. Trong 25 chiều này, ba chiều đầu tiên mã hóa tịnh tiến, và sáu chiều tiếp theo mã hóa xoay như trong Zhou và cộng sự 2019, nhưng sử dụng hai hàng đầu thay vì hai cột đầu của ma trận xoay. 16 chiều còn lại mã hóa các góc của tư thế tay hoặc trạng thái của kẹp, với 0 đại diện cho kẹp đóng và 1 đại diện cho kẹp mở. Các chiều không được sử dụng cho một hiện thân sẽ được đệm bằng số không.

Lưu ý rằng một số tập dữ liệu robot dựa trên không gian hành động 14 chiều riêng biệt, chia thành 7 chiều cho cánh tay trái/chính và 7 chiều cho cánh tay phải/phụ. Tại đây, chúng tôi huấn luyện trực tiếp trên 6 trạng thái khớp và một trạng thái kẹp vì chúng tôi không có các mô hình động lực học tiến của hiện thân. Trên tất cả các tập dữ liệu hành động, tốc độ hành động dao động từ 5 Hz đến 30 Hz.

Đối với không gian hành động EE50, tư thế của bộ phận chấp hành cuối (end effector) được biểu diễn tương đối so với một khung neo (anchor frame), vốn là khung điều kiện cuối cùng. Chúng tôi chọn trạng thái hành động gần nhất với khung neo này làm trạng thái neo và biểu diễn tất cả các tư thế khác của bộ phận chấp hành cuối tương đối so với trạng thái này. Các giá trị khớp tay và kẹp (gripper) vẫn giữ nguyên ở dạng tuyệt đối. Cuối cùng, chúng tôi chuẩn hóa từng chiều EE50 bằng cách sử dụng z-score đặc thù cho từng hiện thân (embodiment) như trong Punamiya et al. 20252, được lập chỉ mục theo độ lệch vị trí có dấu so với trạng thái neo.

Với đầu ra hành động EE50, giờ đây chúng tôi cũng có thể đánh giá hiệu suất RoboLab của các điểm kiểm tra (checkpoint) giữa quá trình huấn luyện mà không cần tinh chỉnh (finetuning) bổ sung. Kết quả của các đánh giá này được hiển thị bằng các đường gạch chéo trong Hình 4. Ban đầu, chúng tôi quan sát thấy hiệu suất EE50 tăng nhanh từ 0% lên 7,2% và 14,7% với mức tăng khiêm tốn đối với các kết quả thu được từ phương pháp tinh chỉnh Joint - vốn chỉ cải thiện 2,3% so với hiệu suất ở điểm kiểm tra tiền huấn luyện cuối cùng. Về các bước sau, chúng tôi thấy hiệu suất tiếp tục cải thiện cho cả EE50, đạt 17,3% và tinh chỉnh Joint, đạt 18,6%. Chúng tôi vẫn chưa thấy hiệu suất bão hòa trong quá trình huấn luyện.

### Chuyển đổi từ Nhiễu sang Tín hiệu cho Video và Hành động

Các mô hình khuếch tán (diffusion) và dòng chảy (flow) đang học cách đảo ngược một quá trình tiến thời gian zt = (1−t)x₀ + tε, trong đó trộn dữ liệu x₀ với nhiễu ε ∼ N(0,1). Tùy thuộc vào quy mô và cấu trúc của dữ liệu, vùng t nơi quá trình tiến này chuyển đổi giữa nhiễu và tín hiệu có thể khác nhau. Trong quá trình huấn luyện, t được lấy mẫu từ một phân phối bước thời gian (timestep distribution) và việc lựa chọn này có thể ảnh hưởng đáng kể đến hiệu suất của các mô hình1.

Khi dự đoán đồng thời hai phương thức như video và hành động, chúng tôi cũng phải xem xét sự tương tác giữa hai phương thức này. Để nắm bắt các vùng chuyển đổi từ tín hiệu sang nhiễu cho hai phương thức, chúng tôi tính toán riêng biệt tổn thất tái tạo x₀ cho cả hai. Chúng tôi thực hiện điều này cho nhiều điểm kiểm tra được huấn luyện với các phân phối bước thời gian khác nhau, sau đó lấy giá trị tối thiểu theo từng điểm trên các điểm kiểm tra để thu được đường bao tối thiểu (minimum-envelope) của tổn thất x₀ như một phép xấp xỉ cho cấu hình tín hiệu-nhiễu của video và hành động. Chúng tôi vẽ các đường bao này, được chuẩn hóa với tổn thất tối đa là 1, trong Hình 5.

Chúng tôi quan sát thấy một cấu hình hình chữ S với sự chuyển đổi xung quanh σ(t) = 3,3 hoặc t ≃ 0,964. Giả định rằng năng lực mô hình được sử dụng tốt nhất ở các vùng có sự chuyển đổi tín hiệu cao, một cách tiếp cận hợp lý là sử dụng phân phối bước thời gian có hàm mật độ xác suất (pdf) tỷ lệ thuận với đạo hàm của cấu hình hình chữ S. Tùy thuộc vào hàm số chúng tôi sử dụng để xấp xỉ hình chữ S, chúng tôi sẽ có các phân phối bước thời gian khác nhau. Khi sử dụng hàm sigmoid để xấp xỉ như trong Hình 5, chúng tôi thu được phân phối logistic trong không gian logit, tức là các phân phối logit-logistic được hiển thị trong Hình 6. Tương tự, khi sử dụng hàm CDF Gaussian, chúng tôi thu được phân phối Gaussian trong không gian logit hoặc phân phối logit-normal.

Chúng tôi sử dụng các ước tính này làm hướng dẫn để chọn phân phối bước thời gian trong quá trình tìm kiếm lưới (grid search). Ngoài các phân phối logit-normal và logit-logistic, chúng tôi cũng bao gồm phân phối bước thời gian “mode-sampler” hoặc “Waver”2 vì đây là lựa chọn trong NVIDIA et al. 20263. Chúng tôi xây dựng tham số vị trí cho cả ba phân phối ứng viên thông qua một phân phối cơ sở có tâm bằng 0, theo sau là việc áp dụng hàm dịch chuyển, t ↦ αt / (1 + (α−1)t), với tham số α. Đối với các phân phối logit-normal và logit-logistic, điều này dẫn đến sự dịch chuyển mode của chúng về logit(t) = log α. Chúng tôi chọn α ∈ {24, 33, 42} tương ứng với các mode của ước tính video và hành động trong Hình 6 cùng với một giá trị ở giữa. Chúng tôi sử dụng phương sai đơn vị cho phân phối logit-normal và xem xét các phân phối logit-logistic với quy mô 0,5 và 0,75. Đối với phân phối Waver, chúng tôi tuân theo NVIDIA et al. 2026 và sử dụng độ dịch chuyển α = 5, đồng thời quét qua một giá trị cao hơn (10) và một giá trị thấp hơn (2,5).

_Bài gốc còn tiếp._ Xem tiếp tại: <https://bfl.ai/blog/flux-3-action>
