Apple Machine Learning Research
85

Nghiên cứu

STARFlow2: Kết hợp mô hình ngôn ngữ và dòng chuẩn hóa cho thế hệ đa phương thức thống nhất

(giờ Việt Nam)

Tóm tắt AI

STARFlow2 tích hợp dòng chuẩn hóa tự hồi quy vào LLM, tận dụng cấu trúc chung để tạo ảnh đa phương thức mà không làm giảm độ trung thực của hình ảnh như phương pháp token hóa rời rạc.

Bản dịch AI

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

Tác giả: Ying Shen†**, Tianrong Chen, Yuan Gao, Yizhe Zhang, Yuyang Wang, Miguel Angel Bautista Martin, Shuangfei Zhai, Josh Susskind, Jiatao Gu

Các mô hình đa phương thức hợp nhất có khả năng hiểu, suy luận và tạo ra các chuỗi văn bản-hình ảnh đan xen hiện vẫn còn bị phân mảnh về mặt cấu trúc: các phương pháp hiện có hoặc làm giảm độ trung thực của hình ảnh thông qua quá trình token hóa rời rạc, hoặc tạo ra sự bất đối xứng về cấu trúc bằng cách kết hợp tạo văn bản nhân quả (causal text generation) với khử nhiễu dựa trên khuếch tán lặp lại, hoặc làm suy giảm khả năng hiểu đã được huấn luyện trước khi điều chỉnh các mô hình ngôn ngữ-hình ảnh (vision-language models) cho mục đích tạo nội dung. Chúng tôi nhận thấy rằng các autoregressive normalizing flows thực chất là các autoregressive Transformers—chia sẻ cùng một mặt nạ nhân quả (causal mask), cơ chế KV-cache và cấu trúc từ trái sang phải giống như các LLM—khiến chúng trở thành mô hình tự nhiên nhất cho việc tạo đa phương thức hợp nhất thực sự, vốn mang tính liên tục, thực hiện trong một lần truyền (single-pass) và hoàn toàn mang tính nhân quả. Chúng tôi giới thiệu STARFlow2, được xây dựng trên kiến trúc Pretzel, trong đó đan xen theo chiều dọc một luồng VLM đã được huấn luyện trước (đóng băng trọng số) với một luồng TARFlow thông qua các kết nối tắt residual, cả hai đều hoạt động dưới cùng một mặt nạ nhân quả. Thiết kế này vừa bảo toàn khả năng hiểu đa phương thức đã được huấn luyện trước, vừa cho phép tạo hình ảnh liên tục với độ trung thực cao, đồng thời đạt được sự hợp nhất về cấu trúc dưới một cơ chế nhân quả duy nhất. Kết hợp với thiết kế dòng chảy sâu-nông (deep-shallow flow) và không gian ẩn FAE hợp nhất, STARFlow2 hỗ trợ tạo nội dung đan xen thân thiện với bộ nhớ đệm, nơi cả đầu ra văn bản và hình ảnh đều đi trực tiếp vào KV-cache mà không cần mã hóa lại. Các thử nghiệm cho thấy hiệu suất mạnh mẽ trên các tiêu chuẩn đánh giá về tạo hình ảnh và hiểu đa phương thức, khẳng định autoregressive flows là một nền tảng khả thi cho mô hình hóa đa phương thức hợp nhất.

Các bài đọc liên quan và cập nhật.

Normalizing flows (NFs) là các mô hình tạo nội dung dựa trên xác suất (likelihood-based) đầu-cuối cho dữ liệu liên tục, và gần đây đã thu hút sự chú ý trở lại với những tiến bộ đáng khích lệ trong việc tạo hình ảnh. Tuy nhiên, trong lĩnh vực tạo video, nơi độ phức tạp không gian-thời gian và chi phí tính toán cao hơn đáng kể, các hệ thống tiên tiến nhất gần như chỉ dựa vào các mô hình dựa trên khuếch tán (diffusion-based models). Trong nghiên cứu này, chúng tôi xem xét lại không gian thiết kế này bằng cách giới thiệu STARFlow-V, một…

Đọc thêm

Quá trình suy luận của Large Language Model hay LLM có hai giai đoạn: giai đoạn gợi ý (hoặc prefill) để xuất ra token đầu tiên và giai đoạn mở rộng (hoặc giải mã) để tạo ra các token tiếp theo. Trong nghiên cứu này, chúng tôi đề xuất một lược đồ song song hóa hiệu quả, KV-Runahead, để tăng tốc giai đoạn gợi ý. Quan sát then chốt là giai đoạn mở rộng tạo ra các token nhanh hơn giai đoạn gợi ý nhờ vào bộ nhớ đệm key-value (KV-cache). Do đó, KV-Runahead…

Đọc thêm

AI đa phương thứcLLMApple ResearchDòng chuẩn hóaThế hệ hình ảnh
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.