Apple Machine Learning Research
85

Nghiên cứu

Mở rộng quy mô mô hình Categorical Flow Maps cho dữ liệu rời rạc

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu từ Apple giới thiệu Categorical Flow Maps (CFMs), một phương pháp mới giúp tạo dữ liệu rời rạc thông qua luồng liên tục, mang lại khả năng lấy mẫu nhanh và chất lượng vượt trội so với các mô hình tự hồi quy truyền thống.

Bản dịch AI

Scaling Categorical Flow Maps

Tác giả: Oscar Davis†**, Anastasiia Filippova, Victor Turrisi, Amitis Shidani, Pierre Ablin, Marco Cuturi, Louis Béthune

Các mô hình khuếch tán liên tục (continuous diffusion) và khớp dòng (flow matching) có thể là một giải pháp thay thế mạnh mẽ cho các phương pháp tự hồi quy (autoregressive) trong mô hình hóa ngôn ngữ (LM), vì chúng mở ra hàng loạt ưu điểm vốn chỉ dành cho các phương thức liên tục, bao gồm lấy mẫu tăng tốc và tilting. Gần đây, một số nghiên cứu đã chứng minh khả năng tạo dữ liệu rời rạc một cách liên tục thông qua quy trình khớp dòng đơn giản giữa phân phối Gaussian và phân phối dữ liệu mã hóa one-hot. Họ cũng đã chứng minh tính khả thi của việc lấy mẫu tăng tốc thông qua Categorical Flow Maps (CFMs), mang lại chất lượng mẫu cạnh tranh trong chế độ ít bước (few-step). Tuy nhiên, phương pháp này mới chỉ được đánh giá ở quy mô tương đối khiêm tốn (< 1 tỷ tham số), để lại câu hỏi bỏ ngỏ về khả năng mở rộng của nó. Trong bài báo này, chúng tôi huấn luyện một mô hình flow cơ sở với 1,7 tỷ tham số trên 2,1 nghìn tỷ token và tự chưng cất (self-distill) nó thành một CFM có khả năng tạo ra văn bản đa dạng, chất lượng cao chỉ trong 4 bước suy luận, đồng thời duy trì entropy token gần với mức dữ liệu thực tế. Hơn nữa, chúng tôi giới thiệu một giới hạn khả năng xảy ra (likelihood bound) cho CFMs trong bối cảnh bán rời rạc và chỉ ra rằng chúng có thể được sử dụng để chấm điểm mô hình trên các tiêu chuẩn LM thông thường, đạt kết quả tương đương với các phương pháp khuếch tán rời rạc. Cuối cùng, chúng tôi làm sáng tỏ một số thách thức nảy sinh khi huấn luyện các mô hình này ở quy mô lớn và cung cấp những hiểu biết mang tính định hướng về trọng số mất mát (loss weighting) và lập lịch thời gian (time scheduling).

Các bài đọc liên quan và cập nhật.

Các mô hình khuếch tán đạt được khả năng tạo ảnh chất lượng cao nhưng bị hạn chế bởi quá trình lấy mẫu lặp lại chậm. Các phương pháp chưng cất (distillation) giúp giảm bớt vấn đề này bằng cách cho phép tạo ảnh trong một hoặc vài bước. Flow matching, ban đầu được giới thiệu như một khung làm việc riêng biệt, từ đó đã được chứng minh là tương đương về mặt lý thuyết với khuếch tán dưới các giả định Gaussian, đặt ra câu hỏi liệu các kỹ thuật chưng cất như score distillation có thể chuyển đổi trực tiếp hay không. Chúng tôi cung cấp một…

Đọc thêm

Mô hình hóa tạo sinh có điều kiện (conditional generative modeling) nhằm mục đích học phân phối dữ liệu có điều kiện từ các mẫu chứa các cặp dữ liệu-điều kiện. Đối với mục tiêu này, các phương pháp dựa trên khuếch tán và flow đã đạt được những kết quả đầy thuyết phục. Các phương pháp này sử dụng một mô hình (flow) đã học để vận chuyển nhiễu Gaussian tiêu chuẩn ban đầu (vốn bỏ qua điều kiện) sang phân phối dữ liệu có điều kiện. Do đó, mô hình được yêu cầu phải học cả việc vận chuyển khối lượng (mass transport) và chèn điều kiện (conditional injection). Để giảm bớt…

Đọc thêm

AppleFlow MatchingGenerative AIMô hình ngôn ngữNghiên cứu AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.