Apple Machine Learning Research
92

Tin ngành

Apple ra mắt TS-DFM: Tối ưu hóa mô hình ngôn ngữ với 'la bàn năng lượng' siêu tốc

(giờ Việt Nam)

Tóm tắt AI

Apple giới thiệu TS-DFM, kỹ thuật chưng cất mô hình sử dụng 'la bàn năng lượng' để chọn lọc bước nhảy hiệu quả thay vì ngẫu nhiên. Kết quả cho thấy mô hình 8 bước vượt trội hơn mô hình 1024 bước tới 32% về độ chính xác, đồng thời tăng tốc độ suy luận gấp 128 lần.

Bản dịch AI

Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation

Tác giả: Amin Karimi Monsefi†**, Dominic Culver, Nikhil Bhendawade, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

Discrete flow matching tạo văn bản bằng cách chuyển đổi lặp đi lặp lại các token nhiễu thành ngôn ngữ mạch lạc, nhưng có thể cần hàng trăm lượt truyền xuôi (forward pass). Kỹ thuật chưng cất (distillation) sử dụng quỹ đạo đa bước để huấn luyện một mô hình học viên (student) tái tạo quy trình này chỉ trong vài bước. Khi mô hình học viên hoạt động kém hiệu quả, cách giải thích thông thường là do năng lực mô hình không đủ. Chúng tôi lập luận ngược lại: quỹ đạo mới là nút thắt cổ chai chứ không phải mô hình học viên. Mỗi quỹ đạo huấn luyện được xây dựng thông qua một chuỗi các bước nhảy ngẫu nhiên mù quáng mà không có sự đánh giá về chất lượng chuỗi; một quyết định sai lầm tại thời điểm trung gian sớm sẽ lan truyền qua các bước tiếp theo, trong khi mô hình học viên buộc phải bắt chước kết quả đó. Trajectory-Shaped Discrete Flow Matching (TS-DFM) thay thế các bước nhảy mù quáng này bằng điều hướng có hướng dẫn: một la bàn năng lượng nhẹ đánh giá các phương án tiếp nối tại mỗi điểm trung gian, từ đó chọn ra phương án mạch lạc nhất. Tất cả quá trình định hình chỉ diễn ra trong lúc huấn luyện; chi phí suy luận không thay đổi. Trên mô hình ngôn ngữ 170M tham số, mô hình học viên được định hình ở 8 bước đạt độ phức tạp (perplexity) thấp hơn 32% so với mô hình giáo viên (teacher) 1.024 bước, đồng thời nhanh hơn 128 lần, với mức tăng trưởng nhất quán trên các phân phối nguồn và ba trình đánh giá có quy mô tăng dần. TS-DFM đạt được độ phức tạp tốt nhất trong số các phương pháp nền tảng tạo văn bản rời rạc mà chúng tôi so sánh, bao gồm cả các phương pháp được huấn luyện trên lượng dữ liệu nhiều gấp 6 lần hoặc sử dụng các mô hình lớn gấp 5 lần.

Các bài đọc liên quan và cập nhật.

Các mô hình ngôn ngữ tự hồi quy (ARMs) mang lại khả năng dự đoán xác suất mạnh mẽ, nhưng về bản chất lại mang tính tuần tự: chúng tạo ra từng token một cho mỗi lượt truyền xuôi, điều này hạn chế thông lượng và làm tăng độ trễ đối với các chuỗi dài. Các mô hình ngôn ngữ khuếch tán (DLMs) song song hóa trên các vị trí và do đó tỏ ra đầy hứa hẹn cho việc tạo ngôn ngữ, tuy nhiên các mô hình khuếch tán rời rạc tiêu chuẩn thường cần hàng trăm đến hàng nghìn lượt đánh giá mô hình để đạt được chất lượng cao, đánh đổi độ sâu tuần tự…

Đọc thêm

Chúng tôi đề xuất một quy luật mở rộng chưng cất (distillation scaling law) giúp ước tính hiệu suất của mô hình được chưng cất dựa trên ngân sách tính toán và sự phân bổ ngân sách đó giữa mô hình học viên và mô hình giáo viên. Những phát hiện của chúng tôi giúp giảm thiểu rủi ro liên quan đến việc chưng cất quy mô lớn bằng cách cho phép phân bổ tối ưu tài nguyên tính toán cho cả giáo viên và học viên nhằm tối đa hóa hiệu suất của học viên. Chúng tôi cung cấp các công thức chưng cất tối ưu về tính toán cho hai kịch bản chính: khi đã có sẵn mô hình giáo viên và khi…

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.