Apple Machine Learning Research
85

Nghiên cứu

Vượt xa dự đoán token tiếp theo: So sánh hiệu năng giữa mô hình ngôn ngữ khuếch tán và tự hồi quy

(giờ Việt Nam)

Tóm tắt AI

Nhóm nghiên cứu của Apple đã thực hiện phân tích chuyên sâu so sánh mô hình ngôn ngữ khuếch tán (DLMs) và mô hình tự hồi quy (ARMs), làm rõ tiềm năng của DLMs như một hướng đi mới bên cạnh ưu thế về độ chính xác của ARMs.

Bản dịch AI

Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

Tác giả: Minseo Kim†, Coleman Hooper‡, Aditya Tomar‡, Chenfeng Xu‡††, Mehrdad Farajtabar, Michael W. Mahoney‡§¶, Kurt Keutzer‡, Amir Gholami‡§*

Các Mô hình Ngôn ngữ Lớn (LLM) đã đạt được hiệu suất vượt trội trên nhiều tác vụ Xử lý Ngôn ngữ Tự nhiên (NLP), bao gồm xử lý tài liệu và tạo mã nguồn. Các Mô hình Ngôn ngữ Tự hồi quy (ARM), vốn tạo ra các token theo trình tự dựa trên tất cả các token trước đó, đã trở thành mô hình chủ đạo cho các LLM. Mặc dù các mô hình này đạt độ chính xác cao trên nhiều tác vụ hạ nguồn, chúng lại có cường độ tính toán thấp do sự phụ thuộc tuần tự vốn có trong việc dự đoán token tiếp theo. Gần đây, các Mô hình Ngôn ngữ Khuếch tán (DLM) đã nổi lên như một kiến trúc thay thế đầy hứa hẹn. DLM tạo ra các token đầu ra song song, giúp giảm thiểu những hạn chế của việc giải mã tuần tự. Tuy nhiên, các tác động về hiệu suất của DLM so với các mô hình ARM thường được triển khai vẫn chưa được hiểu rõ hoàn toàn. Trong nghiên cứu này, chúng tôi trình bày một phân tích toàn diện về đặc điểm hiệu suất của ARM và DLM, kết hợp phân tích lý thuyết với đo lường thực nghiệm để làm rõ sự đánh đổi giữa các phương pháp này. Chúng tôi chỉ ra rằng mặc dù DLM có thể đạt cường độ tính toán cao hơn ARM nhờ tận dụng tính song song giữa các vị trí token, nhưng chúng lại không mở rộng hiệu quả với các ngữ cảnh dài hơn. Sau đó, chúng tôi khám phá phương pháp giải mã theo khối (block-wise decoding) cho DLM, giúp tách biệt cường độ tính toán khỏi độ dài chuỗi và cho phép mở rộng tốt hơn với các ngữ cảnh dài (tương tự như ARM). Chúng tôi cũng xem xét việc suy luận theo lô (batched inference) và nhận thấy rằng ARM thể hiện thông lượng vượt trội vì chúng hưởng lợi nhiều hơn từ tính song song giữa các chuỗi trong lô. Cuối cùng, chúng tôi nêu bật các cơ hội để tăng tốc suy luận cho DLM, nhấn mạnh rằng việc giảm số bước lấy mẫu là chìa khóa để các DLM mã nguồn mở đạt được độ trễ thấp hơn so với ARM.

Các bài đọc liên quan và cập nhật.

Các mô hình ngôn ngữ tự hồi quy bị hạn chế bởi bản chất tuần tự vốn có, chỉ tạo ra từng token một. Mô hình này giới hạn tốc độ suy luận và tính song song, đặc biệt là trong các giai đoạn tạo văn bản sau, khi hướng đi và ngữ nghĩa của văn bản đã tương đối rõ ràng. Trong nghiên cứu này, chúng tôi đề xuất một khung làm việc mới tận dụng kiến thức vốn có của các mô hình ngôn ngữ tự hồi quy thông thường về các token tương lai, kết hợp các kỹ thuật để…

Đọc thêm

Các Mô hình Ngôn ngữ Khuếch tán (DLM) đã nổi lên như một mô hình mới đầy hứa hẹn cho việc tạo mô hình văn bản, có khả năng giải quyết các hạn chế của các mô hình tự hồi quy (AR). Tuy nhiên, các DLM hiện tại mới chỉ được nghiên cứu ở quy mô nhỏ hơn so với các mô hình AR tương đương và thiếu sự so sánh công bằng trên các tiêu chuẩn đánh giá mô hình ngôn ngữ. Ngoài ra, việc huấn luyện các mô hình khuếch tán từ đầu ở quy mô lớn vẫn còn nhiều thách thức. Với sự phổ biến của các mô hình AR mã nguồn mở…

Đọc thêm

AppleMô hình ngôn ngữNghiên cứu AIDiffusion ModelsLLM
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.