Nghiên cứu
Arbitrage: Tối ưu hóa suy luận LLM thông qua cơ chế dự đoán dựa trên ngữ nghĩa
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu từ Apple giới thiệu Arbitrage, phương pháp cải tiến giải mã suy đoán giúp giảm thiểu việc từ chối token không cần thiết bằng cách tập trung vào sự tương đương về ngữ nghĩa thay vì chỉ khớp từng token đơn lẻ.
Bản dịch AI

Tác giả: Monishwaran Maheswaran†*, Rishabh Tiwari†*, Yuezhou Hu†*, Kerem Dilmen†, Coleman Hooper†, Haocheng Xi†, Nicholas Lee†, Mehrdad Farajtabar, Michael W. Mahoney†‡§, Kurt Keutzer†, Amir Gholami†‡
Các mô hình ngôn ngữ lớn (Large Language Models) hiện đại đạt được khả năng lập luận ấn tượng nhờ chuỗi suy nghĩ (Chain of Thoughts) dài, nhưng chúng lại tiêu tốn chi phí tính toán đáng kể trong quá trình suy luận (inference), điều này thúc đẩy việc tìm kiếm các kỹ thuật cải thiện tỷ lệ hiệu năng/chi phí. Trong số các kỹ thuật này, Speculative Decoding giúp tăng tốc suy luận bằng cách sử dụng một mô hình dự thảo (draft model) nhanh nhưng kém chính xác để tự hồi quy (auto-regressively) đề xuất các token, sau đó được xác thực song song bởi một mô hình mục tiêu (target model) mạnh mẽ hơn. Tuy nhiên, do các lần từ chối không cần thiết gây ra bởi sự không khớp token trong các bước tương đương về mặt ngữ nghĩa, phương pháp Speculative Decoding cấp độ token truyền thống gặp khó khăn trong các tác vụ lập luận. Mặc dù các nghiên cứu gần đây đã chuyển sang xác thực ngữ nghĩa cấp độ bước (step-level), giúp cải thiện hiệu quả bằng cách chấp nhận hoặc từ chối toàn bộ các bước lập luận, các phương pháp cấp độ bước hiện tại vẫn tạo lại nhiều bước bị từ chối mà không mang lại cải thiện đáng kể, gây lãng phí tài nguyên tính toán quý giá của mô hình mục tiêu. Để giải quyết thách thức này, chúng tôi đề xuất ARBITRAGE, một khung tạo suy luận suy đoán cấp độ bước mới giúp điều hướng quá trình tạo văn bản một cách linh hoạt dựa trên lợi thế tương đối giữa mô hình dự thảo và mô hình mục tiêu. Thay vì áp dụng một ngưỡng chấp nhận cố định, ARBITRAGE sử dụng một bộ định tuyến (router) gọn nhẹ được huấn luyện để dự đoán khi nào mô hình mục tiêu có khả năng tạo ra bước lập luận tốt hơn một cách rõ rệt. Việc định tuyến này mô phỏng một ARBITRAGE ORACLE lý tưởng, luôn chọn bước có chất lượng cao hơn, từ đó đạt được sự cân bằng tối ưu giữa hiệu quả và độ chính xác. Trên nhiều tiêu chuẩn đánh giá lập luận toán học, ARBITRAGE liên tục vượt qua các phương pháp nền tảng SD cấp độ bước trước đó, giảm độ trễ suy luận lên tới ~2 lần trong khi vẫn giữ nguyên độ chính xác.
Các bài đọc liên quan và cập nhật.
Speculative decoding giúp tăng tốc suy luận LLM bằng cách sử dụng mô hình dự thảo để nhìn trước, nhưng lợi ích đạt được bị giới hạn bởi chi phí tạo dự thảo tự hồi quy: việc tăng kích thước dự thảo giúp nâng cao tỷ lệ chấp nhận nhưng lại làm tăng độ trễ, gây trầm trọng thêm sự đánh đổi giữa tốc độ và độ chính xác. Các phương pháp trước đây (Medusa, Hydra, EAGLE) đã giảm một phần chi phí dự thảo nhưng hoặc làm giảm tỷ lệ chấp nhận, hoặc gây ra các chi phí phụ làm hạn chế khả năng mở rộng. Chúng tôi giới thiệu Mirror…
Đọc thêm
Bài báo này đã được chấp nhận tại Hội thảo Efficient Natural Language and Speech Processing (ENLSP) thuộc khuôn khổ NeurIPS 2024.
Speculative decoding là một kỹ thuật nổi bật nhằm tăng tốc suy luận của một mô hình ngôn ngữ mục tiêu lớn dựa trên các dự đoán từ một mô hình dự thảo phụ trợ. Mặc dù hiệu quả, nhưng trong các thiết lập ứng dụng cụ thể, kỹ thuật này thường đòi hỏi phải tinh chỉnh (fine-tuning) cả mô hình dự thảo và mô hình mục tiêu để đạt được tỷ lệ chấp nhận cao. Khi số lượng các tác vụ hạ nguồn (downstream tasks)…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.