Apple Machine Learning Research
85

Tin ngành

DACA-GRPO: Apple tối ưu hóa học tăng cường cho mô hình ngôn ngữ khuếch tán

(giờ Việt Nam)

Tóm tắt AI

Apple giới thiệu DACA-GRPO, phương pháp mới giúp cải thiện việc phân bổ tín dụng trong học tăng cường cho mô hình ngôn ngữ khuếch tán thông qua kỹ thuật đánh giá tiến trình khử nhiễu và giảm sai lệch ước tính.

Bản dịch AI

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

Tác giả: Amin Karimi Monsefi†‡**, Dominic Culver‡, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

Các mô hình ngôn ngữ lớn khuếch tán (Diffusion large language models) là một giải pháp thay thế đầy hứa hẹn cho các mô hình tự hồi quy (autoregressive models), tuy nhiên các phương pháp RL hiện tại cho mô hình khuếch tán lại coi mọi bước khử nhiễu (denoising steps) đều quan trọng như nhau và dựa vào các ước tính khả năng xảy ra (likelihood estimates) có độ chệch và phương sai cao. Chúng tôi xác định hai điểm yếu cơ bản: sự thiếu hụt phân bổ tín dụng theo thời gian (temporal credit assignment) trên toàn bộ quỹ đạo khử nhiễu, và độ chệch hệ thống của các ước tính khả năng xảy ra trường trung bình (mean-field likelihood estimates) được sử dụng để tối ưu hóa chính sách. Để giải quyết vấn đề này, chúng tôi đề xuất Denoising-Aware Credit Assignment for GRPO (DACA-GRPO), một cải tiến nhẹ, có thể cắm-và-chạy (plug-and-play) cho bất kỳ trình huấn luyện theo phong cách GRPO nào. DACA-GRPO giới thiệu hai cơ chế bổ trợ: Denoising Progress Scores (Điểm tiến trình khử nhiễu), giúp trích xuất trọng số tầm quan trọng của từng token từ các dự đoán trung gian mà không tốn thêm chi phí tính toán xuôi (forward cost), và Stratified Masking Likelihood (Khả năng xảy ra che khuất phân tầng), giúp phân chia các vị trí token thành các tầng để mỗi token được dự đoán với hầu hết chuỗi làm ngữ cảnh, từ đó giảm độ chệch trường trung bình. Khi áp dụng trên ba phương pháp cơ sở GRPO, DACA-GRPO đạt được những cải thiện nhất quán trên bảy tiêu chuẩn đánh giá bao gồm suy luận toán học, tạo mã, thỏa mãn ràng buộc và tạo nội dung có ràng buộc, với mức tăng lên tới 5,6 điểm phần trăm (pp) về suy luận toán học, 7,4pp về tạo mã, 36,3pp về thỏa mãn ràng buộc và 5,9pp về tuân thủ lược đồ JSON.

Các bài đọc liên quan và cập nhật.

Học tăng cường với phần thưởng có thể kiểm chứng (Reinforcement Learning with Verifiable Rewards - RLVR), thường được tối ưu hóa bằng Group Relative Policy Optimization (GRPO), đã trở thành công thức trung tâm để cải thiện khả năng suy luận của các mô hình ngôn ngữ được huấn luyện trước, nhưng các nghiên cứu hiện tại vẫn tập trung quá nhiều vào tiếng Anh. Chúng tôi thực hiện một nghiên cứu thực nghiệm quy mô lớn về GRPO đa ngôn ngữ và phi tiếng Anh trên nhiều loại mô hình cơ sở, ngôn ngữ huấn luyện và các phần thưởng ngôn ngữ suy luận khác nhau. Chúng tôi…

Đọc thêm

Mặc dù sở hữu khả năng đa mục đích tinh vi, các Mô hình ngôn ngữ lớn (LLM) thường không đáp ứng được các sở thích cá nhân đa dạng vì các phương pháp hậu huấn luyện tiêu chuẩn, như Học tăng cường từ phản hồi của con người (RLHF), chỉ tối ưu hóa cho một mục tiêu chung duy nhất. Mặc dù Group Relative Policy Optimization (GRPO) là một khung học tăng cường on-policy được áp dụng rộng rãi, nhưng việc chuẩn hóa dựa trên nhóm của nó ngầm định rằng tất cả…

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.