Apple Machine Learning Research
85

Nghiên cứu

GRPO vượt xa tiếng Anh: Nghiên cứu quy mô lớn về khả năng suy luận đa ngôn ngữ

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu từ Apple cho thấy phương pháp GRPO duy trì hiệu suất ổn định trong các tác vụ suy luận đa ngôn ngữ, chứng minh RLVR vẫn cực kỳ hiệu quả ngay cả khi không sử dụng tiếng Anh làm ngôn ngữ huấn luyện chính.

Bản dịch AI

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

Tác giả: Konstantin Dobler†**, Federico Scozzafava, Jonathan Janke, Mohamed Ali, Simon Lehnerer

Reinforcement Learning with Verifiable Rewards (RLVR), thường được tối ưu hóa bằng Group Relative Policy Optimization (GRPO), đã trở thành công thức cốt lõi để cải thiện khả năng suy luận của các mô hình ngôn ngữ tiền huấn luyện, nhưng các nghiên cứu hiện tại vẫn tập trung quá nhiều vào tiếng Anh. Chúng tôi thực hiện một nghiên cứu thực nghiệm quy mô lớn về GRPO đa ngôn ngữ và phi tiếng Anh trên nhiều loại mô hình cơ sở, ngôn ngữ huấn luyện và các phần thưởng ngôn ngữ suy luận khác nhau. Chúng tôi nhận thấy rằng việc huấn luyện để suy luận bằng ngôn ngữ bản địa thường chỉ tạo ra khoảng cách nhỏ so với việc huấn luyện suy luận bằng tiếng Anh. Chúng tôi cũng quan sát thấy khả năng chuyển đổi đa ngôn ngữ mạnh mẽ: huấn luyện bằng một ngôn ngữ thường cải thiện hiệu suất ở nhiều ngôn ngữ khác. Tuy nhiên, các xu hướng cụ thể phụ thuộc rất nhiều vào mô hình và ngôn ngữ. Trong một số trường hợp, việc huấn luyện bằng một ngôn ngữ cụ thể gây ra sự suy giảm nghiêm trọng đối với các khả năng ngoài phạm vi (out-of-domain) ở các ngôn ngữ khác. Phân tích của chúng tôi cho thấy RLVR ngoài tiếng Anh có thể mang lại những lợi ích đa ngôn ngữ rộng rãi, nhưng cũng đòi hỏi sự đánh giá toàn diện để phát hiện các sự suy giảm đặc thù theo ngôn ngữ.

Các bài đọc và cập nhật liên quan.

Mặc dù sở hữu các khả năng đa năng tinh vi, các Large Language Models (LLMs) thường không đáp ứng được các sở thích cá nhân đa dạng vì các phương pháp hậu huấn luyện tiêu chuẩn, như Reinforcement Learning with Human Feedback (RLHF), tối ưu hóa cho một mục tiêu duy nhất và mang tính toàn cầu. Mặc dù Group Relative Policy Optimization (GRPO) là một khung học tăng cường on-policy được áp dụng rộng rãi, việc chuẩn hóa dựa trên nhóm của nó ngầm định rằng tất cả…

Đọc thêm

Các Large Language Models (LLMs) hiện nay chủ yếu được thiết kế với tiếng Anh là ngôn ngữ chính, và ngay cả những mô hình đa ngôn ngữ hiếm hoi cũng có xu hướng bộc lộ những thiên kiến mạnh mẽ hướng về tiếng Anh. Giống như những người nói có thể tạo ra các cách diễn đạt gượng gạo khi học ngôn ngữ thứ hai, các LLM thường tạo ra kết quả đầu ra không tự nhiên ở các ngôn ngữ không phải tiếng Anh, phản ánh các khuôn mẫu tập trung vào tiếng Anh trong cả từ vựng lẫn ngữ pháp. Bất chấp tầm quan trọng của vấn đề này,…

Đọc thêm

GRPORLVRAI đa ngôn ngữNghiên cứu AIApple Research
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.