Nghiên cứu
Apple nghiên cứu quy luật mở rộng cho mô hình ngôn ngữ với dữ liệu hỗn hợp
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu của Apple đã thực hiện hơn 2.000 thí nghiệm để tìm ra tỷ lệ tối ưu giữa dữ liệu chuyên biệt và dữ liệu phổ quát, giúp tránh tình trạng quá tải hoặc thiếu hụt dữ liệu khi huấn luyện mô hình.
Bản dịch AI

Tác giả: Anastasiia Sedova, Skyler Seto, Natalie Schluter, Pierre Ablin
Khi các mô hình ngôn ngữ (language models) ngày càng mở rộng, lượng dữ liệu chúng yêu cầu cũng tăng lên – tuy nhiên, nhiều nguồn dữ liệu mục tiêu, chẳng hạn như các ngôn ngữ ít tài nguyên hoặc các lĩnh vực chuyên biệt, vốn dĩ có quy mô hạn chế. Một chiến lược phổ biến là trộn lẫn dữ liệu mục tiêu khan hiếm nhưng có giá trị này với dữ liệu chung phong phú, điều này tạo ra một sự đánh đổi cơ bản: quá ít dữ liệu mục tiêu trong hỗn hợp sẽ khiến mô hình không tiếp cận đủ với lĩnh vực mục tiêu, trong khi quá nhiều dữ liệu mục tiêu sẽ lặp lại các ví dụ giống nhau một cách thái quá, dẫn đến hiệu quả giảm dần và cuối cùng là quá khớp (overfitting). Chúng tôi nghiên cứu sự đánh đổi này thông qua hơn 2.000 lần huấn luyện mô hình ngôn ngữ trên nhiều quy mô mô hình và tập dữ liệu mục tiêu khác nhau, cũng như một số loại dữ liệu bao gồm các hỗn hợp đa ngôn ngữ, chuyên biệt theo lĩnh vực và được lọc theo chất lượng. Trong tất cả các thiết lập, chúng tôi nhận thấy rằng sự lặp lại là yếu tố chính thúc đẩy hiệu suất trong lĩnh vực mục tiêu, và việc huấn luyện hỗn hợp có thể chịu đựng mức độ lặp lại cao hơn nhiều so với huấn luyện từ một nguồn duy nhất: các tập dữ liệu mục tiêu khan hiếm có thể được tái sử dụng từ 15–20 lần, với số lần lặp lại tối ưu phụ thuộc vào quy mô dữ liệu mục tiêu, ngân sách tính toán và quy mô mô hình. Tiếp theo, chúng tôi giới thiệu một định luật mở rộng hỗn hợp có tính đến sự lặp lại (repetition-aware mixture scaling law), giải quyết giá trị giảm dần của các token mục tiêu bị lặp lại và vai trò điều tiết của dữ liệu chung. Việc tối ưu hóa định luật mở rộng này cung cấp một phương pháp có nguyên tắc để tính toán các cấu hình hỗn hợp hiệu quả, đưa ra các khuyến nghị hỗn hợp thực tế cho quá trình tiền huấn luyện (pretraining) trong điều kiện hạn chế về dữ liệu.
Các bài đọc liên quan và cập nhật.
Các mô hình nền tảng (foundation models) lớn thường được huấn luyện trên dữ liệu từ nhiều lĩnh vực, với hỗn hợp dữ liệu—tỷ lệ của từng lĩnh vực được sử dụng—đóng vai trò quan trọng đối với hiệu suất của mô hình. Cách tiếp cận tiêu chuẩn để chọn hỗn hợp này dựa trên phương pháp thử và sai, vốn trở nên không khả thi đối với quá trình tiền huấn luyện quy mô lớn. Chúng tôi đề xuất một phương pháp có hệ thống để xác định hỗn hợp dữ liệu tối ưu cho bất kỳ lĩnh vực mục tiêu nào bằng cách sử dụng các định luật mở rộng (scaling laws). Cách tiếp cận của chúng tôi…
Đọc thêm
Một chiến lược phổ biến để có được một mô hình ngôn ngữ hoạt động tốt trong một lĩnh vực mục tiêu là tinh chỉnh (fine-tune) nó bằng cách huấn luyện mô hình thực hiện dự đoán token tiếp theo (next-token prediction) không giám sát trên dữ liệu từ lĩnh vực đó. Việc tinh chỉnh đặt ra hai thách thức: i) nếu lượng dữ liệu mục tiêu bị hạn chế, như trường hợp trong hầu hết các ứng dụng thực tế, mô hình sẽ nhanh chóng bị quá khớp, và ii) mô hình sẽ bị lệch khỏi mô hình gốc và quên đi quá trình tiền huấn luyện…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.