Nghiên cứu
LittleLearner: Thử nghiệm huấn luyện LLM chỉ với giáo trình tiểu học Mỹ để tìm giới hạn năng lực
(giờ Việt Nam)
Tóm tắt AI
LittleLearner là dự án nghiên cứu huấn luyện các mô hình từ 0.6B đến 5B tham số bằng giáo trình tiểu học (K-5). Kết quả cho thấy việc mở rộng quy mô hay tinh chỉnh không thể giúp mô hình vượt qua giới hạn kiến thức đã được thiết lập từ giai đoạn tiền huấn luyện.
Bản dịch AI
Trò chuyện với LittleLearner
Mô hình 5B được lưu trữ, chạy trực tiếp trên trình duyệt của bạn. Mở trong tab mới ↗ nếu khung chat bên dưới không tải.
Một môi trường thử nghiệm (sandbox) có kiểm soát để nghiên cứu cách các mô hình tiếp thu kiến thức.
Các mô hình ngôn ngữ (LM) hiện đại được huấn luyện trên mọi thứ cùng một lúc, vì vậy rất khó để phân biệt liệu một kỹ năng mới đã thực sự được học hay chỉ đơn thuần là được khơi gợi. Chúng tôi giới hạn chính phân phối huấn luyện: một tập dữ liệu 88 tỷ token được lọc theo chương trình giảng dạy tiểu học tại Hoa Kỳ, với các mô hình được huấn luyện từ đầu trên tập dữ liệu này cùng các mô hình đối chứng không lọc tương ứng.
Tập dữ liệu
LittleCurriculum
Một tập dữ liệu 88 tỷ token được chắt lọc từ FineWeb-Edu thông qua quy trình lọc năm giai đoạn, bám sát các tiêu chuẩn Common Core (từ mẫu giáo đến lớp 5). Các khái niệm, sự kiện và từ vựng được giảng dạy trên lớp 5 đều bị loại bỏ một cách rõ ràng.
Các mô hình
LittleLearner
Ba quy mô (0.6B / 1.3B / 5B) được huấn luyện từ đầu trên LittleCurriculum: các mô hình có khả năng trò chuyện với ranh giới kiến thức có thể diễn giải được. Mỗi mô hình đều đi kèm với một phiên bản đối chứng Unfiltered (không lọc) tương ứng để so sánh một cách minh bạch.
Các phát hiện
Khơi gợi, không phải tiếp thu
Trong các thí nghiệm của chúng tôi, việc mở rộng quy mô, hậu huấn luyện SFT+GRPO và học trong ngữ cảnh (in-context learning) giúp khuếch đại những gì chương trình giảng dạy đã cung cấp, nhưng không cải thiện đáng kể hiệu suất ngoài phạm vi, cho thấy bộ lọc tiền huấn luyện đã thiết lập mức trần năng lực thực tế.
Các điểm kiểm tra (checkpoint) mô hình
LittleLearner ở ba quy mô (0.6B / 1.3B / 5B), mỗi mô hình đều có phiên bản đối chứng Unfiltered tương ứng, chia sẻ cùng kiến trúc, token và công thức huấn luyện.
Base: mô hình đã được tiền huấn luyện. GRPO: các chuyên gia toán học được hậu huấn luyện trên MathCAMPS; phản hồi có thể có xu hướng thiên về toán học. Chatty: các biến thể được tinh chỉnh cho hành vi trò chuyện thông thường.
Năng lực nằm trong phạm vi chương trình giảng dạy
Liệu các can thiệp tiêu chuẩn có thể thúc đẩy mô hình vượt qua những gì dữ liệu tiền huấn luyện đã dạy nó không? Với ranh giới được kiểm soát trong thí nghiệm, chúng tôi có thể đặt câu hỏi này một cách rõ ràng. Trong các thí nghiệm của chúng tôi, mỗi can thiệp đều khuếch đại khả năng trong phạm vi; không có can thiệp nào cải thiện đáng kể hiệu suất ngoài phạm vi.
Mở rộng quy mô (Scaling)
Việc mở rộng quy mô mô hình giúp cải thiện hiệu suất trong phạm vi kiến thức được kiểm soát và mở rộng khiêm tốn sang các bài toán cùng quỹ đạo học tập, nhưng mang lại rất ít cải thiện đối với các bài toán đòi hỏi năng lực nâng cao nằm ngoài phạm vi tiếp xúc.
Độ chính xác của MathCAMPS theo cấp lớp, trên các quy mô mô hình
Hậu huấn luyện (Post-training)
Hậu huấn luyện thông qua GRPO giúp tăng đáng kể năng lực trong phạm vi K–5, nhưng không thể khôi phục các năng lực ngoài phạm vi K–5, ngay cả khi huấn luyện với dữ liệu nằm ngoài phạm vi đó.
Hậu huấn luyện khuếch đại phạm vi K–5, không phải khoảng cách ngoài K–5
Học trong ngữ cảnh (In-context learning)
Học trong ngữ cảnh với các câu lệnh (prompt) mà chúng tôi thử nghiệm không mở khóa được các năng lực suy luận mới ngoài phạm vi K–5 cho mô hình LittleLearner 5B đã được huấn luyện.
Độ chính xác theo điều kiện câu lệnh
Bạn sẽ dạy nó điều gì?
Vì phạm vi tiếp xúc huấn luyện của LittleLearner được xác định rõ ràng, các thay đổi về hành vi và biểu diễn có thể được liên kết trực tiếp với các khái niệm mà bạn đưa vào. Ba hướng mà chúng tôi rất hào hứng:
01
RL & khám phá
Liệu RL (Học tăng cường) có thể tạo ra năng lực?
Dữ liệu tiên nghiệm (prior) bị giới hạn ở mức K–5, vì vậy các năng lực xuất hiện dưới tác động của RL có thể được quy cho chính quá trình RL. Một đại diện dễ xử lý cho việc khám phá dựa trên phần thưởng.
02
Học liên tục (Continual learning)
Quan sát một khái niệm đang được học
Giới thiệu số âm và đo lường hiệu quả mẫu, khả năng ghi nhớ và sự can thiệp. Hoặc thăm dò hành vi gần ranh giới: mô hình sẽ trả lời, từ chối hay ảo tưởng (hallucinate)?
03
Khoa học giáo dục
Máy học so với người học là trẻ em
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.