Nghiên cứu
Nghiên cứu mới: Quá trình hậu huấn luyện để lại 'dấu vết hành vi' trong các quyết định không liên quan
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu phương pháp Active Taskless Distillation (ATD), cho thấy các mô hình ngôn ngữ có thể học hỏi khả năng mới thông qua những từ ngữ không liên quan, ngay cả khi không có dữ liệu mục tiêu cụ thể.
Chính văn · Bản dịch AI
Tóm tắt: Chúng tôi phát hiện ra rằng các mô hình ngôn ngữ có thể chuyển giao năng lực thông qua văn bản không liên quan đến tác vụ. Quá trình hậu huấn luyện (post-training) thường cải thiện các mô hình ngôn ngữ bằng cách sử dụng dữ liệu đặc thù cho tác vụ. Các nghiên cứu trước đây về học tập tiềm thức (subliminal learning) cho thấy thông tin về các bản cập nhật này có thể truyền qua các thế hệ không liên quan, nhưng phần lớn tập trung vào các đặc điểm hoặc sở thích thông qua việc sử dụng đầu ra mở rộng từ giáo viên (teacher). Chúng tôi giới thiệu Active Taskless Distillation (ATD), đạt được khả năng chuyển giao năng lực chỉ bằng cách sử dụng một từ duy nhất từ giáo viên cho mỗi prompt. ATD thăm dò "bóng hành vi" (behavioral shadow) của quá trình hậu huấn luyện bằng cách chọn các prompt mà tại đó tổ tiên chung công khai của giáo viên và học viên (student) gần như không phân biệt được giữa hai từ thông thường. Một học viên được khởi tạo từ tổ tiên này học hoàn toàn từ các cặp prompt-từ kết quả, mà không cần các ví dụ về tác vụ mục tiêu, logit của giáo viên hay tham số của giáo viên. Trong thí nghiệm lập trình chính với Qwen2.5-1.5B, 5.664 phản hồi mang lại mức tăng 5,34 điểm phần trăm trên HumanEval+ so với nhóm đối chứng khớp nhiễu chính xác. Các thí nghiệm bổ sung cho thấy khả năng chuyển giao trong kiến thức khoa học, suy luận thông thường và đọc hiểu trên các thế hệ, kích thước và dòng mô hình khác nhau. Các phân tích chức năng cho thấy phần kiến thức đã học có thể kết hợp được và cường độ của nó theo sát cường độ cập nhật của giáo viên.
| Bình luận: | 17 trang, 6 hình, 13 bảng. Mã nguồn: URL này |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL); Trí tuệ nhân tạo (cs.AI); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.29233 [cs.CL] |
| (hoặc arXiv:2609.29233v1 [cs.CL] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.29233 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử nộp bài
Từ: Yichen Gong [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 08:39:27 UTC (2.318 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.