Big W for people saying that distillation was mostly an SFT artifact, and how its unclear how it wou…
DịchMột góc nhìn mới khẳng định tầm quan trọng của kỹ thuật chưng cất mô hình trong kỷ nguyên học tăng cường (RL), bác bỏ quan điểm cho rằng đây chỉ là sản phẩm phụ của quá trình tinh chỉnh có giám sát (SFT).
Nghiên cứu chỉ ra rằng việc huấn luyện LLM trên toàn bộ chuỗi suy luận dài không mang lại nhiều lợi ích. Thay vào đó, các chuỗi rút gọn vẫn đảm bảo hiệu quả, giúp mô hình tránh được các thông tin dư thừa không cần thiết.
New Microsoft plus Univ of San Diego paper shows a model can look better after SFT but actually be a…
DịchNghiên cứu chỉ ra rằng việc tinh chỉnh (SFT) quá mức có thể xóa bỏ các hành vi hiếm gặp nhưng quan trọng, khiến mô hình trở thành điểm khởi đầu kém hiệu quả cho quá trình học tăng cường (RL).
Interesting technical work from Microsoft. Provides a better understanding on SFT and how to levera…
DịchMicrosoft giới thiệu TailSFT, kỹ thuật lọc dữ liệu giúp mô hình tập trung vào các phần chưa tối ưu thay vì lãng phí tài nguyên vào những gì đã học tốt, từ đó cải thiện đáng kể khả năng lập trình và toán học sau khi huấn luyện tăng cường (RL).
Nghiên cứu này so sánh phương pháp RL suy luận theo đoạn với kỹ thuật Mixed SFT đơn giản. Kết quả cho thấy Mixed SFT đạt hiệu suất cao hơn đáng kể trong các bài kiểm tra suy luận, đặt ra dấu hỏi về tính ưu việt thực sự của các phương pháp RL phức tạp hiện nay.
Nghiên cứu chỉ ra rằng điểm số benchmark thường gây nhiễu, trong khi SFT thực sự giúp mô hình tư duy bằng ngôn ngữ mục tiêu thay vì chỉ dịch thuật ngầm, giúp việc kiểm chứng và sửa lỗi trở nên khả thi hơn.
Vì sao đáng đọc: Nghiên cứu thực nghiệm sâu sắc, thách thức cách đánh giá mô hình AI hiện nay và đưa ra góc nhìn quan trọng về khả năng tư duy ngôn ngữ của LLM.
Tổng 6 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (17 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả