11/09

Thứ Sáu · 1 tin
Nathan Lambert@natolambert
NgànhĐiểm AI 43/100

Chưng cất mô hình: Không chỉ là sản phẩm phụ của SFT

Big W for people saying that distillation was mostly an SFT artifact, and how its unclear how it wou…

DịchMột góc nhìn mới khẳng định tầm quan trọng của kỹ thuật chưng cất mô hình trong kỷ nguyên học tăng cường (RL), bác bỏ quan điểm cho rằng đây chỉ là sản phẩm phụ của quá trình tinh chỉnh có giám sát (SFT).

10/09

Thứ Năm · 1 tin

04/09

Thứ Sáu · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Microsoft và UCSD giới thiệu TailSFT: Loại bỏ dữ liệu quá khớp để tối ưu hóa học tăng cường (RL)

New Microsoft plus Univ of San Diego paper shows a model can look better after SFT but actually be a…

DịchNghiên cứu chỉ ra rằng việc tinh chỉnh (SFT) quá mức có thể xóa bỏ các hành vi hiếm gặp nhưng quan trọng, khiến mô hình trở thành điểm khởi đầu kém hiệu quả cho quá trình học tăng cường (RL).

31/08

Thứ Hai · 1 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 44/100

TailSFT: Phương pháp mới từ Microsoft giúp tối ưu hóa SFT để tăng cường hiệu suất RL

Interesting technical work from Microsoft. Provides a better understanding on SFT and how to levera…

DịchMicrosoft giới thiệu TailSFT, kỹ thuật lọc dữ liệu giúp mô hình tập trung vào các phần chưa tối ưu thay vì lãng phí tài nguyên vào những gì đã học tốt, từ đó cải thiện đáng kể khả năng lập trình và toán học sau khi huấn luyện tăng cường (RL).

27/08

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

RL suy luận theo đoạn tiếp theo có thực sự vượt trội hơn SFT? Đánh giá lại chiến lược huấn luyện với dữ liệu không có CoT

Nghiên cứu này so sánh phương pháp RL suy luận theo đoạn với kỹ thuật Mixed SFT đơn giản. Kết quả cho thấy Mixed SFT đạt hiệu suất cao hơn đáng kể trong các bài kiểm tra suy luận, đặt ra dấu hỏi về tính ưu việt thực sự của các phương pháp RL phức tạp hiện nay.

21/08

Thứ Sáu · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnTư duy bằng ngôn ngữ ít tài nguyên: SFT xây dựng gì, RL sửa lỗi gì và những hạn chế của điểm số chính xác

Nghiên cứu chỉ ra rằng điểm số benchmark thường gây nhiễu, trong khi SFT thực sự giúp mô hình tư duy bằng ngôn ngữ mục tiêu thay vì chỉ dịch thuật ngầm, giúp việc kiểm chứng và sửa lỗi trở nên khả thi hơn.


Vì sao đáng đọc: Nghiên cứu thực nghiệm sâu sắc, thách thức cách đánh giá mô hình AI hiện nay và đưa ra góc nhìn quan trọng về khả năng tư duy ngôn ngữ của LLM.
Tổng 6 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (17 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “SFT” | AIHOT.vn