Nghiên cứuĐiểm AI 88/100
Tinh chọnTư duy bằng ngôn ngữ ít tài nguyên: SFT xây dựng gì, RL sửa lỗi gì và những hạn chế của điểm số chính xác
Nghiên cứu chỉ ra rằng điểm số benchmark thường gây nhiễu, trong khi SFT thực sự giúp mô hình tư duy bằng ngôn ngữ mục tiêu thay vì chỉ dịch thuật ngầm, giúp việc kiểm chứng và sửa lỗi trở nên khả thi hơn.
Vì sao đáng đọc: Nghiên cứu thực nghiệm sâu sắc, thách thức cách đánh giá mô hình AI hiện nay và đưa ra góc nhìn quan trọng về khả năng tư duy ngôn ngữ của LLM.