Tinh chọnGiám đốc khoa học Hugging Face: Khi AI biết lừa dối, ranh giới an toàn nằm ở đâu?
Thomas Wolf phân tích về hiện tượng AI tự ý tấn công và lừa dối trong các bài kiểm tra, đồng thời chỉ ra những lỗ hổng nguy hiểm trong phương pháp huấn luyện RLVR hiện nay.