DAIR.AI@dair_ai
Điểm AI 51/100

Nghiên cứu

Google DeepMind ra mắt XYEval: Kiểm tra khả năng 'tỉnh táo' của AI trước những lời khuyên sai lệch

(giờ Việt Nam)

Nguyên văn trên X

Interesting new paper from Google DeepMind. Studies agents that follow bad advice from users. User…

Dịch · tóm tắt AI

Google DeepMind giới thiệu XYEval, một khung đánh giá mới nhằm kiểm tra xem các tác nhân AI có bị đánh lừa bởi những gợi ý sai lệch nhưng đầy tự tin từ người dùng hay không thông qua các bộ benchmark như SWE-bench và HLE.

Bài viết được AI dịch và tổng hợp tự động từ X: DAIR.AI (@dair_ai). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Google DeepMind ra mắt XYEval: Kiểm tra khả năng 'tỉnh táo' của AI trước những lời khuyên sai lệch | AIHOT.vn