DAIR.AI@dair_aiNghiên cứuĐiểm AI 51/100
Google DeepMind ra mắt XYEval: Kiểm tra khả năng 'tỉnh táo' của AI trước những lời khuyên sai lệch
Interesting new paper from Google DeepMind. Studies agents that follow bad advice from users. User…
DịchGoogle DeepMind giới thiệu XYEval, một khung đánh giá mới nhằm kiểm tra xem các tác nhân AI có bị đánh lừa bởi những gợi ý sai lệch nhưng đầy tự tin từ người dùng hay không thông qua các bộ benchmark như SWE-bench và HLE.
