Rohan Paul@rohanpaul_aiNghiên cứuĐiểm AI 47/100
Khung BenchDrift của IBM: Cách diễn đạt khiến điểm số LLM biến động tới 74,7%
A model can know the answer and still fail because you asked the same question differently. New IBM…
DịchIBM giới thiệu BenchDrift, khung đánh giá cho thấy việc thay đổi cách đặt câu hỏi có thể làm điểm số LLM chênh lệch tới 74,7%. Ngay cả với các mô hình mạnh, 18,5% câu trả lời đúng vẫn bị mất đi khi diễn đạt lại dù ý nghĩa không đổi.
