Ethan Mollick@emollickKhi các bài kiểm tra AI đạt ngưỡng bão hòa: Chúng ta nên đo lường tiến bộ bằng gì?
Now that METR long horizons is effectively saturated (Epoch found pre-Fable agents could do 18 weeks…
DịchKhi các chuẩn đo lường như METR, Frontier Math và ARC-AGI dần trở nên quá dễ dàng với AI, giới chuyên gia đang đặt câu hỏi về các chỉ số mới để đánh giá tốc độ phát triển thực sự của trí tuệ nhân tạo.





























