Tinh chọnThử thách 'địa ngục' cho AI: Chuyển đổi 200.000 dòng code mà không được sai sót
SWE Refactor Bench ra đời để kiểm tra khả năng tái cấu trúc toàn bộ hệ thống quy mô lớn của AI. Đây là bài kiểm tra khắc nghiệt hơn nhiều so với việc sửa lỗi thông thường, nơi các mô hình hàng đầu như GPT hay Claude hiện vẫn đang gặp khó khăn.