Tinh chọnRealSWE: Đánh giá thực tế khả năng lập trình của các AI Agent
Nghiên cứu chỉ ra sự khác biệt lớn giữa các bài kiểm tra lập trình hiện nay và yêu cầu thực tế của người dùng. RealSWE được giới thiệu để đánh giá AI Agent dựa trên các tình huống lập trình tự nhiên, ít cấu trúc và mang tính đời thường hơn.