Nghiên cứuĐiểm AI 85/100
LoopsBench: Đánh giá thế hệ Coding Agent mới trong các tác vụ lập trình dài hạn
LoopsBench là bộ tiêu chuẩn mới từ Microsoft và ĐH Nam Kinh, tập trung đánh giá khả năng duy trì kế hoạch và quản lý quy trình làm việc phức tạp của các Coding Agent trong các dự án phần mềm dài hạn thay vì chỉ giải quyết các tác vụ đơn lẻ.