Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

WideSWE: Đánh giá khả năng phối hợp đa kho lưu trữ của các AI lập trình viên

(giờ Việt Nam)

Tóm tắt AI

WideSWE là bộ tiêu chuẩn mới đánh giá khả năng xử lý các tác vụ phức tạp trên nhiều kho lưu trữ mã nguồn của AI, với kết quả cho thấy GPT-5.6-sol đang dẫn đầu trong việc giải quyết các lỗi và tính năng thực tế.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Việc đánh giá các tác nhân lập trình (coding-agent) đã tiến triển từ giải quyết các vấn đề đơn lẻ sang thực hiện phát triển dài hạn, tuy nhiên việc hoàn thành tác vụ vẫn chủ yếu được đánh giá trong phạm vi một cơ sở mã (codebase) duy nhất. Trong các hệ sinh thái phần mềm, nhiều tính năng và bản sửa lỗi đòi hỏi sự thay đổi phối hợp trên nhiều kho lưu trữ (repository) khác nhau. Chúng tôi giới thiệu WideSWE để đánh giá các tác nhân lập trình trên các tác vụ đa kho lưu trữ như vậy. Thông qua việc khai thác và xem xét các thay đổi trên 103 hệ sinh thái phần mềm, chúng tôi thu được 120 tác vụ thực tế, cân bằng giữa 60 bản sửa lỗi và 60 tính năng. Chúng tôi trích xuất các câu lệnh (prompt) từ các vấn đề và yêu cầu kéo (pull request) liên quan. Chúng tôi xem xét và điều chỉnh một cách hệ thống các bài kiểm thử ẩn để hỗ trợ nhiều cách triển khai đúng đắn khác nhau, đồng thời bảo toàn hành vi bắt buộc và các kiểm tra hồi quy. Qua bảy cấu hình tác nhân, tỷ lệ thành công toàn diện của tác vụ dao động từ 10,83% đến 42,50%, trong đó cấu hình kết hợp Codex CLI với GPT-5.6-sol đạt tỷ lệ cao nhất. Các quỹ đạo cho thấy các tác nhân thất bại trong việc xác định những thay đổi cần thiết, nhận diện được thay đổi nhưng để dở dang, hoặc sửa đổi các kho lưu trữ cần thiết mà không đáp ứng đầy đủ yêu cầu. Để kiểm tra xem việc làm việc trên từng kho lưu trữ một có thể giảm bớt những khó khăn này hay không, chúng tôi so sánh nó với việc thực thi đồng thời dưới cùng một câu lệnh. Việc thực thi độc lập chủ yếu khôi phục các công việc bị bỏ sót và kém hiệu quả hơn trong việc sửa chữa các triển khai đã thử nhưng không thành công trước đó. Việc thực thi đồng thời có thể sử dụng thông tin từ các kho lưu trữ liên quan để hướng dẫn triển khai và xác minh. Mã nguồn có sẵn tại đường dẫn https này.

Chủ đề:Kỹ thuật phần mềm (cs.SE)
Trích dẫn là:arXiv:2609.33382 [cs.SE]
(hoặc arXiv:2609.33382v1 [cs.SE] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.33382 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Baoyi Wang [xem email] [v1] CN, 27 Thg 9, 2026 09:02:49 UTC (1.074 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

WideSWE: Đánh giá khả năng phối hợp đa kho lưu trữ của các AI lập trình viên | AIHOT.vn