‹ Quay lạiTinh chọnĐiểm AI 92/100
Hugging Face Daily Papers
Tinh chọnĐiểm AI 92/100

Nghiên cứu

Kho mã nguồn Schrödinger: Liệu LLM thực sự hiểu lập trình hay chỉ đang học vẹt SWE-bench?

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu giới thiệu SchrodingerRepo, một khung đánh giá mới giúp loại bỏ tình trạng 'học vẹt' bằng cách thay đổi cấu trúc mã nguồn động, buộc các tác nhân AI phải thực sự tư duy thay vì dựa vào dữ liệu đã ghi nhớ từ trước.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các bộ tiêu chuẩn đánh giá lập trình ở cấp độ kho lưu trữ (repository) đã trở thành tiêu chuẩn để đánh giá các tác nhân lập trình (coding agents), tuy nhiên chúng vốn dĩ gặp vấn đề rò rỉ dữ liệu vì được xây dựng dựa trên các kho lưu trữ mã nguồn mở phổ biến vốn được sử dụng lặp đi lặp lại để huấn luyện. Hệ quả là, hiệu suất cao có thể phản ánh việc ghi nhớ các gợi ý đặc trưng của kho lưu trữ thay vì khả năng suy luận mạnh mẽ trên kho lưu trữ đó. Chúng tôi đề xuất SchrodingerRepo (Kho lưu trữ của Schrödinger), một khung đánh giá để kiểm thử các tác nhân lập trình dưới các biểu diễn kho lưu trữ được khởi tạo động. Thay vì sử dụng lặp lại một biểu diễn tĩnh của kho lưu trữ kiểm thử, SchrodingerRepo coi kho lưu trữ kiểm thử là một biến tiềm ẩn tại thời điểm đánh giá, chỉ được khởi tạo động khi tác nhân đi vào môi trường đánh giá. Kho lưu trữ được khởi tạo này bảo toàn hành vi thực thi ban đầu trong khi làm mờ các gợi ý quen thuộc như quy ước đặt tên, bố cục tệp và các mẫu triển khai thông qua bốn cấp độ chuyển đổi: tái cấu trúc tuyên bố vấn đề, ánh xạ lại không gian tên, sắp xếp lại bố cục trong tệp và viết lại mã bảo toàn chức năng. Chúng tôi đánh giá các LLM phổ biến trên SWE-bench Verified và SWE-QA. Kết quả cho thấy việc loại bỏ các gợi ý kho lưu trữ quen thuộc làm giảm hiệu suất của tác nhân một cách nhất quán và làm tăng đáng kể chi phí tương tác trên các mô hình. Phân tích sâu hơn cho thấy chi phí tăng thêm chủ yếu do khó khăn trong việc khám phá và định vị kho lưu trữ. Những phát hiện này cho thấy các tác nhân lập trình hiện tại có thể dựa một phần vào các gợi ý được ghi nhớ từ phía kho lưu trữ, làm nổi bật nhu cầu đánh giá dưới các biểu diễn kho lưu trữ được khởi tạo động.

Bình luận:Mã nguồn và dữ liệu của chúng tôi có sẵn tại URL này
Chủ đề:Kỹ thuật phần mềm (cs.SE); Trí tuệ nhân tạo (cs.AI)
Trích dẫn là:arXiv:2609.27891 [cs.SE]
(hoặc arXiv:2609.27891v1 [cs.SE] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.27891 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử nộp bài

Từ: Silin Chen [xem email] [v1] Thứ Sáu, 21 tháng 8 năm 2026 02:34:34 UTC (2,963 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Kho mã nguồn Schrödinger: Liệu LLM thực sự hiểu lập trình hay chỉ đang học vẹt SWE-bench? | AIHOT.vn