# Kho mã nguồn Schrödinger: Liệu LLM thực sự hiểu lập trình hay chỉ đang học vẹt SWE-bench?

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-24 07:00 (giờ Việt Nam)
- Điểm AI: 92/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/ac48ff2f856bb5d9
- Link gốc: https://arxiv.org/abs/2609.27891

## Lý do tinh chọn

Đề tài rất quan trọng trong bối cảnh các benchmark lập trình hiện nay đang bị bão hòa do dữ liệu rò rỉ, ảnh hưởng trực tiếp đến độ tin cậy của các mô hình coding AI.

## Tóm tắt AI

Nghiên cứu giới thiệu SchrodingerRepo, một khung đánh giá mới giúp loại bỏ tình trạng 'học vẹt' bằng cách thay đổi cấu trúc mã nguồn động, buộc các tác nhân AI phải thực sự tư duy thay vì dựa vào dữ liệu đã ghi nhớ từ trước.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.27891) [HTML (thử nghiệm)](https://arxiv.org/html/2609.27891v1)

> Tóm tắt: Các bộ tiêu chuẩn đánh giá lập trình ở cấp độ kho lưu trữ (repository) đã trở thành tiêu chuẩn để đánh giá các tác nhân lập trình (coding agents), tuy nhiên chúng vốn dĩ gặp vấn đề rò rỉ dữ liệu vì được xây dựng dựa trên các kho lưu trữ mã nguồn mở phổ biến vốn được sử dụng lặp đi lặp lại để huấn luyện. Hệ quả là, hiệu suất cao có thể phản ánh việc ghi nhớ các gợi ý đặc trưng của kho lưu trữ thay vì khả năng suy luận mạnh mẽ trên kho lưu trữ đó. Chúng tôi đề xuất SchrodingerRepo (Kho lưu trữ của Schrödinger), một khung đánh giá để kiểm thử các tác nhân lập trình dưới các biểu diễn kho lưu trữ được khởi tạo động. Thay vì sử dụng lặp lại một biểu diễn tĩnh của kho lưu trữ kiểm thử, SchrodingerRepo coi kho lưu trữ kiểm thử là một biến tiềm ẩn tại thời điểm đánh giá, chỉ được khởi tạo động khi tác nhân đi vào môi trường đánh giá. Kho lưu trữ được khởi tạo này bảo toàn hành vi thực thi ban đầu trong khi làm mờ các gợi ý quen thuộc như quy ước đặt tên, bố cục tệp và các mẫu triển khai thông qua bốn cấp độ chuyển đổi: tái cấu trúc tuyên bố vấn đề, ánh xạ lại không gian tên, sắp xếp lại bố cục trong tệp và viết lại mã bảo toàn chức năng. Chúng tôi đánh giá các LLM phổ biến trên SWE-bench Verified và SWE-QA. Kết quả cho thấy việc loại bỏ các gợi ý kho lưu trữ quen thuộc làm giảm hiệu suất của tác nhân một cách nhất quán và làm tăng đáng kể chi phí tương tác trên các mô hình. Phân tích sâu hơn cho thấy chi phí tăng thêm chủ yếu do khó khăn trong việc khám phá và định vị kho lưu trữ. Những phát hiện này cho thấy các tác nhân lập trình hiện tại có thể dựa một phần vào các gợi ý được ghi nhớ từ phía kho lưu trữ, làm nổi bật nhu cầu đánh giá dưới các biểu diễn kho lưu trữ được khởi tạo động.

| Bình luận: | Mã nguồn và dữ liệu của chúng tôi có sẵn tại URL này |
| --- | --- |
| Chủ đề: | Kỹ thuật phần mềm (cs.SE); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.27891 [cs.SE] |
|  | (hoặc arXiv:2609.27891v1 [cs.SE] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.27891 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử nộp bài

Từ: Silin Chen [xem email](https://arxiv.org/show-email/a7d89e4e/2609.27891)] [v1] Thứ Sáu, 21 tháng 8 năm 2026 02:34:34 UTC (2,963 KB)
