Nghiên cứu
CodeGraph: Xây dựng đồ thị tri thức mã nguồn với phân loại mở và liên kết Wikidata
(giờ Việt Nam)
Tóm tắt AI
CodeGraph giới thiệu quy trình sử dụng LLM chuyên dụng để chú giải ngữ nghĩa mã nguồn, kết hợp với hệ thống liên kết Wikidata ba giai đoạn nhằm chuyển đổi mã nguồn thành đồ thị tri thức có cấu trúc, vượt xa các phân tích cú pháp truyền thống.
Chính văn · Bản dịch AI
Tóm tắt: Các kho lưu trữ phần mềm công cộng, như GitHub và Software Heritage Archive, lưu trữ hàng tỷ tệp tin, tuy nhiên việc trích xuất kiến thức kỹ thuật ẩn chứa trong đó ---ví dụ như các thuật toán được triển khai, các mô hình được tuân theo, các mẫu được khởi tạo và các lĩnh vực ứng dụng mà chúng phục vụ--- vẫn là một thách thức, vì các công cụ hiện tại bị hạn chế ở mức phân tích cú pháp và mã thông báo (token). Chúng tôi giới thiệu một quy trình xây dựng chú giải ngữ nghĩa theo phân loại mở (open-taxonomy) cho mã nguồn bằng cách sử dụng Mô hình Ngôn ngữ Lớn (LLM) chuyên biệt về mã nguồn. Các thực thể được trích xuất được liên kết với Wikidata thông qua quy trình ba giai đoạn: giai đoạn SPARQL tất định xử lý các thực thể không mơ hồ, một Deep Research Agent giải quyết phần đuôi dài còn lại, và giai đoạn tổng hợp phân cấp (hierarchy-rollup) nhập vào bao đóng "cha của" (parent-of closure) cho mỗi định danh Wikidata đã được giải quyết. Các chú giải thu được được cụ thể hóa thành một đồ thị tri thức phân loại mở dành riêng cho mã nguồn. Chúng tôi cũng giới thiệu một giao thức đảm bảo chất lượng đã được hiệu chuẩn nhằm định lượng độ chính xác của chú giải bằng cách kết hợp một tập dữ liệu chuẩn (gold set) nhỏ do con người thực hiện với bộ lọc LLM-as-a-judge. Chúng tôi đã áp dụng quy trình này vào 167 triệu tệp tin của tập dữ liệu Stack-Edu, tạo ra đồ thị tri thức phân loại mở quy mô lớn đầu tiên được biết đến cho mã nguồn. Đồ thị của chúng tôi, có tên là CodeGraph, chứa khoảng 158 triệu nút, bao gồm khoảng 145 triệu tệp tin, khoảng 63.000 thực thể khái niệm được trích xuất (như thuật toán, mô hình, mẫu thiết kế và lĩnh vực ứng dụng), và khoảng 19.800 thực thể Wikidata đã được liên kết. Hơn nữa, CodeGraph có khoảng 1 tỷ cạnh có kiểu (typed edges) kết nối các tệp tin với các khái niệm tương ứng, liên kết các khái niệm này với các định danh Wikidata của chúng, và liên hệ chúng với các danh mục cha, bao phủ 14 ngôn ngữ lập trình.
| Bình luận: | Được chấp nhận tại CIKM 2026 |
| Chủ đề: | Kỹ thuật phần mềm (cs.SE); Tính toán và Ngôn ngữ (cs.CL); Truy xuất thông tin (cs.IR) |
| Trích dẫn là: | arXiv:2609.29474 [cs.SE] |
| (hoặc arXiv:2609.29474v1 [cs.SE] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.29474 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) | |
| DOI liên quan: | https://doi.org/10.1145/3799682.3840769 (Các) DOI liên kết đến các tài nguyên liên quan |
Lịch sử gửi bài
Từ: Federico Pennino [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 12:31:05 UTC (983 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.