HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 54/100

Nghiên cứu

Nghiên cứu: Đánh giá khả năng của Coding Agent trong giải quyết các bài toán lập kế hoạch hành động và nhiệm vụ tổng quát

(giờ Việt Nam)

Tóm tắt AI

Bài báo trên arXiv nghiên cứu khả năng của các Coding Agent trong việc tự động tạo ra mã nguồn có khả năng khái quát hóa qua nhiều tình huống, nhằm giải quyết các bài toán lập kế hoạch nhiệm vụ và chuyển động (TAMP) phức tạp.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các bài toán lập kế hoạch nhiệm vụ và chuyển động (TAMP) vẫn còn nhiều khó khăn ngay cả khi có khả năng quan sát toàn diện và các trạng thái tập trung vào đối tượng, vì các quyết định rời rạc gắn kết chặt chẽ với các ràng buộc về hình học, động học và động lực học. TAMP tổng quát giải quyết khó khăn này bằng cách khai thác các quy luật trên các trường hợp bài toán để giảm bớt nỗ lực lập kế hoạch cho các trường hợp mới. Tuy nhiên, các phương pháp hiện có đòi hỏi kỹ thuật chuyên biệt cho TAMP rất đáng kể. Chúng tôi nghiên cứu liệu các tác nhân lập trình (coding agents) có thể tự động hóa quy trình này bằng cách tổng hợp các chương trình có khả năng tổng quát hóa trên nhiều trường hợp hay không. Với mô tả nhiệm vụ và quyền truy cập trình mô phỏng, mỗi tác nhân chọn cách tương tác với môi trường trong khi phát triển một chương trình trong ngân sách tổng hợp cố định. Chương trình sau đó được đóng băng và đánh giá trên các trường hợp chưa từng thấy. Chúng tôi đánh giá Claude Code (Opus 5) và Codex (GPT-5.6 Sol và GPT-6 Astra) trên 28 môi trường mô phỏng từ KinDER và PDDLStream, với số lượng đối tượng vượt xa các đánh giá trong tiêu chuẩn gốc. Trên tất cả các phương pháp tổng hợp chương trình, chúng tôi đánh giá 980 chương trình được tạo ra trên 100 trường hợp kiểm chứng cho mỗi chương trình, tổng cộng 98.000 tập đánh giá. Nhìn chung, chúng tôi nhận thấy các tác nhân lập trình đạt hiệu quả đáng kinh ngạc trong TAMP tổng quát: cả ba cấu hình tác nhân đều vượt trội hơn các bộ lập kế hoạch thủ công, tạo một lần (one-shot) và phương pháp lập kế hoạch tổng quát dựa trên LLM về tỷ lệ thành công trung bình (56% đến 95% so với 47% của các bộ lập kế hoạch, trên 16 môi trường có sẵn bộ lập kế hoạch). Khi số lượng đối tượng tăng lên, các chương trình của tác nhân duy trì tỷ lệ thành công cao hơn so với bộ lập kế hoạch, sử dụng ít tài nguyên tính toán hơn một bậc độ lớn trên mỗi trường hợp. Nhật ký cho thấy các tác nhân sử dụng tương tác để hiệu chỉnh các mô hình vật lý, kiểm tra các trường hợp biên và tinh chỉnh chiến lược. Chúng tôi công khai toàn bộ mã nguồn, bao gồm các câu lệnh (prompts) đầy đủ đã cung cấp cho các tác nhân. Những phát hiện này cho thấy các tác nhân lập trình là một cơ sở mạnh mẽ cho TAMP tổng quát.

Bình luận:9 trang, 4 hình, 3 bảng
Chủ đề:Robotics (cs.RO); Trí tuệ nhân tạo (cs.AI)
Trích dẫn là:arXiv:2609.30233 [cs.RO]
(hoặc arXiv:2609.30233v1 [cs.RO] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.30233 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Matteo Merler [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 17:53:35 UTC (7.521 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Nghiên cứu: Đánh giá khả năng của Coding Agent trong giải quyết các bài toán lập kế hoạch hành động và nhiệm vụ tổng quát | AIHOT.vn