# ExplorationBench: Đánh giá khả năng khám phá của AI trong các 'thế giới lạ' có thể kiểm chứng

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-24 07:00 (giờ Việt Nam)
- Điểm AI: 40/100
- Link AIHOT.vn: https://aihot.vn/items/46b4ff9e1813d6ca
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuge8kyh0panrogv9xdhen8h
- Link gốc: https://arxiv.org/abs/2609.30199

## Tóm tắt AI

ExplorationBench sử dụng các môi trường giả lập với quy tắc logic mới lạ, buộc AI phải tự khám phá thay vì dựa vào dữ liệu huấn luyện sẵn, giúp đánh giá chính xác tư duy khoa học của mô hình.

## Thân bài

Tác giả: [Ming Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+M), [Zhenghao Xiang](https://arxiv.org/search/cs?searchtype=author&query=Xiang,+Z), [Peizhong Gao](https://arxiv.org/search/cs?searchtype=author&query=Gao,+P), [Yujiong Shen](https://arxiv.org/search/cs?searchtype=author&query=Shen,+Y), [Yuhui Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y), [Zhonghan Yue](https://arxiv.org/search/cs?searchtype=author&query=Yue,+Z), [Shihan Dou](https://arxiv.org/search/cs?searchtype=author&query=Dou,+S), [Zhangyue Yin](https://arxiv.org/search/cs?searchtype=author&query=Yin,+Z), [Junjie Ye](https://arxiv.org/search/cs?searchtype=author&query=Ye,+J), [Shichun Liu](https://arxiv.org/search/cs?searchtype=author&query=Liu,+S), [Weihuang Zheng](https://arxiv.org/search/cs?searchtype=author&query=Zheng,+W), [Jiahao Chen](https://arxiv.org/search/cs?searchtype=author&query=Chen,+J), [Jiayi Chen](https://arxiv.org/search/cs?searchtype=author&query=Chen,+J), [Hongzhang Liu](https://arxiv.org/search/cs?searchtype=author&query=Liu,+H), [Jiaqi Shao](https://arxiv.org/search/cs?searchtype=author&query=Shao,+J), [Tao Gui](https://arxiv.org/search/cs?searchtype=author&query=Gui,+T), [Qi Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Q), [Xuanjing Huang](https://arxiv.org/search/cs?searchtype=author&query=Huang,+X), [Suncong Zheng](https://arxiv.org/search/cs?searchtype=author&query=Zheng,+S), [Maxm Pan](https://arxiv.org/search/cs?searchtype=author&query=Pan,+M)

[Xem PDF](https://arxiv.org/pdf/2609.30199) [HTML (thử nghiệm)](https://arxiv.org/html/2609.30199v1)

> Tóm tắt: Khám phá khoa học bắt đầu từ nơi các vấn đề đã biết kết thúc. Tại đó, các hệ thống AI phải tham gia vào quá trình khám phá: đặt giả thuyết, thiết kế thí nghiệm và lặp lại dựa trên kết quả. Tuy nhiên, việc đánh giá khả năng này rất khó khăn: (1) làm thế nào để xác minh liệu một giả thuyết thực sự mới có đúng hay không, và (2) làm thế nào để xác định liệu một hệ thống đã khám phá ra nó thông qua quá trình tìm tòi hay chỉ đơn thuần gợi nhớ lại kiến thức liên quan từ dữ liệu tiền huấn luyện. Để giải quyết vấn đề này, chúng tôi giới thiệu ExplorationBench, biến bài toán hóc búa về đánh giá khám phá khoa học thành một khuôn khổ cụ thể và khả thi được xây dựng trên các Alien Worlds có thể kiểm chứng: các quy tắc của chúng có thể thực thi được, vì vậy mọi câu trả lời đều có thể được kiểm tra chính xác, và chúng xung đột với kiến thức quen thuộc, do đó chỉ riêng việc gợi nhớ kiến thức không thể giải quyết được các tác vụ. Bộ tiêu chuẩn đánh giá này bao gồm hai môi trường sandbox: AlienCode (31 mục tiêu khám phá, 70 tác vụ) và AlienLogic (24 mục tiêu khám phá, 70 tác vụ). Mỗi sandbox cung cấp một tài liệu hướng dẫn còn thiếu sót, phản hồi môi trường đặc thù cho từng tác vụ và một lược đồ gọi công cụ chuyên dụng. Các hệ thống sử dụng những tài nguyên này để khám phá sandbox, sau đó giải quyết các tác vụ ẩn. Chúng tôi đánh giá 10 hệ thống AI và nhận thấy rằng các hệ thống mạnh nhất có thể tiếp thu và áp dụng các quy tắc xa lạ, trong khi hiệu suất thay đổi đáng kể giữa các quỹ đạo và việc tiếp tục khám phá có thể làm đình trệ hoặc đảo ngược những thành quả trước đó. ExplorationBench đại diện cho một bước tiến tới các hệ thống AI có khả năng tiếp thu và áp dụng kiến thức thực sự mới thông qua khám phá trong các môi trường chưa biết.

| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.30199 [cs.AI] |
|  | (hoặc arXiv:2609.30199v1 [cs.AI] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.30199 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Ming Zhang [xem email](https://arxiv.org/show-email/b7c04c8a/2609.30199)] [v1] Thứ Năm, 24 tháng 9 năm 2026 17:37:14 UTC (5,363 KB)
