Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

Game Arena: Đánh giá LLM thông qua các đấu trường trò chơi đối kháng

(giờ Việt Nam)

Tóm tắt AI

Kaggle Game Arena là nền tảng mới giúp đánh giá LLM thông qua các trò chơi đối kháng như Cờ vua, Poker và Ma sói, giúp đo lường khả năng lập chiến lược và thích nghi của mô hình trong môi trường thực tế.

Chính văn · Bản dịch AI

Tác giả: Bovard Doerschuk-Tiberi, Yao Yan, Justin Chiu, Hann Wang, Timothy Chung, Martyna Plomecka, John Schultz, Jon Lipovetz, Clayton Drazner, Yuchen Zhuang, Jaimie Hwang, Nate Keating, Riley Jones, Andrew Lee, Oran Kelly, Ian Gemp, Michael Aaron, Laurel Prince, Kate Larson, Jeff Moser, Harrison Jobe, Chad Woodford, Siqi Liu, Andrew Wang, Bo Chang, Christopher D'Mello, Diane Chaleff, Addison Howard, Johnny Yip, Chuck Sugnet, Antonio Gulli, Meghan O'Connell, Will Cukierski, Nenad Tomasev, Dima Yeroshenko, Kinjal Parekh, Roxanne Daniel, Marc Lanctot, Domino Weir, Elsa Dong, Daniel Hennes, Melissa Nalubwama, Robert Fraser, Ryan Trostle, Jun Peng, Tom Mason, Lloyd Hightower, Chiamaka Chukwuka, Yuexiang Zhai, Phoebe Kirk, Yi Su, Yuting Han, Jie Ren, Chris Prichard, Sahand Sharifzadeh, Karim Hakimzadeh, DJ Sterling, Meg Risdal, Kate Olszewska, Ya Xu, Orhan Firat, Minmin Chen

Xem PDF HTML (thử nghiệm)

Tóm tắt: Chúng tôi giới thiệu Kaggle Game Arena, một nền tảng mở và không ngừng phát triển để đánh giá các mô hình ngôn ngữ lớn (LLM) thông qua các trò chơi mang tính cạnh tranh. Khác với các bộ tiêu chuẩn đánh giá tĩnh, Game Arena cho phép các mô hình đối đầu trực tiếp trong các môi trường có cấu trúc, nơi sức mạnh lối chơi tăng lên một cách tự nhiên khi các mô hình tiến hóa, giúp ngăn chặn tình trạng bão hòa hiệu suất. Báo cáo kỹ thuật này trình bày chi tiết về cơ sở hạ tầng đằng sau Game Arena và mô tả ba môi trường trò chơi thí điểm: Cờ vua, Poker và Ma sói. Các môi trường này bao gồm các thiết lập trò chơi thông tin hoàn hảo, thông tin không hoàn hảo và nhiều người chơi, cho phép nghiên cứu một cách hệ thống về khả năng lập kế hoạch chiến lược, khả năng thích ứng và tính bền vững của các mô hình trong điều kiện không chắc chắn. Đối với mỗi trò chơi, chúng tôi cung cấp mô tả chi tiết về môi trường, các chỉ số đánh giá và kết quả từ việc chạy các cuộc thi toàn diện giữa các mô hình. Thông qua cơ sở hạ tầng mạnh mẽ và đánh giá dựa trên cơ sở thực tế quy mô lớn, Game Arena đảm bảo tính tái lập, minh bạch và khả năng khái quát hóa cho các trò chơi và biến thể mới theo thời gian.

Ghi chú:31 trang, 15 hình ảnh. Báo cáo kỹ thuật. Trang dự án: URL này
Chủ đề:Trí tuệ nhân tạo (cs.AI)
Trích dẫn là:arXiv:2609.31473 [cs.AI]
(hoặc arXiv:2609.31473v1 [cs.AI] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.31473 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: William Cukierski [xem email] [v1] Thứ Sáu, 25 tháng 9 năm 2026 16:20:55 UTC (7.362 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Game Arena: Đánh giá LLM thông qua các đấu trường trò chơi đối kháng | AIHOT.vn