Hugging Face Daily Papers
85

Nghiên cứu

MetroLLM-Bench: Đánh giá mô hình ngôn ngữ trong vai trò trợ lý điều hành hệ thống tàu điện ngầm

(giờ Việt Nam)

Tóm tắt AI

MetroLLM-Bench là bộ tiêu chuẩn mới gồm 955 tình huống thực tế, giúp đánh giá khả năng của AI trong việc xử lý lộ trình, giá vé và sự cố tại các ki-ốt tàu điện ngầm thông qua việc sử dụng công cụ có cấu trúc.

Bản dịch AI

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Remco Hendriks [xem email] [v1] Thứ Tư, 9 tháng 9, 2026 10:46:56 UTC (1.303 KB)

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.