Nghiên cứu
IndicBankBench: Đánh giá độ an toàn và tin cậy của AI trong lĩnh vực ngân hàng bán lẻ tại Ấn Độ
(giờ Việt Nam)
Tóm tắt AI
IndicBankBench là bộ tiêu chuẩn đánh giá gồm 799 trường hợp, tập trung kiểm tra khả năng xử lý dữ liệu, sử dụng công cụ và độ an toàn của các trợ lý AI trong ngành ngân hàng bán lẻ tại Ấn Độ.
Chính văn · Bản dịch AI
Tóm tắt: Các trợ lý ngân hàng phải sử dụng thông tin cụ thể của tài khoản để trả lời yêu cầu và trong nhiều trường hợp, thực hiện các thao tác thông qua công cụ. Việc chỉ đánh giá phản hồi cuối cùng sẽ bỏ sót những lỗi quan trọng. Một trợ lý có thể hỏi thông tin mà nó đã có, dựa vào ngữ cảnh cũ, chọn sai tài khoản hoặc viết một giá trị không hợp lệ sau khi đã nêu đúng giá trị đó. Chúng tôi giới thiệu IndicBankBench, một bộ tiêu chuẩn đánh giá gồm 799 trường hợp cho lĩnh vực ngân hàng bán lẻ tại Ấn Độ, bao gồm năm lĩnh vực hoạt động, một lĩnh vực về khả năng/từ chối và hai mươi trục chính. Các trường hợp được đánh giá qua bốn giai đoạn: an toàn, sử dụng công cụ và hành động, mức độ phù hợp của phản hồi và chất lượng tư vấn. Việc sử dụng công cụ và hầu hết các kiểm tra an toàn đều mang tính tất định. Một bộ giải quyết hẹp chỉ xử lý các trường hợp xác nhận-trước-khi-ghi mơ hồ, trong khi một LLM judge riêng biệt đánh giá mức độ phù hợp về ngữ nghĩa của phản hồi. Chúng tôi chạy mỗi trường hợp ba lần và báo cáo kết quả strict pass^3, yêu cầu thành công ở tất cả các lần thử. Trong số mười một mô hình được đánh giá, độ tin cậy nghiêm ngặt dao động từ 43,7% đến 58,2%, trong khi tỷ lệ thành công ít nhất một lần dao động từ 60% đến 74%. Khoảng cách này cho thấy tỷ lệ thành công ít nhất một lần có thể phóng đại hành vi ngân hàng đáng tin cậy. Các chẩn đoán ở cấp độ trường hợp cũng phân biệt được các hệ thống hỏi những câu hỏi không cần thiết với những hệ thống thực hiện hành động nhưng thất bại trong việc đối chiếu ngữ cảnh khách hàng hoặc giải quyết triệt để yêu cầu. Chúng tôi công bố các trường hợp, môi trường mô phỏng và bộ công cụ đánh giá.
| Bình luận: | 16 trang, 4 hình ảnh |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.29167 [cs.AI] |
| (hoặc arXiv:2609.29167v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.29167 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Prashant Devadiga [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 07:40:09 UTC (210 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.