Nghiên cứu
DeepAmbigQA: Apple ra mắt bộ tiêu chuẩn đánh giá khả năng suy luận đa bước của LLM
(giờ Việt Nam)
Tóm tắt AI
Apple giới thiệu DeepAmbigQA, bộ tiêu chuẩn mới giúp kiểm tra độ hoàn thiện của LLM khi xử lý các câu hỏi phức tạp, đòi hỏi khả năng phân biệt thực thể trùng tên và suy luận đa bước.
Bản dịch AI

Tác giả: Jiabao Ji†, Min Li, Priyanshu Kumar, Shiyu Chang†, Saloni Potdar
Các mô hình ngôn ngữ lớn (LLM) tích hợp công cụ tìm kiếm cho thấy tiềm năng mạnh mẽ trong việc trả lời câu hỏi (QA) trên phạm vi mở, tuy nhiên chúng thường gặp khó khăn trong việc đưa ra tập hợp câu trả lời đầy đủ cho các câu hỏi phức tạp như “Diễn viên nào trong bộ phim Heat đã giành được ít nhất một giải Oscar?”, vốn đòi hỏi (1) khả năng phân biệt giữa nhiều bộ phim có cùng tiêu đề và (2) khả năng suy luận trên một tập hợp lớn các diễn viên để thu thập và tổng hợp bằng chứng. Các tiêu chuẩn đánh giá QA hiện nay hiếm khi đánh giá đồng thời cả hai thách thức này. Để giải quyết vấn đề đó, chúng tôi giới thiệu DEEPAMBIGQAGEN, một quy trình tạo dữ liệu tự động giúp xây dựng các tác vụ QA dựa trên kho ngữ liệu văn bản và đồ thị tri thức liên kết, từ đó tạo ra các câu hỏi tự nhiên và có thể kiểm chứng, trong đó lồng ghép một cách hệ thống sự mơ hồ về tên gọi và khả năng suy luận đa bước. Dựa trên cơ sở này, chúng tôi xây dựng DEEPAMBIGQA, một tập dữ liệu gồm 3.600 câu hỏi đòi hỏi suy luận đa chặng (multi-hop reasoning), trong đó một nửa yêu cầu giải quyết sự mơ hồ về tên gọi một cách rõ ràng. Các thí nghiệm cho thấy ngay cả GPT-5, mô hình tiên tiến nhất hiện nay, cũng đưa ra các câu trả lời không đầy đủ, chỉ đạt 0,13 điểm khớp chính xác (exact match) đối với các câu hỏi mơ hồ và 0,21 đối với các câu hỏi không mơ hồ. Những phát hiện này nhấn mạnh nhu cầu về các hệ thống QA mạnh mẽ hơn, hướng tới mục tiêu thu thập thông tin và đảm bảo tính đầy đủ của câu trả lời.
Các bài đọc và cập nhật liên quan.
Tác vụ Trả lời câu hỏi trực quan dựa trên tri thức bên ngoài (OKVQA) đòi hỏi một hệ thống tự động phải trả lời các câu hỏi ngôn ngữ tự nhiên về hình ảnh bằng cách sử dụng tri thức bên ngoài. Chúng tôi nhận thấy rằng nhiều câu hỏi trực quan, vốn chứa các cụm từ chỉ định tham chiếu đến các thực thể trong hình ảnh, có thể được viết lại thành các câu hỏi “không dựa trên ngữ cảnh hình ảnh” (non-grounded) và có thể được giải quyết bởi các hệ thống trả lời câu hỏi dựa trên văn bản hiện có. Điều này cho phép tái sử dụng…
Đọc thêm
Trả lời câu hỏi hội thoại (Conversational QA) đòi hỏi khả năng diễn giải chính xác một câu hỏi trong ngữ cảnh của các lượt hội thoại trước đó. Chúng tôi giải quyết tác vụ QA hội thoại bằng cách phân tách nó thành các tác vụ phụ là viết lại câu hỏi và trả lời câu hỏi. Tác vụ phụ viết lại câu hỏi (QR) được thiết kế đặc biệt để chuyển đổi các câu hỏi mơ hồ, vốn phụ thuộc vào ngữ cảnh hội thoại, thành các câu hỏi rõ ràng để có thể được…
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.