Nghiên cứu
SolveEdit: Bộ tiêu chuẩn đánh giá khả năng giải quyết vấn đề thị giác của mô hình tạo sinh
(giờ Việt Nam)
Tóm tắt AI
SolveEdit là bộ benchmark mới gồm 2.728 trường hợp, giúp đánh giá khả năng giải quyết vấn đề thị giác thông qua biến đổi cảnh quan của mô hình AI, sử dụng SolveScore để đo lường độ chính xác mà không cần ảnh tham chiếu.
Chính văn · Bản dịch AI
Tác giả: Wenjie Shu, Yexin Liu, Harold Haodong Chen, Xuerui Qiu, Zehan Wang, Yidi Zhang, Yizhan Chen, Zunwei Wang, Minghao Liu, Qi Chen, Harry Yang, Xiaogang Xu
Tóm tắt: Trí tuệ máy tính thường được đánh giá thông qua các bài toán suy luận trừu tượng, tuy nhiên nhiều vấn đề trong thế giới thực lại mang tính trực quan, chẳng hạn như sắp xếp đồ vật, sửa chữa bố cục hoặc vạch lộ trình. Việc giải quyết các vấn đề này đòi hỏi khả năng hiểu bối cảnh, suy luận những thay đổi cần thiết để đạt được mục tiêu và thực hiện thay đổi đó mà không làm ảnh hưởng đến các nội dung không liên quan. Tuy nhiên, các tiêu chuẩn đánh giá hiện nay chủ yếu tập trung vào nhận thức, tạo hình ảnh hoặc các phép biến đổi được chỉ định rõ ràng, khiến việc giải quyết vấn đề trực quan theo mục tiêu vẫn chưa được nghiên cứu đầy đủ. Để thu hẹp khoảng cách này, chúng tôi giới thiệu SolveEpIT, một tiêu chuẩn đánh giá khả năng giải quyết vấn đề trực quan thông qua biến đổi bối cảnh. Với một hình ảnh và một mục tiêu, mô hình phải suy luận ra phép biến đổi hợp lệ từ yêu cầu, bối cảnh hoặc quy tắc được thể hiện trực quan, sau đó thực thi nó trong khi vẫn bảo toàn các nội dung không liên quan. SoLvEEDrr chứa 2.728 trường hợp. Các hợp đồng chuyển đổi nguyên tử xác định các điều kiện bắt buộc và được bảo vệ, cho phép SoLvEScoRE đo lường mức độ hoàn thành và các thay đổi ngoài ý muốn mà không cần một kết quả tham chiếu duy nhất. Mô hình mạnh nhất được đánh giá chỉ đạt 57,0% SoLvEScoRE. Chúng tôi giới thiệu thêm SolveEdiT-PLAN, một trình lập kế hoạch trực quan hai giai đoạn giúp hiện thực hóa quá trình chuyển đổi trước khi tạo hình ảnh. Trong đánh giá tạo hình ảnh đơn lẻ tương ứng, nó cải thiện SoLvEScoRE trung bình 9,1 điểm trên ba trình tạo được thử nghiệm, bao gồm mức tăng từ 57,0% lên 71,6% đối với GPT-Image-2 mà không cần sửa đổi trình chỉnh sửa.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.35504 [cs.CV] |
| (hoặc arXiv:2609.35504v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.35504 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Yexin Liu [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 16:05:26 UTC (25.408 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.