Nghiên cứu
UMM-Reflection: Tối ưu hóa khả năng tự sửa lỗi hình ảnh cho mô hình đa phương thức bằng Reinforcement Learning
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu UMM-Reflection, phương pháp huấn luyện mô hình đa phương thức tự chẩn đoán và sửa lỗi hình ảnh thông qua Reinforcement Learning, giúp cải thiện chất lượng thế hệ ảnh bằng cách học đồng thời phản hồi văn bản và kết quả hình ảnh.
Chính văn · Bản dịch AI
Tóm tắt: Các mô hình đa phương thức hợp nhất có khả năng vừa quan sát vừa kết xuất hình ảnh, vì vậy về nguyên tắc, chúng có thể tự sửa lỗi các hình ảnh do chính mình tạo ra: chẩn đoán những điểm sai sót của hình ảnh, sửa đổi, quan sát kết quả và chẩn đoán lại. Việc sửa đổi có hiệu quả hay không chỉ được biết sau khi hình ảnh được kết xuất, do đó văn bản phản hồi và quá trình tạo hình ảnh phải được học cùng nhau trong toàn bộ vòng lặp. Tinh chỉnh có giám sát (SFT) trên các quỹ đạo phản hồi mang lại bước khởi đầu thuận lợi nhưng không tìm ra được các lộ trình sửa lỗi có tỷ lệ thành công cao, còn học tăng cường (RL) ngây thơ chỉ tối ưu hóa bộ kết xuất hoặc chỉ một đầu ra (head) sẽ bỏ lỡ phần lớn tiềm năng cải thiện. Chúng tôi giới thiệu UMM-Reflection, áp dụng học tăng cường (RL) để hoàn thiện các quỹ đạo phản hồi bên trong một mô hình hợp nhất: các quỹ đạo cùng nguồn gốc chia sẻ một hình ảnh ban đầu, nhờ đó lợi thế tương đối theo nhóm giúp so sánh các chiến lược phản hồi, và một lợi thế cấp quỹ đạo sẽ cập nhật cả các token phản hồi lẫn các sửa đổi dựa trên luồng (flow-based), giúp tránh sự bùng nổ tổ hợp của việc phân bổ tín dụng theo từng vòng. Không giống như chỉnh sửa đơn vòng hoặc các quy trình có bộ đánh giá bên ngoài, tín dụng được luân chuyển qua các vòng và cho cả hai vai trò của cùng một mô hình, đồng thời không cần bộ xác thực khi suy luận. Trên BAGEL, UMM-Reflection cải thiện GenEval thêm 12,05 điểm so với SFT, và các cải thiện này chuyển đổi sang WISE (+10,97), OneIG-Bench (+3,48) và T2I-CompBench++ (+4,63), tất cả đều không được sử dụng trong quá trình huấn luyện.
| Chủ đề: | Thị giác máy tính và Nhận dạng mẫu (cs.CV); Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.35767 [cs.CV] |
| (hoặc arXiv:2609.35767v1 [cs.CV] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.35767 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Yijia Fan [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 17:59:36 UTC (20.973 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.