# Diffusion Reward Models: Bước tiến mới trong mô hình hóa phần thưởng đa phương thức

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-29 07:00 (giờ Việt Nam)
- Điểm AI: 88/100
- Nhãn AIHOT: Tinh chọn
- Link AIHOT.vn: https://aihot.vn/items/4e0e42cc2856f717
- Link gốc: https://arxiv.org/abs/2609.33803

## Lý do tinh chọn

Đề xuất một hướng tiếp cận mới mẻ và đầy tiềm năng để giải quyết vấn đề căn bản trong việc căn chỉnh (alignment) các mô hình ngôn ngữ lớn.

## Tóm tắt AI

Nghiên cứu giới thiệu DRM, một mô hình phần thưởng dựa trên Diffusion Transformer giúp nắm bắt bản chất đa phương thức của sở thích con người, thay thế các phương pháp ước tính điểm đơn lẻ truyền thống.

## Thân bài

Tác giả: [Xiangyang Wang](https://arxiv.org/search/cs?searchtype=author&query=Wang,+X), [Bingxiang He](https://arxiv.org/search/cs?searchtype=author&query=He,+B), [Zeyuan Liu](https://arxiv.org/search/cs?searchtype=author&query=Liu,+Z), [Jiaze WangZiqing Qiao](https://arxiv.org/search/cs?searchtype=author&query=Qiao,+J+W), [Yuxin Zuo](https://arxiv.org/search/cs?searchtype=author&query=Zuo,+Y), [Huan-ang Gao](https://arxiv.org/search/cs?searchtype=author&query=Gao,+H), [Cheng Qian](https://arxiv.org/search/cs?searchtype=author&query=Qian,+C), [Wenbin Zhang](https://arxiv.org/search/cs?searchtype=author&query=Zhang,+W), [Ran Li](https://arxiv.org/search/cs?searchtype=author&query=Li,+R), [Youbang Sun](https://arxiv.org/search/cs?searchtype=author&query=Sun,+Y), [Ning Ding](https://arxiv.org/search/cs?searchtype=author&query=Ding,+N), [Yuanchun Shi](https://arxiv.org/search/cs?searchtype=author&query=Shi,+Y), [Zhiyuan Liu](https://arxiv.org/search/cs?searchtype=author&query=Liu,+Z), [Chaojun Xiao](https://arxiv.org/search/cs?searchtype=author&query=Xiao,+C), [Chun Yu](https://arxiv.org/search/cs?searchtype=author&query=Yu,+C)

[Xem PDF](https://arxiv.org/pdf/2609.33803) [HTML (thử nghiệm)](https://arxiv.org/html/2609.33803v1)

> Tóm tắt: Các mô hình phần thưởng (reward models) là nền tảng cho việc căn chỉnh các mô hình ngôn ngữ lớn (LLM), tuy nhiên các thiết kế phổ biến hiện nay đều quy giản mỗi cặp câu lệnh-phản hồi về một ước tính điểm hoặc một phân phối từ một họ tham số cố định. Điều này không phù hợp với sở thích của con người, vốn mang tính đa phương thức (multimodal) một cách tự nhiên: cùng một phản hồi có thể được đánh giá hợp lý theo nhiều cách khác nhau và không có họ tham số đơn lẻ nào bao hàm được tất cả. Để phù hợp hơn với cấu trúc này, chúng tôi giới thiệu DRM, một Diffusion Reward Model (Mô hình phần thưởng khuếch tán) giúp định hình lại việc mô hình hóa phần thưởng thành ước tính mật độ có điều kiện trên $p(\mathbf{r}\mid x,y)$. Dựa trên một bộ mã hóa LLM cố định, một Diffusion Transformer gọn nhẹ sẽ khử nhiễu Gaussian thành một vectơ phần thưởng, không đặt ra giả định tham số nào về phân phối đầu ra và thể hiện tự nhiên cấu trúc đa phương thức của nó. Một kiến trúc duy nhất có thể xử lý cả hồi quy đa thuộc tính và dữ liệu ưu tiên theo cặp; tại thời điểm suy luận, $N$ mẫu tạo thành một phân phối phần thưởng thực nghiệm có thể được tổng hợp thành một giá trị vô hướng, phương sai hoặc các phân vị. Qua năm tiêu chuẩn đánh giá, DRM bắt kịp hoặc vượt qua các mô hình cơ sở với cùng dữ liệu và nền tảng, duy trì tính cạnh tranh với các RM phân biệt, phân phối và tạo sinh lớn hơn nhiều mặc dù quy mô đào tạo khiêm tốn, đồng thời khôi phục được cấu trúc phần thưởng đa phương thức nơi các đầu ra thông thường bị suy giảm thành một điểm duy nhất. Việc loại bỏ dựa trên độ không chắc chắn và tổng hợp theo cận dưới tin cậy (LCB) chứng minh thêm rằng DRM có thể khai thác thông tin phân phối vượt ra ngoài phần thưởng vô hướng để cải thiện các quyết định của mô hình phần thưởng. Các thí nghiệm RLHF hạ nguồn cũng cho thấy việc sử dụng DRM làm phần thưởng trong quá trình đào tạo dẫn đến hiệu suất chính sách tốt hơn, xác nhận trực tiếp lợi ích thực tiễn của mô hình hóa phần thưởng dựa trên khuếch tán cho đào tạo RLHF.

| Chủ đề: | Học máy (cs.LG); Trí tuệ nhân tạo (cs.AI) |
| --- | --- |
| Trích dẫn là: | arXiv:2609.33803 [cs.LG] |
|  | (hoặc arXiv:2609.33803v1 [cs.LG] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.33803 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Xiangyang Wang [xem email](https://arxiv.org/show-email/71c6824c/2609.33803)] [v1] CN, 27 Thg 9, 2026 17:57:14 UTC (947 KB)
