# Tại sao hướng dẫn PRM tất định lại kém hiệu quả trong suy luận khuếch tán rời rạc?

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 48/100
- Link AIHOT.vn: https://aihot.vn/items/9435db643756cb7a
- Nguồn dữ liệu AI HOT: https://aihot.news/items/k9egkedanczjazmdt31wvys3e
- Link gốc: https://arxiv.org/abs/2609.35472

## Tóm tắt AI

Nghiên cứu chỉ ra rằng với cùng ngân sách tính toán, phương pháp hướng dẫn PRM tất định cho mô hình ngôn ngữ khuếch tán rời rạc kém hiệu quả hơn so với lấy mẫu độc lập kết hợp tái xếp hạng ORM, đặc biệt là trên bài toán GSM8K.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.35472) [HTML (thử nghiệm)](https://arxiv.org/html/2609.35472v1)

> Tóm tắt: Các mô hình ngôn ngữ khuếch tán rời rạc (dLLM) đưa ra giải pháp khử nhiễu tại mỗi bước, điều này khiến việc hướng dẫn bằng mô hình phần thưởng quy trình (PRM) trông như một cách để tiêu tốn tài nguyên tính toán tại thời điểm kiểm thử. Chúng tôi chỉ ra rằng khi việc khử nhiễu, chấm điểm bằng PRM và chấm điểm bằng mô hình phần thưởng kết quả (ORM) được tính trong cùng một ngân sách lượt truyền xuôi (forward pass), dạng xác định của nó lại thua kém một phương pháp cơ sở đơn giản hơn nhiều. Các PRM của chúng tôi chấm điểm các trạng thái khử nhiễu trung gian và được huấn luyện dựa trên tính đúng đắn của câu trả lời cuối cùng. Trên Dream-v0-Instruct-7B với 8 ứng viên cho mỗi bài toán GSM8K, việc giữ lại ứng viên có điểm PRM cao nhất tại mỗi bước chấm điểm đạt 65,18%, trong khi lấy mẫu độc lập cộng với bộ xếp hạng lại ORM được huấn luyện cho tác vụ này đạt 75,13%. Khoảng cách này tăng lên 12,69 điểm phần trăm (pp) với 32 ứng viên, và là 9,85 pp trên MATH và 12,16 pp trên MBPP. Chúng tôi truy vết điều này đến hai thất bại có thể tách rời. Thứ nhất, việc hướng dẫn cắt tỉa dựa trên tín hiệu yếu: trên GSM8K, chỉ số PRM ROC-AUC giảm từ 0,77 xuống 0,54 khi tỷ lệ mặt nạ tăng lên, một sự suy giảm vẫn tồn tại khi các trạng thái được gán nhãn lại với các lượt triển khai mới, và việc cắt tỉa làm giảm độ chính xác tốt nhất có thể đạt được từ nhóm ứng viên từ 81,05% đối với các mẫu độc lập xuống 67,30%. Thứ hai, trên GSM8K và MATH, PRM là một bộ đánh giá cuối cùng kém: một bộ lấy mẫu Monte Carlo tuần tự với cùng ngân sách khôi phục mức trần đó lên 77,89%, tuy nhiên việc lựa chọn bằng PRM chỉ cho kết quả 65,48%, ngang bằng với hướng dẫn xác định, trong khi một PRM được huấn luyện lại trên các trạng thái cuối cùng lại tương đương với ORM trên các ứng viên giống hệt nhau. MBPP tách biệt hai điều này: ở đó PRM đạt 65,47% khi xếp hạng lại các chương trình đã hoàn thành, ngang bằng với ORM, nhưng chỉ đạt 50,88% khi nó hướng dẫn quá trình khử nhiễu. Các kết quả chỉ ra hai mục tiêu cho việc hướng dẫn dLLM: giữ lại các giải pháp từng phần đúng đắn trong suốt quá trình khử nhiễu sớm, và để lại lựa chọn cuối cùng cho một bộ kiểm chứng được huấn luyện trên các trạng thái cuối cùng. Chúng tôi công bố tập dữ liệu các trạng thái khử nhiễu với nhãn kết quả và bộ công cụ đánh giá để có thể so sánh tái lập ở mức tài nguyên tính toán tương đương.

| Bình luận: | Được chấp nhận tại NeurIPS 2026. 27 trang, 6 hình ảnh. Mã nguồn: this https URL tập dữ liệu và mô hình: this https URL |
| --- | --- |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.35472 [cs.AI] |
|  | (hoặc arXiv:2609.35472v1 [cs.AI] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.35472 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Yan Zhan [xem email](https://arxiv.org/show-email/c6b194b0/2609.35472)] [v1] Thứ Hai, 28 tháng 9 năm 2026 15:54:05 UTC (1.627 KB)
