# VHD-Play: Tạo môi trường RL cho tác nhân AI từ các cơ chế đã giải, giúp Qwen3.6-35B-A3B tăng điểm từ 0.204 lên 0.815

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-23 07:00 (giờ Việt Nam)
- Điểm AI: 47/100
- Link AIHOT.vn: https://aihot.vn/items/37854aea7281a638
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmueysbv003kkrood53v0n6cz
- Link gốc: https://arxiv.org/abs/2609.27321

## Tóm tắt AI

VHD-Play giới thiệu quy trình tạo môi trường RL bằng cách mô hình hóa toán học và chuyển đổi thành các công cụ có trạng thái, giúp huấn luyện tác nhân hiệu quả với chi phí cực thấp.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.27321) [HTML (thử nghiệm)](https://arxiv.org/html/2609.27321v1)

> Tóm tắt: Các tác nhân mô hình ngôn ngữ ngày càng phải đối mặt với các tác vụ dài hạn với trạng thái thay đổi liên tục, các quyết định phụ thuộc lẫn nhau và kết quả bị trì hoãn. Việc mở rộng quy mô huấn luyện đòi hỏi các môi trường tác nhân đa dạng, tín hiệu kết quả đáng tin cậy và chi phí mở rộng thấp. Các quy trình tạo lập hiện có thường xây dựng môi trường trước khi xác định quy tắc kết quả hoặc chú thích quỹ đạo của chúng, khiến cho động lực học và đánh giá phải được căn chỉnh sau đó. VHD-Play đảo ngược sự phụ thuộc này bằng cách lấy mẫu và giải quyết một mô hình toán học trước khi một trình thiết lập dựa trên ngữ liệu chuyển đổi quy trình ra quyết định của nó thành các công cụ có trạng thái. Động lực học có thể thực thi và tham chiếu chấm điểm quỹ đạo được kế thừa từ cùng một mô hình đã giải. Quy trình này tạo ra 3.300 môi trường tác nhân đa dạng với chi phí chỉ vài xu mỗi môi trường. Việc huấn luyện Qwen3.6-35B-A3B trên ba họ tác vụ giúp nâng điểm số tác nhân trung bình từ 0,204 lên 0,815 trong bài kiểm tra chẩn đoán gồm năm họ tác vụ. Những cải thiện cũng xuất hiện trên các trường hợp chưa từng thấy từ cả ba họ huấn luyện và tám họ cơ chế chưa biết, sau đó mở rộng ra ngoài nền tảng được tạo để áp dụng cho các tiêu chuẩn bên ngoài về gọi hàm tổng quát, lập kế hoạch du lịch và thương mại điện tử 365 ngày. Trên E-Commerce Bench, checkpoint được huấn luyện hoàn thành mọi lượt chạy mà không bị phá sản và vượt qua Qwen3.7-Max. Chúng tôi so sánh các bài toán dạng văn bản với các phiên bản có trạng thái giúp tiết lộ hoặc ẩn đi các tham số của chúng. Sự so sánh cho thấy phần lớn khoảng cách có thể học được nằm ở tương tác có trạng thái thay vì giải quyết vấn đề cơ bản. Một trình thiết lập 35B cố định tạo ra các môi trường lớn hơn, và việc huấn luyện với quy mô tương xứng duy trì được các lợi ích khi kích thước cơ chế và thời hạn tăng lên, cho thấy tiềm năng của một nền tảng huấn luyện đang phát triển.

| Bình luận: | Báo cáo kỹ thuật Qwen |
| --- | --- |
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL) |
| Trích dẫn là: | arXiv:2609.27321 [cs.AI] |
|  | (hoặc arXiv:2609.27321v1 [cs.AI] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.27321 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Xinjie Shen [xem email](https://arxiv.org/show-email/277ad91e/2609.27321)] [v1] Thứ Tư, 23 tháng 9 năm 2026 03:51:54 UTC (350 KB)
