# Học cách học từ ngữ cảnh: Huấn luyện tổng hợp từ tài liệu công khai bị nhiễu

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-29 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/53f20ff80283e55d
- Link gốc: https://arxiv.org/abs/2609.33642

## Tóm tắt AI

Nghiên cứu đề xuất phương pháp sử dụng tài liệu công khai có chỉnh sửa để huấn luyện LLM khả năng suy luận dựa trên ngữ cảnh thay vì chỉ ghi nhớ dữ liệu cũ, giúp giải quyết bài toán thiếu hụt dữ liệu huấn luyện chất lượng cao.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.33642) [HTML (thử nghiệm)](https://arxiv.org/html/2609.33642v1)

> Tóm tắt: Các tác vụ thực tế thường đòi hỏi các mô hình ngôn ngữ lớn (LLM) phải học từ ngữ cảnh cụ thể của tác vụ thay vì dựa vào kiến thức tham số đã được huấn luyện trước. Khả năng này vẫn là một điểm yếu của các LLM, trong khi việc gắn nhãn thủ công cho các ngữ cảnh tác vụ như vậy rất tốn kém và khó mở rộng. Các tài liệu công khai chất lượng cao là một giải pháp thay thế dồi dào, nhưng phần lớn web công khai đã được tiêu thụ trong quá trình huấn luyện trước: việc huấn luyện một cách máy móc trên các tài liệu này sẽ khuyến khích sự ghi nhớ thay vì học theo ngữ cảnh. Trong nghiên cứu này, chúng tôi cố gắng tận dụng các tài liệu công khai chất lượng cao với những thay đổi nhỏ và nhận thấy qua thực nghiệm rằng các LLM có thể tạo ra các chuỗi suy luận và câu trả lời phụ thuộc vào ngữ cảnh một cách thành công, sau đó được sử dụng để huấn luyện một mô hình học viên (student model). Cụ thể, chúng tôi xây dựng một quy trình tổng hợp: (i) viết lại các tài liệu nguồn để giảm rủi ro ghi nhớ, (ii) tạo ra các câu hỏi và tiêu chí đánh giá đòi hỏi phải suy luận dựa trên tài liệu, (iii) trả lời các câu hỏi với tài liệu làm ngữ cảnh, và (iv) chỉ chấp nhận các mẫu thực sự phụ thuộc vào tài liệu. Không cần bất kỳ người gắn nhãn nào, quy trình của chúng tôi tạo ra khoảng 10 nghìn mẫu từ 3,5 nghìn tài liệu, và mô hình học viên thu được cải thiện đáng kể hiệu suất trên CL-bench. SFT nâng cấp một mô hình học viên Qwen3.6-35B-A3B từ 13,7% lên 22,8%, và giai đoạn RL với phần thưởng dựa trên tiêu chí đánh giá tiếp theo đạt 24,6%, trên CL-bench tương đương với một mô hình tiên phong có hơn một nghìn tỷ tham số là Qwen3.8-2.4T (23,9%). Chúng tôi cũng quan sát thấy sự cải thiện lan rộng sang khả năng hiểu ngữ cảnh dài, tuân thủ hướng dẫn và suy luận, trong khi khả năng tạo mã và kiến thức vẫn giữ nguyên. Chúng tôi hy vọng nghiên cứu này cung cấp một phương pháp có thể tái lập và mở rộng để cải thiện khả năng học từ ngữ cảnh của các LLM, đồng thời thúc đẩy nghiên cứu sâu hơn về suy luận dựa trên ngữ cảnh.

| Bình luận: | 18 trang, 3 hình, 10 bảng |
| --- | --- |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL); Trí tuệ nhân tạo (cs.AI) |
| Phân loại ACM: | I.2.7; I.2.6 |
| Trích dẫn là: | arXiv:2609.33642 [cs.CL] |
|  | (hoặc arXiv:2609.33642v1 [cs.CL] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.33642 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Chengyue Jiang [xem email](https://arxiv.org/show-email/916d9561/2609.33642)] [v1] Chủ nhật, 27 tháng 9 năm 2026 15:05:22 UTC (271 KB)
