# Draft-KV: Tối ưu hóa giao tiếp tiềm ẩn giữa các mô hình ngôn ngữ

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 51/100
- Link AIHOT.vn: https://aihot.vn/items/a7f5d5ec083b2665
- Nguồn dữ liệu AI HOT: https://aihot.news/items/j1l8qp4lsjmdgqhw7wai22zbq
- Link gốc: https://arxiv.org/abs/2609.34754

## Tóm tắt AI

Nghiên cứu giới thiệu Draft-KV, phương pháp cho phép mô hình chia sẻ trạng thái key-value thông qua các lớp chiếu tuyến tính và cổng chú ý, giúp tăng hiệu suất mà chỉ cần huấn luyện thêm 1.05M tham số.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.34754) [HTML (thử nghiệm)](https://arxiv.org/html/2609.34754v1)

> Tóm tắt: Giao tiếp tiềm ẩn (latent communication) truyền các trạng thái nội bộ giữa các mô hình ngôn ngữ thay vì văn bản đã giải mã, nhưng độ chính xác cao hơn của bên nhận không chứng minh rằng bên nhận đã sử dụng nội dung thông điệp. Qua năm cặp phương pháp-tập dữ liệu, việc thay thế mỗi thông điệp bằng một thông điệp từ câu hỏi không liên quan chỉ làm thay đổi độ chính xác tối đa 0,60 điểm, ngay cả khi giao tiếp giúp tăng 15,44 điểm so với việc chỉ dùng bên nhận. Do đó, giao diện có thể cung cấp mức tăng này trong khi khiến bên chia sẻ trở nên không cần thiết. Draft-KV thay vào đó gửi các trạng thái key-value được hình thành trong khi bên chia sẻ soạn thảo câu trả lời cho câu hỏi hiện tại. Các phép chiếu tuyến tính đặt các trạng thái này vào một bộ nhớ phụ được đọc thông qua nhánh chú ý có cổng (gated attention branch), và quá trình huấn luyện tăng dần chuyển từ tái tạo thông điệp sang giám sát câu trả lời dưới sự kiểm soát về tác hại từ các thông điệp không khớp. Cả hai mô hình đều được giữ nguyên (frozen) và giao diện chỉ huấn luyện 1,05 triệu tham số, ít hơn 348 lần so với C2C. Với bên chia sẻ Qwen3-8B, bên nhận Qwen2.5-0.5B-Instruct được giữ nguyên đạt 78,04% trên MMLU-Redux, so với 37,45% khi đứng một mình và 36,40% với các thông điệp được gán lại. Ở kích thước giao diện cố định, việc mở rộng bên chia sẻ từ 0,6B lên 8B giúp tăng độ chính xác từ 46,11% lên 78,04%; giao tiếp cũng chuyển đổi sang các tác vụ chưa từng thấy (held-out tasks) và có thể vượt qua cả hai mô hình khi mỗi bên nắm giữ các bằng chứng khác nhau.

| Bình luận: | 41 trang, 7 hình, 13 bảng. Mã nguồn: this https URL |
| --- | --- |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL) |
| Trích dẫn là: | arXiv:2609.34754 [cs.CL] |
|  | (hoặc arXiv:2609.34754v1 [cs.CL] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.34754 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Linquan Wu [xem email](https://arxiv.org/show-email/db34575f/2609.34754)] [v1] Thứ Hai, 28 tháng 9 năm 2026 09:42:01 UTC (479 KB)
