# SpeakerMem-R1: Hệ thống bộ nhớ kênh đôi tập trung vào người nói cho hội thoại đa bên

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-24 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/b06cd2d5958048a0
- Link gốc: https://arxiv.org/abs/2609.26780

## Tóm tắt AI

SpeakerMem-R1 giải quyết các hạn chế của LLM trong việc ghi nhớ hội thoại đa bên bằng cách sử dụng cấu trúc bộ nhớ kênh đôi, giúp phân tách thông tin theo từng cá nhân và nhóm để tái tạo trạng thái hội thoại chính xác hơn.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.26780) [HTML (thử nghiệm)](https://arxiv.org/html/2609.26780v2)

> Tóm tắt: Bộ nhớ hội thoại dài hạn trong môi trường đa người tham gia đòi hỏi nhiều hơn là chỉ truy xuất nội dung liên quan từ các cuộc hội thoại dài hạn: hệ thống phải phân biệt được ai đã nói gì, mỗi phát biểu liên quan đến ai, các cá nhân nhìn nhận lẫn nhau như thế nào, thông tin nào được chia sẻ bởi nhóm và các trạng thái thay đổi theo thời gian ra sao. Các nghiên cứu gần đây về tiêu chuẩn đối thoại đa người tham gia cho thấy các hệ thống bộ nhớ LLM đa năng hiện nay thường làm mất đi mối quan hệ giữa người với người và nhóm, hoặc gặp khó khăn trong việc tích hợp các manh mối nằm rải rác giữa các thành viên, các nhóm và theo thời gian. Tổng hợp lại, những vấn đề này bộc lộ hai nút thắt cốt lõi: quy gán thông điệp và hiểu mối quan hệ trong đối thoại đa người tham gia, cùng với việc tái tạo trạng thái từ các lịch sử đan xen. Để giải quyết cả hai vấn đề này, chúng tôi đề xuất $\textbf{SpeakerMem-R1}$: bộ nhớ hai luồng của nó lưu trữ các thông điệp nguyên văn được gắn nhãn người nói và các trạng thái suy luận được tổ chức theo góc nhìn cấp cá nhân và cấp nhóm, sau đó kết hợp bằng chứng từ cả hai luồng theo thực thể, sự kiện và thời gian tại thời điểm truy vấn. Để giảm thiểu lỗi quy gán và cập nhật trong quá trình xây dựng bộ nhớ có cấu trúc đồng thời cho phép triển khai cục bộ, chúng tôi huấn luyện Writer-R1 với SpeakerLevenshtein và GRPO có điều kiện theo người nói. Trên GroupMemBench, SocialMemBench và EverMemBench, SpeakerMem-R1 đạt độ chính xác nhị phân lần lượt là 47.9%, 69.2% và 61.9%. Trên bảng xếp hạng EverMemBench được công bố công khai từ EverMind-AI, chúng tôi đạt 62.33%, kết quả tốt nhất được báo cáo trong số các khung làm việc hiện đại mới nhất. Hệ thống cũng đạt 70.85% trên tổng số 1.986 câu hỏi LoCoMo, vốn được chúng tôi sử dụng như một bài kiểm tra giới hạn hội thoại dài hạn giữa hai người. Trong một đánh giá có kiểm soát với 305 câu hỏi, RL đã nâng độ chính xác trung bình của SFT Writer từ 57.38% lên 68.20%. Chúng tôi báo cáo cả độ chính xác nhị phân và token-F1, các thử nghiệm cắt bỏ cho thấy các luồng nguyên văn và có cấu trúc, cũng như các góc nhìn cấp cá nhân và cấp nhóm, có tính bổ trợ cho nhau dưới giao diện đánh giá tiêu chuẩn.

| Bình luận: | Trang dự án: URL này, Mã nguồn: URL này |
| --- | --- |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL); Trí tuệ nhân tạo (cs.AI); Truy xuất thông tin (cs.IR); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.26780 [cs.CL] |
|  | (hoặc arXiv:2609.26780v2 [cs.CL] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.26780 DOI do arXiv cấp thông qua DataCite |

### Lịch sử gửi bài

Từ: Haobo Zheng [xem email](https://arxiv.org/show-email/ca640b24/2609.26780)] [v1](https://arxiv.org/abs/2609.26780v1) Thứ Ba, 22 tháng 9, 2026 17:56:12 UTC (2.055 KB) [v2] Thứ Tư, 23 tháng 9, 2026 12:35:20 UTC (1.028 KB)
