# Đo lường sự sụp đổ và khả năng tự sửa lỗi trong các cuộc tranh luận giữa các mô hình LLM đồng nhất

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 43/100
- Link AIHOT.vn: https://aihot.vn/items/523b77002f82d114
- Nguồn dữ liệu AI HOT: https://aihot.news/items/qhzwco0q0ob3oilpq880jff84
- Link gốc: https://arxiv.org/abs/2609.35279

## Tóm tắt AI

Nghiên cứu đề xuất giao thức kiểm toán cho tranh luận LLM, sử dụng sổ cái chuyển đổi để theo dõi sự sụp đổ và sửa lỗi. Kết quả phân tích 6.925 cuộc tranh luận cho thấy việc can thiệp để ngăn chặn sụp đổ có thể vô tình làm giảm khả năng tự sửa lỗi của mô hình.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2609.35279) [HTML (thử nghiệm)](https://arxiv.org/html/2609.35279v1)

> Tóm tắt: Các cuộc tranh luận giữa các mô hình ngôn ngữ lớn (LLM) đa tác nhân thường được đánh giá dựa trên việc liệu câu trả lời cuối cùng có cải thiện hay không, nhưng sự thay đổi không nhất thiết là cải thiện: cùng một cuộc thảo luận có thể cứu vãn một đa số ban đầu sai hoặc phá hỏng một đa số ban đầu đúng. Các đánh giá độ chính xác cuối cùng tiêu chuẩn thường đánh đồng các cơ chế đối lập này. Chúng tôi giới thiệu một giao thức có thể kiểm toán cho các cuộc tranh luận đồng nhất trên các câu hỏi trắc nghiệm (MCQ), ghi lại mỗi lượt chạy dưới dạng một sổ cái chuyển đổi về sự sụp đổ, sự sửa lỗi, sự khởi đầu và tiện ích can thiệp có dấu. Trên 6.925 cuộc tranh luận MMLU-Pro, giao thức xác định 253 trường hợp sụp đổ và một sổ cái sửa lỗi song song làm thay đổi cách đánh giá các can thiệp. Các thí nghiệm phát lại cho thấy sự đánh đổi cốt lõi: việc đóng băng có kiểm soát bằng cách loại bỏ một mô hình (leave-one-model-out probe-gated freeze) ngăn chặn được 29 trường hợp sụp đổ nhưng làm mất 108 trường hợp sửa lỗi với trọng số bằng nhau, vì vậy chỉ riêng việc ngăn chặn sụp đổ có thể dẫn đến chính sách sai lầm. Một bộ lọc 8-probe nhỏ gọn trước tranh luận đóng vai trò là tín hiệu phân loại: mối liên hệ cấp gia đình chưa điều chỉnh của nó với rủi ro sụp đổ có điều kiện là rất cao (G=7, Spearman rho=0,893, p hai phía chính xác=0,0123), nhưng độ chính xác của đa số ban đầu là một yếu tố so sánh gần gũi (rho=0,821; rho một phần gia đình=0,767, p=0,0877), vì vậy chúng tôi không coi đó là dự đoán đã được hiệu chuẩn hoặc điều chỉnh theo năng lực. Các dấu vết cấp vòng tranh luận khu trú nhiều trường hợp sụp đổ vào vòng tranh luận đầu tiên, nơi sự bất đồng sớm có thể dẫn đến cả các chuỗi tác động có hại và sự phục hồi hữu ích. Chúng tôi phát hành các lược đồ có thể phát lại, bộ mã hóa, kiểm toán, thẻ chi phí và tập lệnh xây dựng lại không cần API để các hàng khung mô hình trong tương lai có thể được so sánh dưới cùng các mẫu số và sổ cái tiện ích có dấu.

| Bình luận: | Được chấp nhận tại NeurIPS 2026 (Nhánh Đánh giá và Tập dữ liệu). Trang dự án: this https URL. Mã nguồn: this https URL |
| --- | --- |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL) |
| Trích dẫn là: | arXiv:2609.35279 [cs.CL] |
|  | (hoặc arXiv:2609.35279v1 [cs.CL] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2609.35279 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |

### Lịch sử gửi bài

Từ: Xin Li [xem email](https://arxiv.org/show-email/a151d240/2609.35279)] [v1] Thứ Hai, 28 tháng 9 năm 2026 14:31:19 UTC (536 KB)
