Nghiên cứu
Khi nào trạng thái nội tại của mô hình hữu ích? Khám phá kỹ thuật biểu diễn trong an toàn LLM
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu so sánh hiệu quả giữa các phương pháp căn chỉnh hành vi (DPO) và kỹ thuật điều hướng biểu diễn nội tại trong việc kiểm soát an toàn cho LLM, nhằm làm rõ ưu nhược điểm của từng cách tiếp cận.
Chính văn · Bản dịch AI
Tóm tắt: Các biện pháp bảo vệ AI đáng tin cậy đòi hỏi cả cơ chế kiểm soát nhằm giảm thiểu hành vi không an toàn và cơ chế giám sát nhằm phát hiện các rủi ro an toàn trong quá trình tương tác với mô hình. Các biện pháp bảo vệ hành vi đã được thiết lập bao gồm các phương pháp căn chỉnh (alignment) giúp tối ưu hóa đầu ra của mô hình và các trình giám sát văn bản (text monitors) giúp đánh giá văn bản tương tác. Thay vào đó, kỹ thuật biểu diễn (representation engineering) đọc hoặc sửa đổi các trạng thái nội tại của mô hình, nhưng thế mạnh tương đối của các phương pháp này vẫn chưa rõ ràng vì chúng thường được đánh giá trong các thiết lập khác nhau. Chúng tôi trình bày một đánh giá đối chiếu trên hai hướng. Đối với kiểm soát an toàn, chúng tôi so sánh DPO, một phương pháp căn chỉnh hành vi, với ba phương pháp điều hướng biểu diễn (representation steering) dựa trên các tiêu chí về độ bền vững, tính thực tiễn và độ chi tiết. DPO mang lại khả năng kiểm soát tổng thể mạnh mẽ nhất và nhìn chung cải thiện khi tăng dữ liệu huấn luyện, mặc dù độ an toàn của nó có thể suy giảm sau quá trình tinh chỉnh (fine-tuning) lành tính tiếp theo. Điều hướng biểu diễn vẫn duy trì tính cạnh tranh chủ yếu trong các thiết lập ít dữ liệu, đặc biệt là với dữ liệu đối lập chất lượng cao. Đối với giám sát an toàn, chúng tôi so sánh các bộ dò biểu diễn (representation probes) với các trình giám sát văn bản đã tinh chỉnh và có trọng số mở (open-weight) dựa trên các tiêu chí về phát hiện toàn bộ phản hồi, phát hiện sớm và chi phí tính toán. Các trình giám sát văn bản chuyên dụng đạt được độ chính xác phát hiện tổng thể mạnh mẽ nhất, trong khi các bộ dò biểu diễn vẫn duy trì tính cạnh tranh với chi phí biên thấp hơn đáng kể. Cuối cùng, các biện pháp can thiệp có sự hướng dẫn của trình giám sát giúp khôi phục phần lớn độ an toàn bị mất đi của DPO sau khi tinh chỉnh lành tính, với rất ít tình trạng từ chối nhầm (over-refusal) bổ sung. Nhìn chung, kỹ thuật biểu diễn không thay thế hoàn toàn các biện pháp bảo vệ hành vi, nhưng mang lại những ưu điểm thực tiễn trong các điều kiện cụ thể và có thể cung cấp các lợi ích an toàn bổ trợ.
| Chủ đề: | Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2609.34771 [cs.AI] |
| (hoặc arXiv:2609.34771v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.34771 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Tianyi Guan [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 09:50:08 UTC (307 KB)
Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.