Nghiên cứu
Imprint Reader: Giải mã cập nhật trọng số thành can thiệp hành vi
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu giới thiệu Imprint Reader sử dụng kỹ thuật SaRT để mô tả các cập nhật trọng số bằng ngôn ngữ tự nhiên, mở ra hướng can thiệp hành vi mô hình dựa trên các thay đổi tham số.
Chính văn · Bản dịch AI
Tóm tắt: Khi các mô hình ngôn ngữ ngày càng đóng vai trò quan trọng trong phát triển AI, một nguyện vọng tự nhiên là chúng có thể tự suy ngẫm về quá trình học tập của chính mình, giống như con người, và sử dụng sự suy ngẫm đó để tự cải thiện. Đồng thời, các mô hình này có một lợi thế mà người học là con người không có, vì quá trình huấn luyện để lại các dấu vết ở cấp độ tham số mà về nguyên tắc có thể được kiểm tra trực tiếp. Tuy nhiên, các mô hình hiện tại không thể giải mã những dấu vết này thành một bản tường thuật rõ ràng về những gì chúng đã học được. Để giải quyết vấn đề này, chúng tôi giới thiệu \textit{Imprint Reader}, một mô hình được huấn luyện bằng \textit{Semantic Mount-and-Read Tuning} (SaRT) để mô tả các cập nhật trọng số đã đóng băng. SMaRT gắn từng bản cập nhật lên Reader và sử dụng một truy vấn meta không cần neo (anchor-free meta-query) để gợi ra mô tả bằng ngôn ngữ tự nhiên, trong khi các kiểm soát không thay đổi và nhiễu ngẫu nhiên giúp ngăn chặn các tuyên bố thiếu căn cứ. Trên các bản cập nhật chưa từng thấy, Reader kết hợp đạt được Pass@100 dựa trên đánh giá là $2\%$ cho kiến thức và $16\%$ cho hành vi. Những kết quả này chứng minh tính khả thi của việc đọc dữ liệu bằng ngôn ngữ tự nhiên, đồng thời chỉ ra độ tin cậy trên các bản cập nhật là bước tiếp theo cần thực hiện. Ngoài việc tạo văn bản tự do, Reader còn cung cấp một đại diện khả vi cho khoảng cách giữa hành vi mục tiêu được chỉ định và một bản cập nhật trọng số ứng viên. Các gradient căn chỉnh tọa độ của nó hỗ trợ can thiệp thông qua MetaEdit. Ở tỷ lệ cắt tỉa $0.5\%$, việc lựa chọn có hướng dẫn từ Reader giúp tăng tỷ lệ từ chối các câu lệnh độc hại từ $57.9\%$ lên $64.1\%$ theo mục tiêu duy trì an toàn. Sử dụng các mô tả hành vi mà không cần dữ liệu huấn luyện tác vụ mục tiêu, MetaEdit làm tăng tần suất quay lui và các biểu thức mục tiêu phụ trong các dấu vết suy luận toán học, đồng thời nâng BFCL Overall từ $41.69\%$ lên $44.60\%$.
| Chủ đề: | Trí tuệ nhân tạo (cs.AI) |
| Trích dẫn là: | arXiv:2609.35261 [cs.AI] |
| (hoặc arXiv:2609.35261v1 [cs.AI] cho phiên bản này) | |
| https://doi.org/10.48550/arXiv.2609.35261 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký) |
Lịch sử gửi bài
Từ: Guanxu Chen [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 14:21:00 UTC (525 KB)
Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.