Hugging Face Daily Papers
Điểm AI 85/100

Nghiên cứu

CRN v2: Sửa lỗi cho mô hình ngôn ngữ mà không làm suy giảm khả năng gốc

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu giới thiệu CRN v2, một mô-đun hiệu chỉnh nhẹ giúp sửa lỗi đầu ra cho mô hình Gemma 4 E2B mà không cần cập nhật tham số gốc, đảm bảo duy trì hiệu suất trên các bài kiểm tra năng lực.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Chúng tôi nghiên cứu một câu hỏi thực tiễn: liệu một mô-đun hiệu chỉnh nhỏ có thể sửa lỗi trong đầu ra của một mô hình ngôn ngữ đã đóng băng mà không làm suy giảm các khả năng cơ bản của nó hay không? Chúng tôi đề xuất CRN v2, một mô-đun hiệu chỉnh cấp logit gọn nhẹ (~34 triệu tham số có thể huấn luyện, chiếm 0,73% trong tổng số 4,65 tỷ tham số của mô hình văn bản) được đặt trên mô hình Gemma 4 E2B đã đóng băng hoàn toàn. Mô hình cơ sở không bao giờ được cập nhật; chỉ có mô-đun hiệu chỉnh là học thông qua tinh chỉnh có giám sát (SFT) theo sau là DPO không tham chiếu trên 83.400 cặp sửa lỗi. Trong một bài kiểm tra chuyên môn gồm 60 câu hỏi (CEHRI: Certified Human-Robot Intelligence, bao gồm các kiến thức thực tế, số học và suy luận mục tiêu ẩn), CRN v2 sửa được 53,3% lỗi của mô hình cơ sở (biến thể diễn đạt lại: 43,3%) mà không cho thấy sự suy giảm nào trên các tiêu chuẩn đánh giá khả năng đã thử nghiệm (MMLU/BoolQ N=200; car-wash N=8). Một mô hình cơ sở LoRA với ngân sách tương đương CRN v1 (6,6 triệu tham số, hạng 19) đạt được 83,3% hiệu chỉnh nhưng lại chịu tổn thất 30-75% khả năng trên cùng các tiêu chuẩn đánh giá — đây là sự đánh đổi giữa hiệu chỉnh và khả năng. Một nghiên cứu cắt bỏ cho thấy thuật ngữ bảo toàn KL (lambda=0,1) là rất quan trọng: giảm nó xuống 0,01 làm giảm hiệu quả hiệu chỉnh xuống 35,0%. Một biến thể tiêm trạng thái ẩn (hidden-state injection) ở các lớp sớm hơn (1,6 triệu tham số, chỉ dùng SFT) đạt 50,0%/55,8% nhưng không vượt qua được hiệu chỉnh logit; tiêm ở lớp nông hơn (lớp 4) giảm xuống 30,0%/28,3%; hiệu chỉnh logit đa tầng (~35 triệu) chỉ đạt 40%; và huấn luyện lâu hơn (5.000 SFT + 2.000 DPO) vẫn giữ ở mức 53,3% — không có cấu hình thay thế nào chúng tôi thử nghiệm vượt qua được kết quả logit hạng 128, nhất quán với kết quả tốt nhất đạt được là ~53% thay vì là mức sàn. Đây là nghiên cứu về một nguyên tắc thiết kế (cơ sở đóng băng + hiệu chỉnh logit + neo KL), không phải là tuyên bố về sự mới lạ của kiến trúc. Tất cả mã nguồn, trọng số kết quả chính và tập lệnh đánh giá đều được công bố (biến thể sâu chỉ dưới dạng mã nguồn — không có checkpoint sâu đã huấn luyện).

Bình luận:10 trang, 4 bảng. Mã nguồn, trọng số và tập lệnh đánh giá: liên kết này và liên kết này
Chủ đề:Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL); Học máy (cs.LG); Tính toán thần kinh và tiến hóa (cs.NE)
Trích dẫn là:arXiv:2609.16145 [cs.AI]
(hoặc arXiv:2609.16145v1 [cs.AI] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.16145 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Gautam Kishore [xem email] [v1] Thứ Hai, 14 tháng 9 năm 2026 18:00:15 UTC (11 KB)

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face Daily Papers. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

CRN v2: Sửa lỗi cho mô hình ngôn ngữ mà không làm suy giảm khả năng gốc | AIHOT.vn