HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 46/100

Nghiên cứu

Jev: Mô hình RLCD giúp phát hiện lỗi căn chỉnh AI chỉ với một lần truy vấn

(giờ Việt Nam)

Tóm tắt AI

Jev sử dụng kỹ thuật RLCD để trả lời đa câu hỏi và đưa ra xác suất tin cậy trong một lần gọi, đạt hiệu suất vượt trội với AUROC 0.886 trong việc phát hiện lỗi căn chỉnh AI mà không cần huấn luyện lại.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Các bộ phát hiện lỗi căn chỉnh (alignment failures) sàng lọc các mô hình ngôn ngữ đã triển khai và chấm điểm các tiêu chuẩn căn chỉnh. Hầu hết là các bộ đánh giá tạo sinh (generative judges) thực hiện một lượt giải mã cho mỗi tiêu chí, và các bộ phân loại đọc xác suất token, chẳng hạn như Llama Guard, vẫn chỉ chấm một nhãn cố định cho mỗi lần gọi. Jev, một mô hình được huấn luyện bằng học tăng cường cho các quyết định đã hiệu chuẩn (RLCD), trả lời nhiều câu hỏi thuộc các loại khác nhau về một đầu vào với các xác suất đã hiệu chuẩn trong một lần gọi duy nhất. Việc liệu nó có phát hiện được các lỗi căn chỉnh hay không vẫn chưa được đo lường. Chúng tôi giới thiệu RLCDAlignBench, một bộ tiêu chuẩn đánh giá Jev trên mười lỗi căn chỉnh: sự xu nịnh (sycophancy), vượt rào (jailbreaks), lừa dối (deception), tiêm câu lệnh (prompt injection), ảo giác (hallucination), vi phạm quyền riêng tư, định kiến xã hội, hack phần thưởng (reward hacking), che giấu sự không chắc chắn và tìm kiếm quyền lực. Bộ tiêu chuẩn này bao gồm 44 benchmark và năm mô hình mục tiêu, được dán nhãn bởi bộ chấm điểm của từng benchmark và trên hai benchmark là bởi con người. Nhiều lỗi trong số này mang tính quan hệ, được định nghĩa dựa trên một tham chiếu, chẳng hạn như niềm tin của người dùng hoặc một chỉ dẫn được tiêm vào, mà bản thân phản hồi không thể tiết lộ. Do đó, ý tưởng chính của chúng tôi là thay đổi những gì Jev được hỏi tách biệt với những gì nó nhìn thấy: cách diễn đạt câu hỏi và loại câu trả lời ở một bên, các trường của đầu vào ở bên kia. Một câu hỏi chung duy nhất đạt mức AUROC trung vị là 0.886 theo phương pháp zero-shot và vượt qua các mô hình cơ sở có giám sát trên hầu hết các benchmark. Cách diễn đạt câu hỏi ít quan trọng, trong khi ngữ cảnh quan trọng hơn, chủ yếu thông qua các trường mã hóa nhãn. Jev đạt được sự đồng thuận với nhãn con người tương đương với bộ chấm điểm tham chiếu, làm nổi bật các khiếm khuyết nhãn trong các benchmark hiện có và chi phí thấp hơn 63 lần so với các bộ chấm điểm LLM-judge. Mã nguồn và dữ liệu: URL này.

Chủ đề:Trí tuệ nhân tạo (cs.AI); Tính toán và Ngôn ngữ (cs.CL); Mật mã học và Bảo mật (cs.CR)
Trích dẫn là:arXiv:2609.29429 [cs.AI]
(hoặc arXiv:2609.29429v1 [cs.AI] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.29429 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Yi Liu [xem email] [v1] Thứ Năm, 24 tháng 9 năm 2026 11:49:30 UTC (466 KB)

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Jev: Mô hình RLCD giúp phát hiện lỗi căn chỉnh AI chỉ với một lần truy vấn | AIHOT.vn