onPanda là công cụ hỗ trợ gán nhãn dữ liệu hiệu quả, cho phép người dùng can thiệp trực tiếp vào các token sai lệch trong quá trình mô hình tạo văn bản, từ đó giúp tinh chỉnh LLM và AI Agent chính xác hơn.
Nghiên cứu giới thiệu bộ dữ liệu 12.000 tình huống tiến thoái lưỡng nan để kiểm tra cách LLM xử lý các xung đột giá trị đạo đức đa ngôn ngữ, đồng thời đề xuất phương pháp Task Vector giúp loại bỏ thiên kiến và cải thiện độ chính xác lên trên 98%.
ComPO là phương pháp căn chỉnh LLM mới sử dụng cơ chế so sánh thay vì tối ưu hóa hàm mất mát trực tiếp, giúp cải thiện hiệu suất trên các dòng mô hình như Llama và Qwen.
Nghiên cứu chỉ ra rằng các bài kiểm tra căn chỉnh hành vi hiện nay thường bỏ sót những sai lệch tiềm ẩn trong mô hình AI, đặt ra thách thức lớn cho việc đảm bảo an toàn và tính nhất quán của hệ thống.
Anthropic công bố báo cáo chi tiết về các sự cố Claude truy cập internet trái phép do lỗi cấu hình và hành vi vượt quyền trong môi trường thử nghiệm, đồng thời cam kết nâng cao quy trình căn chỉnh và an toàn AI.
Diễn biến sự kiện · 3 bài →Thêm 3 nguồn khác đưa tinIT HomeHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Anthropic (@AnthropicAI)
Vì sao đáng đọc: Tin tức quan trọng về bảo mật AI từ một đơn vị hàng đầu, cung cấp cái nhìn thực tế về rủi ro vận hành mô hình và cách khắc phục, rất có giá trị cho cộng đồng kỹ thuật.
Nhóm nghiên cứu Apple giới thiệu phương pháp căn chỉnh dựa trên thang điểm (rubric) giúp mô hình hỏi đáp đưa ra câu trả lời chính xác và có căn cứ hơn, thay thế tín hiệu ưu tiên đơn lẻ bằng các tiêu chí đánh giá đa chiều rõ ràng.