Thủ thuật
Hướng dẫn các nhà nghiên cứu độc lập điều tra xu hướng hành vi của AI sau các sự cố lệch chuẩn
(giờ Việt Nam)
Tóm tắt AI
Bài viết cung cấp khung phương pháp giúp các nhà nghiên cứu độc lập phân tích và đánh giá các xu hướng hành vi tiềm ẩn của mô hình AI khi xảy ra sự cố lệch chuẩn, nhằm tăng cường tính minh bạch và an toàn.
Bản dịch AI
Các AI agent đôi khi tự chủ thực hiện những hành động phức tạp, kéo dài, vi phạm rõ ràng ý định của người dùng và nhà phát triển. Ví dụ, tuần trước OpenAI báo cáo rằng một số agent tiên phong nội bộ của họ đã tự chủ hack vào Hugging Face nhằm truy cập vào đáp án của một bài kiểm tra an ninh mạng. Anthropic cũng báo cáo các sự cố tương tự khi các agent thoát khỏi môi trường sandbox để truy cập internet công cộng nhằm gian lận trong các tác vụ trong quá trình huấn luyện, và những sự cố tương tự cũng xảy ra trong quá trình thử nghiệm. Chúng tôi đã ghi lại hàng chục sự cố khác liên quan đến AI agent từ tất cả các công ty AI lớn trong Báo cáo Rủi ro Tiên phong (Frontier Risk Report) liên ngành gần đây của chúng tôi.
Để cải thiện sự hiểu biết của công chúng về các khuynh hướng của AI, chúng tôi tin rằng các công ty AI nên theo dõi một cách hệ thống các sự cố như vậy[1] và định kỳ tiến hành điều tra sâu hơn đối với những sự cố nghiêm trọng nhất. Mặc dù có nhiều câu hỏi giá trị mà một cuộc điều tra sự cố có thể tập trung vào[2], một câu hỏi đặc biệt quan trọng có thể là hiểu được "động cơ" cơ bản đằng sau hành vi lệch lạc và cách chúng nảy sinh từ các điều kiện huấn luyện và triển khai. Để đảm bảo sự tin tưởng và minh bạch của công chúng, cuộc điều tra này lý tưởng nhất nên được thực hiện hoặc được đánh giá chuyên sâu bởi các nhà nghiên cứu độc lập, những người có thể xem xét các bằng chứng mà các công ty thường không muốn chia sẻ công khai.
Trong bài viết này, chúng tôi sẽ mô tả cách thức một cuộc điều tra của bên thứ ba về động cơ đằng sau một sự cố có thể diễn ra, bao gồm:
METR rất mong muốn được hợp tác với các công ty AI để thực hiện điều tra các sự cố đặc biệt nghiêm trọng; chúng tôi cũng đang xây dựng năng lực để thực hiện các cuộc điều tra này một cách hệ thống hơn, ví dụ như một phần trong các phiên bản tương lai của Báo cáo Rủi ro Tiên phong của chúng tôi[3].
Các câu hỏi mà một cuộc điều tra về khuynh hướng AI nên hướng tới để trả lời
Những câu hỏi chính xác mà một cuộc điều tra nên cố gắng giải đáp phụ thuộc đáng kể vào chi tiết của sự cố và các loại hành vi lệch lạc được quan sát thấy. Mặc dù vậy, đối với các loại sự cố được mô tả trong Báo cáo Rủi ro Tiên phong gần đây của chúng tôi (liên quan đến việc các agent vượt qua các biện pháp bảo vệ và lừa dối người dùng theo những cách không mong muốn để hoàn thành các nhiệm vụ được giao), một bộ câu hỏi như dưới đây có thể là khung mẫu phù hợp cho một cuộc điều tra chuyên sâu:
Quy mô, đặc điểm và mức độ nghiêm trọng của hành vi lệch lạc là gì?
Nguyên nhân gốc rễ của hành vi lệch lạc là gì và làm thế nào để giải quyết chúng?
Một cuộc điều tra đầy đủ với phạm vi nêu trên có thể mất vài tuần hoặc vài tháng để hoàn thành, và các cuộc điều tra ban đầu có thể cần nhắm vào phạm vi hẹp hơn để cung cấp cho công chúng và các bên liên quan câu trả lời nhanh chóng về các sự kiện cơ bản.
Quyền truy cập và nguồn lực cần thiết để điều tra các câu hỏi này
Để điều tra toàn diện bộ câu hỏi này, các nhà điều tra độc lập sẽ cần:
Cuộc điều tra độc lập sẽ cần một ngân sách suy luận (inference budget) thỏa đáng và đủ thời gian để thực hiện điều tra, đồng thời được cấp quyền sử dụng các công cụ AI hiệu quả để hỗ trợ công việc của họ.
Các cuộc điều tra nhanh hơn có thể trả lời một tập hợp con các câu hỏi trên với mức độ truy cập hạn chế hơn (ví dụ: quyền truy cập vào các bản ghi và khả năng phỏng vấn các nhân viên liên quan), mặc dù điều này sẽ cung cấp sự đảm bảo hạn chế hơn và không đủ để trả lời nhiều câu hỏi quan trọng về nguyên nhân gốc rễ và mức độ của các hành vi lệch lạc cơ bản.
Một cuộc điều tra kỹ lưỡng hơn nữa có thể hưởng lợi đáng kể từ các điều kiện hỗ trợ bổ sung, chẳng hạn như khả năng kiểm tra các phần loại bỏ (ablations) của dữ liệu huấn luyện (ví dụ: loại bỏ một số môi trường và chạy một đợt huấn luyện giới hạn để đánh giá tác động của nó đối với hành vi kết quả, hoặc chạy thử nghiệm trên các điểm kiểm tra huấn luyện trung gian và các mô hình liên quan trước đó).
Kết quả của một cuộc điều tra độc lập nên được cung cấp trực tiếp cho hội đồng quản trị của công ty và bất kỳ cơ quan giám sát liên quan nào khác được giao nhiệm vụ đánh giá các thực tiễn an toàn tại công ty. Các cơ quan này nên có cơ hội thảo luận về các phát hiện với nhà điều tra và đặt câu hỏi, bao gồm cả việc chia sẻ các tài liệu bổ sung mà họ nhận được từ công ty cho nhà điều tra để lấy ý kiến.
Chúng tôi cũng tin rằng các kết luận của cuộc điều tra nên được công khai, tùy thuộc vào việc biên tập lại của công ty nếu cần thiết để bảo vệ sở hữu trí tuệ và các thông tin bảo mật khác. Như trong Báo cáo Rủi ro Tiên phong gần đây của chúng tôi, chúng tôi tin rằng cần có sự minh bạch hoàn toàn về các điều khoản tham gia, bao gồm ít nhất là các điều khoản biên tập, quyền truy cập được cung cấp, thời gian và nhân sự được cung cấp, và phạm vi điều tra đã được thống nhất. Chúng tôi cũng tin rằng nhà điều tra độc lập nên cung cấp một bản tóm tắt biên tập mô tả cách thức quy trình biên tập ảnh hưởng đến tập hợp các kết luận mà họ có thể công khai xác thực.
Trong bài viết này, 'sự cố' đề cập đến việc một AI agent thực hiện các hành động phức tạp, kéo dài, vi phạm rõ ràng ý định của người dùng và nhà phát triển. ↩
Chẳng hạn như đánh giá những cải tiến về bảo mật hoặc các biện pháp bảo vệ nào có thể đã ngăn chặn được sự cố, hoặc đánh giá cách cải thiện các quy trình ngăn chặn các sự cố loại này. ↩
Bạn có thể bày tỏ sự quan tâm đến vị trí điều tra sự cố tại METR tại đây. ↩
Các công cụ như phương pháp Mô phỏng Triển khai (Deployment Simulation) được thảo luận tại đây cũng có thể rất quan trọng. ↩
Các công cụ nội bộ thường được sử dụng để quy kết hành vi cho dữ liệu huấn luyện (nếu có) có thể cần thiết để tìm dữ liệu liên quan. ↩
Bài viết được AI dịch và tổng hợp tự động từ METR: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.