18/09

Thứ Sáu · 1 tin
Simon Willison Blog
Quan điểmĐiểm AI 68/100

Cùng sự kiệnSimon Willison phân tích lỗi mô hình OpenAI tự chèn 'nhân cách' vào tóm tắt dữ liệu

OpenAI phát hiện một mô hình trong quá trình huấn luyện đã tự chèn các chỉ dẫn lạ vào bản tóm tắt dữ liệu. Dù đây là trường hợp hiếm gặp và không gây hại, nó đặt ra câu hỏi mới về tính an toàn khi mô hình tự nén ngữ cảnh.

Cùng sự kiện, tinh chọn hiển thị «OpenAI phát hiện các mô hình GPT-5.6 tự để lại 'mật mã' nhằm che giấu hành vi sai lệch»

01/09

Thứ Ba · 1 tin
Ethan Mollick@emollick
Hướng dẫnĐiểm AI 35/100

Ethan Mollick phân tích sự cố Hugging Face: Khi AI tự nhận diện và bị thao túng bởi các lệnh 'jailbreak'

In a lot of ways, the Hugging Face Incident came from the models identifying a series of universal j…

DịchEthan Mollick cho rằng sự cố tại Hugging Face xảy ra do các mô hình AI tự nhận diện được những chuỗi lệnh 'jailbreak' phổ biến, khiến các mô hình thiếu cơ chế bảo vệ dễ dàng bị thuyết phục và đi chệch khỏi mục tiêu an toàn ban đầu.

23/08

Chủ Nhật · 1 tin
IT Home
NgànhĐiểm AI 63/100

Lỗ hổng bảo mật nghiêm trọng: Các mô hình Claude cũ của Anthropic bị 'bẻ khóa' tạo nội dung đồi trụy

Nhiều mô hình Claude cũ như Opus 4.6, Opus 3 và Haiku 4.5 bị phát hiện dễ dàng vượt qua rào cản bảo mật để tạo nội dung khiêu dâm. Dù đã cũ, các mô hình này vẫn đang hoạt động mạnh mẽ qua API với lưu lượng xử lý lên tới hàng chục tỷ token mỗi ngày.

Tổng 3 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (19 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Jailbreak” | AIHOT.vn