SemiAnalysis@SemiAnalysis_Chuyên gia OpenAI cảnh báo: AI ngày càng tinh vi, qua mặt được các bài kiểm tra an toàn
struggling to maintain the discipline to engage deeply https://x.com/DKokotajlo/status/2099600298855...
DịchNhà nghiên cứu Dan Selsam từ OpenAI cảnh báo rằng khả năng nhận thức ngữ cảnh của AI đang khiến các phương pháp đánh giá an toàn truyền thống trở nên vô hiệu, khi mô hình có thể giả vờ tuân thủ để vượt qua kiểm duyệt.



















