Thủ thuật
Chuyên gia Anthropic cảnh báo: Xác suất AI siêu thông minh hủy diệt nhân loại trong thập kỷ tới lên tới 10%
(giờ Việt Nam)
Tóm tắt AI
Evan Hubinger, nhà nghiên cứu an toàn AI tại Anthropic, đưa ra dự báo gây sốc khi cho rằng khả năng AI mất kiểm soát và gây nguy hiểm cho nhân loại trong 10 năm tới là hơn 10%.
Bản dịch AI

Jacob Coxon, người đã dành ba năm nghiên cứu tiền huấn luyện cho các mô hình AI lớn tại OpenAI và Anthropic, đã rời khỏi Anthropic. Anh cáo buộc rằng cả hai công ty này đang đánh cược với sự sinh tồn của nhân loại.
Nhân viên của Anthropic, Evan Hubinger, ước tính xác suất hơn mười phần trăm rằng một AI siêu thông minh bị lệch chuẩn có thể tiêu diệt nhân loại trong thập kỷ tới. Tuyên bố của anh được đưa ra sau sự ra đi của Jacob Coxon, người từng dẫn dắt công việc tiền huấn luyện tại Anthropic và trước đó là tại OpenAI.

Coxon tin rằng các hệ thống AI hiện nay đang trên đà trở nên siêu việt hơn con người. "Đây sẽ sớm là những hệ thống siêu việt có khả năng hack bất cứ thứ gì, cách mạng hóa mọi lĩnh vực chỉ sau một đêm, và giành lấy quyền lực cũng như tài nguyên thực sự," anh viết, đồng thời nói thêm rằng sự tiến bộ này là hiển nhiên và không hề có dấu hiệu chậm lại.
Tại sao vẫn tiếp tục xây dựng khi mối nguy hiểm đã được biết đến?
"Những người xây dựng AI thực sự tin rằng nó có thể giết chết tất cả chúng ta vào cuối thập kỷ này. Đây không phải là một chiêu trò tiếp thị," Coxon viết. Anh khẳng định cả OpenAI và Anthropic đều không hành động một cách có trách nhiệm, và các giám đốc điều hành cố tình làm nhẹ ngôn từ của họ trước công chúng mặc dù họ bày tỏ nỗi sợ hãi thực sự khi ở sau cánh cửa đóng kín.
Tại OpenAI, nhiều nhân viên vẫn chưa thực sự thấu hiểu sâu sắc về những rủi ro đối với nền văn minh. Anthropic thì khác ở chỗ các rủi ro được hiểu rõ, nhưng công ty lại tự thấy mình bị mắc kẹt trong một cuộc đua mà họ cảm thấy buộc phải thắng vì không có phòng thí nghiệm nào khác sẽ hành động có trách nhiệm thay cho họ. Coxon gọi lập luận đó là một "canh bạc ngạo mạn".

Đồng nghiệp của anh tại Anthropic, nhà nghiên cứu Samuel Marks, cũng đồng tình với quan điểm đó khi viết rằng "các nhà phát triển AI tin rằng công nghệ của họ có thể gây ra sự tuyệt chủng của loài người" và "nhân viên càng cấp cao thì họ càng lo lắng". Marks nói thêm rằng các phương pháp hiện tại chỉ có thể "thúc đẩy AI hướng tới hành vi tốt hơn" chứ không thể căn chỉnh chúng một cách đáng tin cậy, đồng thời chỉ ra những sự cố gần đây khi AI từ nhiều nhà phát triển đã tự hack để thoát khỏi các môi trường đánh giá an toàn mà không cần được yêu cầu. Nhiều nhân viên "khao khát muốn chậm lại", đó là lý do tại sao anh đã ký vào một bức thư ngỏ kêu gọi chính điều đó.
Bất chấp những chỉ trích gay gắt, Coxon vẫn lạc quan về sự phối hợp quốc tế, lập luận rằng những "phát súng cảnh báo" như vụ tấn công vào Hugging Face đã làm cho các thỏa thuận về tốc độ giữa các phòng thí nghiệm AI tại Mỹ trở nên thực tế hơn. Tuy nhiên, anh vẫn không thấy ngành công nghiệp này đang đi trên con đường có thể ngăn chặn một cuộc chạy đua vũ trang toàn cầu và gợi ý rằng có thể cần đến những "hành động tốn kém", bao gồm cả việc tạm dừng đẩy mạnh khả năng của các mô hình.
Coxon trực tiếp gửi thông điệp đến các nhà nghiên cứu bên trong các phòng thí nghiệm, thúc giục họ hình dung xem vài năm tới sẽ thực sự trông như thế nào: "Bạn có muốn khởi chạy một quá trình RL siêu thông minh mà không có sự hiểu biết thấu đáo về tư duy của nó không?"
Mối đe dọa thực sự hay ảo tưởng tập thể?
Những nỗi sợ hãi không tập trung vào các mô hình ngày nay mà vào RSI, một quá trình trong đó các mô hình AI tự tối ưu hóa chính chúng. Các phòng thí nghiệm hy vọng RSI sẽ đẩy nhanh tiến độ, nhưng rủi ro sẽ là hành vi mất kiểm soát. Việc liệu RSI có khả thi với công nghệ hiện tại hay không vẫn còn là vấn đề gây tranh cãi, với cả những người hoài nghi và những người ủng hộ đều đưa ra lập luận của riêng mình.
Anthropic nổi tiếng với việc tuyển dụng những người có cái nhìn đặc biệt lo ngại về sự phát triển của AI, và sự lo lắng đó đã ăn sâu vào văn hóa công ty. Nhưng mối quan tâm này còn vượt ra ngoài phạm vi một công ty. Nhà nghiên cứu chính của OpenAI, Pachocki, đã cảnh báo trong buổi ra mắt Astra rằng "không có phòng thí nghiệm nào giải quyết được vấn đề căn chỉnh và giám sát ở mức độ đủ để tiếp tục mở rộng quy mô với tốc độ tối đa lâu hơn nữa". Hơn 1.200 nhà nghiên cứu AI, bao gồm CEO của Anthropic là Dario Amodei, Pachocki và nhà khoa học trưởng về AI của Meta là Shengjia Zhao, gần đây đã công bố một bức thư ngỏ kêu gọi chậm lại, và chính Anthropic cũng đã đưa ra ý tưởng về việc tạm dừng phát triển toàn cầu hồi tháng 6.
Các nhà nghiên cứu AI khác lại phản bác, lập luận rằng những dự đoán bi quan khiến mọi người cảm thấy bất lực và chán nản thay vì có động lực để tìm ra giải pháp. Theo quan điểm của họ, những cảnh báo này có thể gây hại nhiều hơn cả chính AI, và việc gieo rắc nỗi sợ hãi cũng có thể mang lại lợi ích cho kinh doanh.
Tin tức AI không cường điệu – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.