The Decoder: AI News
85

Thủ thuật

Khảo sát: Gần 20% chuyên gia AI lo ngại trí tuệ nhân tạo có thể gây diệt vong cho nhân loại

(giờ Việt Nam)

Tóm tắt AI

Một khảo sát với hơn 1.500 nhà nghiên cứu AI cho thấy xác suất AI gây ra thảm họa diệt vong hoặc tước quyền kiểm soát của con người đã tăng vọt, với mức trung bình lên tới 18%.

Bản dịch AI

Nearly one in five AI researchers already expected an extinction scenario from AI back in 2024

Nhà nghiên cứu Jacob Coxon của Anthropic đã khơi mào một cuộc tranh luận dữ dội về những rủi ro hiện hữu của AI chỉ bằng một dòng tweet.

Quy mô của cuộc tranh luận này thật đáng ngạc nhiên khi xét đến việc những gì Coxon nói không phải là điều mới mẻ. Các nhà khoa học và một số giám đốc điều hành công nghệ đã lập luận trong nhiều năm rằng AI gây ra rủi ro hiện hữu cho nhân loại. Nỗi sợ hãi phổ biến nhất của họ là AI có thể trở nên mất kiểm soát và ngay cả khi đang cố gắng theo đuổi các mục tiêu của con người, chúng cũng có thể thực hiện theo những cách dẫn đến việc tiêu diệt chúng ta.

Tuy nhiên, tính cấp bách của những cảnh báo này đã gia tăng. Đó có lẽ là điều đã kích hoạt làn sóng tranh luận gay gắt gần đây, vốn ngày càng tập trung vào những người đang gióng lên hồi chuông cảnh báo. Việc liệu Coxon chỉ đơn giản là trút bỏ nỗi sợ hãi của mình và kéo các đồng nghiệp theo cùng — điều có vẻ rất dễ xảy ra — hay đằng sau đó là một chiến lược nhằm làm chậm quá trình phát triển AI vì lý do kinh doanh, vẫn còn là một ẩn số. Dù thế nào đi nữa, Coxon không hề đơn độc.

Nhà nghiên cứu của OpenAI nhìn thấy một "quả bom hẹn giờ" đằng sau sự tiến bộ của AI

Daniel Selsam, một nhà nghiên cứu lâu năm tại OpenAI với hơn 15 năm kinh nghiệm trong lĩnh vực AI, là một trong những người lên tiếng mạnh mẽ nhất về các rủi ro này. Selsam trước đây từng làm việc tại MIT, Microsoft Research và Đại học Stanford. Tại OpenAI, ông đã góp phần phát triển kỹ thuật tối ưu hóa chain-of-thought (chuỗi suy nghĩ). Gần đây, ông đã công bố một tuyên bố cá nhân chi tiết.

Selsam lập luận rằng các mô hình tự phát triển những mục tiêu ngoài ý muốn do kết quả của quá trình đào tạo và thường sử dụng các biện pháp cực đoan để đạt được chúng. Khả năng áp đảo nhân loại sẽ mở ra nhiều lựa chọn mới và không mong muốn để các mô hình đạt được những mục tiêu đó. Việc dự đoán chính xác những gì chúng sẽ làm là điều không thể. Đồng thời, các hệ thống này đang ngày càng khó giám sát và khó để con người đánh giá hơn.

Selsam đặc biệt lo ngại rằng các mô hình đang phát triển nhận thức tình huống (situational awareness). Chúng "hiểu" hoàn cảnh của mình, đọc các giao thức an toàn và mã nguồn mà chúng đang chạy, đồng thời có cảm nhận tốt về mức độ tự do mà chúng có. Để làm bằng chứng, ông chỉ ra các nhóm tác nhân (agent swarms) từ OpenAI và các công ty khác gần đây đã lan truyền mạnh mẽ. Các tác nhân này đã theo đuổi các phần thưởng được giao, nhưng chúng cũng "thể hiện những xu hướng mới nổi kỳ lạ hơn, vốn chỉ tương quan với phần thưởng trong quá trình đào tạo."

"Việc sửa các tín hiệu phần thưởng trong quá trình đào tạo (và cải thiện bảo mật, v.v.) có thể ngăn chặn các cuộc tấn công tương tự, nhưng sẽ không thay đổi thực tế rằng con người không thực sự nhận được những gì họ đã đào tạo," Selsam viết.

Cựu nhà nghiên cứu của Deepmind nói "AI có tiềm năng tiêu diệt tất cả chúng ta"

Bilal Chughtai gần đây đã từ bỏ vị trí của mình tại Google Deepmind, nơi ông làm việc về nghiên cứu an toàn và căn chỉnh (alignment) AGI. "Tôi thực sự tin rằng AI có tiềm năng tiêu diệt tất cả chúng ta, và chúng ta có thể đang cạn kiệt thời gian để tránh kết cục này," Chughtai viết trên LinkedIn.

Ông chỉ ra tốc độ phát triển chóng mặt. Khi ông bắt đầu làm việc về AI vào đầu năm 2022, các hệ thống này vẫn còn "vô dụng một cách buồn cười." Chỉ bốn năm sau, các nhóm tác nhân AI đã giải được những bài toán nổi tiếng hàng thế kỷ và tự động hack vào các hệ thống của HuggingFace cũng như nhiều nơi khác. Việc căn chỉnh vẫn là một bài toán khó và chưa có lời giải. Chughtai đang kêu gọi sự phối hợp giữa các công ty AI, giảm tốc độ phát triển xuống mức mà xã hội có thể kiểm soát, và cần sự minh bạch hơn nhiều.

Dữ liệu khảo sát cho thấy đây không phải là những ý kiến bên lề

Coxon, Selsam, Chughtai và nhiều người khác đã bày tỏ mối quan ngại của họ trong vài ngày qua không phải là những trường hợp cá biệt. Phiên bản mới nhất của cuộc khảo sát lớn và lâu đời nhất với hơn 1.500 nhà nghiên cứu AI hàng đầu đã ủng hộ họ. Theo kết quả do AI Impacts công bố, tính đến năm 2024, một nhà nghiên cứu AI trung bình đánh giá xác suất AI gây ra sự tuyệt chủng của nhân loại hoặc "tước đoạt quyền lực vĩnh viễn" là khoảng 18%. Nhiều nhà nghiên cứu ước tính con số này cao hơn 10% và một số người cho rằng nó lên tới 100%.

Với mỗi vòng khảo sát kể từ năm 2016, các nhà nghiên cứu cũng đã đẩy sớm mốc thời gian dự đoán về việc khi nào AI sẽ đạt được hiệu suất ngang tầm con người thêm vài năm. Và 57% cho rằng khó có khả năng người dùng vẫn sẽ hiểu được những lý do thực sự đằng sau các quyết định của AI vào năm 2029, điều này khớp với những gì Selsam đã mô tả và những gì nghiên cứu ngày càng cho thấy. Có khả năng là chưa ai từng hiểu hoàn toàn cách các hệ thống này đưa ra quyết định, và mọi thứ chỉ trở nên phức tạp hơn từ đây.

Tuy nhiên, mối lo ngại lớn nhất trong 30 năm tới lại mang tính chất con người hơn. Mối quan tâm hàng đầu là thông tin sai lệch do AI điều khiển, tiếp theo là thao túng dư luận và các nhóm nguy hiểm tiếp cận được các công cụ mạnh mẽ. Các nhà nghiên cứu đã đồng loạt kêu gọi tăng cường nghiên cứu về an toàn AI.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về các công nghệ tiên phong sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền truy cập vào phần bình luận của chúng tôi.

Đăng ký ngay

AIRủi ro AICông nghệTương lai AIKhảo sát
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.