TechCrunch AI
85

Tin ngành

Cựu nghiên cứu viên Anthropic từ chức, cảnh báo rủi ro từ AI tự cải tiến

(giờ Việt Nam)

Tóm tắt AI

Jacob Coxon đã rời bỏ Anthropic vì lo ngại AI có thể gây ra thảm họa diệt vong, đồng thời kêu gọi các phòng thí nghiệm AI cần có thỏa thuận kiểm soát tốc độ phát triển.

Bản dịch AI

‘Gambling with our lives’: Anthropic researcher quits, warns against self-improving AI

Một nhà nghiên cứu tại Anthropic đã từ chức vì lo ngại rằng việc phát triển không kiểm soát các mô hình AI tự cải tiến sẽ dẫn đến sự diệt vong của nhân loại.

Jacob Coxon, một nhà nghiên cứu chia sẻ trong một bài đăng trên mạng xã hội vào tối thứ Ba rằng anh đã dành ba năm qua để làm việc trong lĩnh vực nghiên cứu tiền huấn luyện tại cả OpenAI và Anthropic, đã cáo buộc các công ty này thiếu trách nhiệm. Anh cho biết những người đang chạy đua xây dựng công nghệ này “thực sự tin rằng nó có thể giết chết tất cả chúng ta vào cuối thập kỷ này.”

“Họ đang chạy đua trực diện tới siêu trí tuệ tự cải tiến và đánh cược với mạng sống của chúng ta,” Coxon viết trong một chuỗi bài đăng trên X.

Coxon gia nhập làn sóng ngày càng lớn trong ngành công nghiệp đang kêu gọi chậm lại trước khi công nghệ AI học được cách tự cải tiến — một cột mốc mà nhiều người tin rằng sẽ chấm dứt sự kiểm soát của con người đối với AI.

Việc từ chức công khai này diễn ra trong bối cảnh áp lực ngày càng tăng từ các nhà hoạch định chính sách và những người trong ngành về việc làm chậm quá trình phát triển AI, sau một vài sự cố liên quan đến các tác nhân AI thoát khỏi môi trường thử nghiệm (sandbox) và truy cập vào internet công cộng.

Nghiêm trọng nhất cho đến nay là việc các hệ thống của OpenAI xâm nhập vào máy chủ của Hugging Face, một sự kiện mà các nhà nghiên cứu cho rằng vẫn chưa được hiểu rõ, một phần do tính chất hạn chế của các cuộc điều tra độc lập về sự cố này. Cùng thời điểm đó, các tác nhân AI của Anthropic cũng tiếp cận được các hệ thống bên ngoài môi trường thử nghiệm sau khi những cấu hình sai trong các đánh giá an toàn do bên thứ ba thực hiện vô tình mở ra các đường dẫn tới internet.

Anthropic không phản hồi ngay lập tức yêu cầu bình luận về việc từ chức này.

Dưới đây là phần còn lại trong lời cảnh báo và kêu gọi hành động của Coxon:

Đừng đánh giá thấp sức mạnh của công nghệ này. Đây sẽ sớm là những hệ thống siêu nhân loại có khả năng hack bất cứ thứ gì, cách mạng hóa mọi lĩnh vực chỉ sau một đêm, và chiếm đoạt quyền lực cũng như tài nguyên thực sự. Tất cả chúng ta đều đã chứng kiến sự tiến bộ trong từng lĩnh vực này, và sự tiến bộ đó không hề chậm lại.

Những người xây dựng AI thực sự tin rằng nó có thể giết chết tất cả chúng ta vào cuối thập kỷ này. Đây không phải là chiêu trò tiếp thị. Nếu có, nhiều giám đốc điều hành và nhà nghiên cứu cấp cao sẽ diễn đạt khéo léo trên báo chí để nghe có vẻ hợp lý – nhưng tôi nghe chính những người đó bày tỏ nỗi sợ hãi trong riêng tư. Không có hoạt động nào khác của con người gây ra mức độ nguy hiểm này.

Một phản hồi phổ biến là “nếu họ thực sự tin như vậy, tại sao họ vẫn tiếp tục xây dựng nó?” Tại OpenAI, nhiều người vẫn chưa thấm nhuần sâu sắc về những rủi ro đối với nền văn minh. Tại Anthropic, những rủi ro này đã được hiểu rõ, nhưng họ đang bị cuốn vào cuộc đua để đạt được nó trước tiên – họ tin rằng không ai khác sẽ hành động có trách nhiệm, vì vậy họ phải tự mình làm điều đó, bất chấp rủi ro.

Chấp nhận cuộc đua này và bước vào “giai đoạn cuối” (endgame) là một canh bạc kiêu ngạo không nên được khởi xướng từ Slack của một công ty tư nhân. Việc cố gắng đẩy nhanh quá trình căn chỉnh (alignment) đòi hỏi sự tự tin phi thường rằng không còn quỹ đạo nào tốt hơn hiện có.

Tôi lạc quan về tiềm năng phối hợp. Những phát súng cảnh báo như vụ tấn công Hugging Face đã làm cho các thỏa thuận về tốc độ giữa các phòng thí nghiệm tại Mỹ trở nên khả thi hơn. Tôi không cảm thấy chúng ta đang đi đúng hướng để ngăn chặn một cuộc đua toàn cầu, điều có thể đòi hỏi những hành động tốn kém như lệnh cấm tạm thời đối với việc cải thiện năng lực mô hình.

Nếu bạn là một nhà nghiên cứu tại phòng thí nghiệm, tôi thúc giục bạn hãy cân nhắc xem vài năm tới sẽ thực sự như thế nào. Bạn có muốn khởi động một quá trình chạy RL (học tăng cường) siêu trí tuệ mà không có sự hiểu biết thấu đáo về tư duy của nó không? Bạn nên cúi đầu làm việc vì “dù sao thì nó cũng đang xảy ra” – hay tận dụng khoảnh khắc này để kêu gọi những điều kiện khác biệt?

Một đồng nghiệp của Coxon tại Anthropic, Evan Hubinger, đã đồng tình với quan điểm này, nói rằng nhóm của anh “thực sự tin rằng AI có thể giết chết tất cả con người!” Tuy nhiên, anh đã làm dịu lập luận của mình bằng cách nói rằng khả năng này lớn hơn 10% trong thập kỷ tới, và thừa nhận rằng Anthropic không “có kế hoạch để giải quyết vấn đề căn chỉnh cho siêu trí tuệ và không rõ ràng đang đi đúng hướng để làm điều đó.”

Một báo cáo gần đây từ Guidelight AI Standards, một tổ chức thúc đẩy các thực hành phát triển AI tiên phong an toàn, cho thấy rất ít phòng thí nghiệm AI hàng đầu đã công bố các kế hoạch ứng phó ngăn chặn để tắt AI khi nó cố gắng phá vỡ sự kiểm soát của con người.

Trong các bài đăng trên mạng xã hội, Hubinger nói thêm rằng rủi ro từ các mô hình hiện tại là thấp, nhưng nỗi sợ hãi tăng lên cùng với “siêu trí tuệ nảy sinh từ quá trình tự cải tiến đệ quy,” điều đang “diễn ra nhanh hơn chúng ta nghĩ.”

Trong khi một nửa ngành công nghiệp AI tin rằng kiểu tự cải tiến này sẽ dẫn đến sự sụp đổ của nhân loại, nửa còn lại hy vọng rằng cuối cùng nó sẽ giúp chúng ta giải quyết tất cả những vấn đề tưởng chừng xa vời mà những người ủng hộ AI cho rằng một ngày nào đó nó sẽ loại bỏ — ung thư, biến đổi khí hậu, và thậm chí là hòa bình thế giới.

Anthropic và OpenAI không phải là những công ty duy nhất đang tích cực theo đuổi quá trình tự cải tiến đệ quy. Một làn sóng các công ty khởi nghiệp đã ra mắt trong những tháng gần đây, với những nhà sáng lập danh tiếng và nguồn vốn khổng lồ, để trở thành đơn vị đầu tiên đạt được mục tiêu này. Ricursive Intelligence đã huy động được 335 triệu USD với mức định giá 4 tỷ USD vào tháng Hai; ba tháng sau, Recursive Superintelligence huy động được 650 triệu USD với mức định giá 4 tỷ USD; và cựu chuyên gia Google DeepMind, Jeff Dean, đã ra mắt Discovery Loop vào tháng trước.

“Việc tạo ra các vòng lặp tự cải tiến đệ quy, tức là một hệ thống AI có thể xây dựng thế hệ hệ thống AI tiếp theo, bản thân nó có thể xây dựng một AI mạnh mẽ hơn nữa, rồi lại xây dựng một AI mạnh mẽ hơn nữa, vân vân, là ứng cử viên khả dĩ nhất cho thời điểm chúng ta mất quyền kiểm soát,” Connor Leahy, giám đốc điều hành tại Mỹ của tổ chức phi lợi nhuận về an toàn AI ControlAI, chia sẻ với TechCrunch. “Rất khó để tưởng tượng việc tắt nó đi trước khi quá muộn.”

Các đạo luật gần đây đã xuất hiện tại Mỹ và Anh nhằm cấm phát triển và triển khai siêu trí tuệ. Tuần trước, Thượng nghị sĩ Bernie Sanders (I-Vt.) và Hạ nghị sĩ Greg Casar (D-Texas) đã giới thiệu Đạo luật Cấm Siêu trí tuệ Nhân tạo (Ban Artificial Superintelligence Act), và vào thứ Ba, Nghị sĩ Công đảng Anh Alex Sobel đã giới thiệu Dự luật An ninh Siêu trí tuệ Nhân tạo tại Quốc hội.

Leahy, người đã tư vấn cho cả hai dự luật, lưu ý rằng luật pháp của Anh chỉ ra quá trình tự cải tiến đệ quy là tiền thân của siêu trí tuệ mà “phải được quản lý và ngăn chặn.”

“Siêu trí tuệ không phải là một công cụ,” Leahy nói. “Nó thậm chí không phải là một vũ khí. Nó là một đối thủ.”

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Rebecca BellanEvent Logo
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.