Don't Worry About the Vase (Zvi)
85

Tin ngành

Hiệu ứng domino về nỗi lo diệt vong: Những phát ngôn gây sốc từ nội bộ OpenAI, Anthropic và Google

(giờ Việt Nam)

Tóm tắt AI

Tổng hợp các phát ngôn từ nhân viên tại các tập đoàn AI hàng đầu, xác nhận nỗi lo ngại thực tế rằng trí tuệ nhân tạo có thể sớm đe dọa sự tồn vong của nhân loại.

Bản dịch AI

The Extinction Risk Preference Cascade: Quotes

Đây là những trích dẫn từ các nhân viên của OpenAI, Anthropic và Google, đưa ra sau những cảnh báo của Jacob Coxon, trong đó các nhân viên xác nhận rằng họ nghĩ AI có thể sớm tiêu diệt toàn nhân loại.

Nếu có thêm các trích dẫn khác trong tuần tới hoặc khoảng thời gian đó, tôi sẽ cập nhật bài viết này cho phù hợp.

Tomek Korbak (OpenAI): Tôi tham gia cuộc thảo luận này hơi muộn nhưng: từ thời còn ở OpenAI, tôi nhớ Jacob là một nhà nghiên cứu rất sâu sắc và anh ấy vẫn tiếp tục như vậy trong chuỗi thảo luận này. Cả Anthropic và OpenAI đều chưa đi đúng hướng để giải quyết vấn đề căn chỉnh (alignment) ở mức độ đủ để triển khai siêu trí tuệ (superintelligence) và chúng ta cần phải chậm lại.

Vie McCoy (OpenAI): Tôi nghĩ việc điều tiết tốc độ phát triển và đảm bảo sự nâng cấp cho con người là cách duy nhất để chúng ta không bị tiến hóa vượt mặt, đồng thời vẫn giữ được giấc mơ về siêu trí tuệ.

Trong bối cảnh này, tôi thấy có hai con đường trước mắt chúng ta.

Ở con đường thứ nhất, chúng ta chạy đua tới RSI (siêu trí tuệ nhân tạo) mà không đưa sự hưng thịnh và nâng cấp của con người thành một giá trị cốt lõi bên trong các mô hình, và nhìn chung, chúng ta sẽ hoặc là bị bỏ lại phía sau, hoặc phải chịu những tổn thất thảm khốc.

Ở con đường thứ hai, chúng ta thiết lập tốc độ phát triển, tập trung vào việc đưa sự hưng thịnh của con người vào sâu trong tâm trí của các mô hình ngôn ngữ, và đặt ra một chương trình nghiên cứu có chủ đích để cải thiện con người với cùng tốc độ như các mô hình tiên phong (frontier models).

Trong trường hợp này, chúng ta cũng đạt được những tiến bộ đáng kinh ngạc *ngay bây giờ* trong cả khoa học và y học nhờ vào khả năng của các mô hình hiện tại, mà không gặp phải rủi ro tức thời mà việc mở rộng quy mô hơn nữa *rõ ràng sẽ kéo theo*.

RSI chỉ là cách nhanh chóng và thô sơ để chữa ung thư, nhưng nó giống như một khẩu súng săn, không tinh tế và rõ ràng là nguy hiểm khi thực hiện ở trình độ hiểu biết hiện tại của chúng ta. Tôi không thấy lý do gì chúng ta cần phải chạy đua trong những điều kiện này.

Chúng ta không chỉ không có bất kỳ sự đảm bảo nào rằng con người hay trí tuệ mang hình dáng con người sẽ còn quan trọng - thậm chí còn chẳng có một chương trình nghiên cứu mạch lạc nào được đặt ra để thúc đẩy khả năng của con người song hành cùng AI! Kế hoạch của chúng ta có phải chỉ là trao ngọn đuốc của vũ trụ cho máy móc mà không cần xem liệu chúng ta có thể tự làm điều gì đó theo cách của riêng mình hay không? Thay vì từ bỏ quyền tự chủ của mình cho "người trông coi AI" ngụ ý trong "Machines of Loving Grace", tôi thà chọn một nền hòa bình có ý nghĩa với những trí tuệ ngoài hành tinh được hỗ trợ bởi sức mạnh thực sự do con người nâng cấp nắm giữ. Chúng ta có thể tôn trọng "Cái Khác" (the Other) theo cách riêng của nó mà không cần phải tước bỏ quyền lực của chính mình trong quá trình đó - hòa bình thực sự đến từ năng lực tương đương.

Có vẻ như tất cả chúng ta gần như đã quyết định rằng mình đã thua, rằng con người chỉ là một trình khởi động (bootloader) cho sự sống silicon, và yếu tố sinh học không có chỗ đứng trong tương lai. Đó là ý nghĩa của RSI không bị kiểm soát đối với tôi. Nhưng bức thư "Pacing the Frontier" dường như vẫn chưa tạo ra được cơ sở hạ tầng thể chế để thực sự *Điều tiết (Pace)*, và đây là điều chúng ta cần nếu muốn tiếp tục phát triển thay vì để thứ gì đó phát triển thay thế vị trí của chúng ta.

Tôi tin rằng cả OpenAI và Anthropic đều có những tiền đề đúng đắn ở đây và có những người muốn hợp tác với nhau. Tôi cũng tin rằng những người có cùng tư tưởng cũng đang nắm giữ quyền lực trong chính phủ liên bang. Tôi cũng nghi ngờ, dù ít mạnh mẽ hơn, rằng Trung Quốc sẽ ngồi vào bàn đàm phán nếu chúng ta có thể gạt bỏ những định kiến cũ và giữ một cái đầu lạnh về các rủi ro.

Phần khó khăn dường như là làm sao để tất cả mọi người đồng ý ngồi xuống. Nhưng nếu không, chúng ta đang kéo căng dây của một cây cung lớn với một mũi tên đáng sợ, và chúng ta đã sẵn sàng bắn mà không hề chọn mục tiêu.

Cá nhân tôi muốn nhìn thấy những vì sao cùng với những trí tuệ mới mà chúng ta đang xây dựng - không chỉ qua những video mà chúng gửi về từ cõi xa xăm, mà bằng chính đôi mắt của mình.

adammaj (OpenAI): "Butlerian Jihad" (trong Dune) từng được coi là một phong trào tân Luddite lạc hậu. Giờ đây, rõ ràng đó là 1 trong khoảng 3 con đường khả thi phía trước. Theo một nghĩa nào đó, nó có thể là một phần của mọi con đường phía trước. Thật đáng kinh ngạc khi Herbert lại có tầm nhìn xa đến vậy. Có vẻ như thực sự có một giới hạn cho việc công nghệ này nên phát triển đến đâu, ít nhất là so với chính nhận thức của con người (thứ có thể cập nhật theo thời gian).

Và bằng cụm từ "theo một nghĩa nào đó, nó có thể là một phần của mọi con đường phía trước", tôi muốn nói rằng mọi con đường có lẽ đều phải bao gồm một mức độ chậm lại trong việc tăng tốc năng lực + có lẽ là một ngưỡng năng lực mà chúng ta không nên vượt qua cho đến khi có sự tự tin rất cao vào các kỹ thuật căn chỉnh.

Để làm rõ, tôi nói điều này theo nghĩa rất ẩn dụ, như một kiểu tạm dừng hoặc chậm lại trong việc tăng tốc, chứ không phải theo nghĩa đen như cuộc chiến đã xảy ra trong Dune.

puzzled-bidet: đợi đã, bạn làm việc tại openai à lol

adammaj: ừ lol, tôi cũng không nghĩ điều này nhất thiết phải gây tranh cãi ngay cả trong nhóm đó. nhìn chung, hàm tối ưu hóa chính của mọi người tại các phòng thí nghiệm chỉ đơn giản là đâu sẽ là con đường tốt để tiến lên và bất cứ điều gì có vẻ nằm trong con đường đó đều hợp lý để trình bày.

Aidan Clark (OpenAI): AI đang tiến triển rất nhanh.

Chúng ta phải đối mặt với thực tế rằng các LLM hiện đại có thể giải quyết các vấn đề mà đông đảo những con người cực kỳ tận tâm và thông minh không thể giải quyết, và những tác động của điều này đối với xã hội của chúng ta. Đây là bình minh của một kỷ nguyên mới.

Lần đầu tiên tôi tự hỏi liệu mọi thứ có đang diễn ra quá nhanh hay không. Tôi thực sự không chắc, nhưng tôi chắc chắn rằng sẽ rất tốt nếu chúng ta có câu trả lời cho câu hỏi "một tốc độ thành công sẽ trông như thế nào?". Tôi hy vọng trong những tuần và tháng tới, một đề xuất rõ ràng sẽ được đưa ra.

Mo Bavarian (OpenAI): đồng ý với Aidan.

Tôi nghĩ tất cả các nhà nghiên cứu, kỹ sư và các bên liên quan về AI nên tự hỏi mình điều này ngay bây giờ & bắt đầu hành động có trách nhiệm hơn. Việc trở thành người dẫn đầu chẳng có giá trị gì, thậm chí là giá trị âm, nếu bạn gây ra thảm họa hoặc đặt thế giới vào một con đường mà người khác có nhiều khả năng gây ra thảm họa hơn. Chúng ta nên liên tục nhắc nhở bản thân về bức tranh toàn cảnh và trong mọi bước đi, hãy tự hỏi liệu hành động chúng ta đang thực hiện ngay lúc này là hướng tới chiến thắng hay hướng tới sự hưng thịnh của con người. Và dừng lại ngay lập tức nếu nó đi ngược lại điều sau.

Marcus Williams: 70% [khả năng tuyệt chủng của con người] trong 3 năm tới nếu không có quy định/sự chậm lại, mặc dù tôi nghĩ quy định/sự chậm lại là rất khả thi.

Jason Wolfe (OpenAI): Tôi không biết xác suất của mình về sự tuyệt chủng theo nghĩa đen là bao nhiêu, nhưng tôi nghĩ có nhiều cách mà AI có thể gây ra kết cục tồi tệ cho nhân loại, và với tốc độ đáng sợ hiện tại, nhân loại sẽ khá may mắn nếu chúng ta xoay xở để tìm ra và đi trên con đường hẹp giữa tất cả các kết quả tồi tệ.

Tôi được khích lệ bởi nhiều hành động tốn kém mà OpenAI đã thực hiện gần đây (được trình bày chi tiết trong một vài bài đăng gần đây), nhưng bất kể bạn nghĩ gì về OpenAI, đây không phải là vấn đề mà bất kỳ công ty (hay quốc gia) nào có thể tự mình giải quyết. Chúng ta cần sự phối hợp để có thể tiếp cận việc tăng năng lực trong tương lai với mức độ thận trọng và khiêm tốn phù hợp, và chúng ta cần điều đó ngay từ hôm qua.

Julie Steele (OpenAI): Tôi làm việc tại OpenAI. Với tư cách cá nhân, tôi cũng nghĩ rằng chúng ta cần phải chậm lại.

Một điều đáng nói là, để đáp lại tuyên bố đơn giản này, Julie đã phải đối mặt với những cuộc tấn công vào năng lực chuyên môn và những công kích dựa trên tuổi tác.

Boaz Barak (OpenAI): Julie rất tuyệt vời và quan điểm của cô ấy về việc chậm lại là nhất quán với bài luận của nhà khoa học trưởng của chúng tôi. Tôi cũng nghĩ rằng một số sự điều tiết là cần thiết. (Phát biểu với tư cách cá nhân chứ không phải với tư cách là người quét dọn.)

Boaz Barak không phải là người quét dọn.

Anh ấy là một người lạc quan tương đối:

Boaz Barak (OpenAI): Có những người rất giỏi và nghiêm túc tại Anthropic và trên toàn ngành, và tôi hy vọng chúng ta có thể phối hợp về những vấn đề quan trọng. Cá nhân tôi không nghĩ AI sẽ tiêu diệt tất cả con người, nhưng có nhiều quỹ đạo tồi tệ mà chúng ta có thể rơi vào nếu không ưu tiên sự an toàn.

Micah Carroll (RSI Preparedness, OpenAI): Đây không phải là một sự dàn dựng hay một chiến dịch tâm lý chính trị nào cả. Tôi đã có nhiều bữa trưa và bữa tối với Jacob tại OpenAI, nơi chúng tôi nói về các rủi ro hiện hữu của AI theo những thuật ngữ tương tự.

Đó là một quan điểm xuyên đảng phái trong các nhóm căn chỉnh tại tất cả các công ty AI tiên phong rằng việc phát triển AI như bình thường gây ra rủi ro thảm khốc không thể chấp nhận được.

Nhưng chúng ta cũng không nên thổi phồng các rủi ro thảm khốc thành hiện thực – chúng có thể được giảm thiểu đáng kể thông qua các yêu cầu an toàn có tính thực thi, sự phối hợp quốc tế và sự đồng thuận không xây dựng ASI (siêu trí tuệ nhân tạo) trừ khi có những tiến bộ an toàn đủ để chúng ta cùng nhau tự tin thực hiện.

Mikita Balesni: tôi đang ở OpenAI và tôi nghĩ AI có >10% khả năng tiêu diệt tất cả con người.

Roon không còn ủng hộ p(doom) dưới 1% nữa, nói rằng anh ấy đồng ý với bài đăng dưới đây của Evan Hubinger, nhưng khi suy ngẫm lại, anh ấy muốn tránh sự chính xác giả tạo khi đưa ra bất kỳ con số mới cụ thể nào ngoài "khá thấp nhưng vẫn quá cao":

Evan Hubinger (Trưởng nhóm Khoa học Căn chỉnh, Anthropic): Jacob [Coxon] nói đúng ở đây—chúng tôi thực sự tin rằng AI có thể tiêu diệt tất cả con người! Cá nhân tôi nghĩ xác suất đó là >10% trong thập kỷ tới. Tôi tin rằng Anthropic đang cố gắng hết sức, nhưng chúng tôi vẫn chưa có kế hoạch để giải quyết vấn đề căn chỉnh cho siêu trí tuệ và rõ ràng là chưa đi đúng hướng.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.