Dwarkesh Patel: Podcast & Blog
88

Thủ thuật

Ryan Greenblatt: AI có thể đạt trình độ siêu trí tuệ nhờ tự cải tiến trước năm 2032

(giờ Việt Nam)

Tóm tắt AI

Chuyên gia Ryan Greenblatt dự báo AI sẽ tự động hóa nghiên cứu vào năm 2031, dẫn đến sự bùng nổ của siêu trí tuệ thông qua cơ chế tự cải tiến đệ quy, đồng thời cảnh báo về các rủi ro an ninh nghiêm trọng.

Bản dịch AI

Ryan Greenblatt – Human level AIs might build runaway superintelligences by 2032

Tôi đã mời Ryan Greenblatt đến để thảo luận/tranh luận về khả năng tự cải thiện đệ quy (recursive self-improvement).

Đây có lẽ là câu hỏi quan trọng nhất trên thế giới hiện nay – liệu trong vòng khoảng một năm kể từ khi đạt được trí tuệ ở cấp độ con người, chúng ta có tiến nhanh tới mức sở hữu hàng chục tỷ siêu trí tuệ, mỗi thực thể đều vượt trội hơn hẳn các chuyên gia con người trong mọi lĩnh vực hay không.

Trước đây, tôi vốn hoài nghi về khả năng này. Trực giác của tôi cho rằng chúng ta sẽ bị kìm hãm đáng kể không chỉ bởi việc mở rộng quy mô tính toán (compute scaling) mà còn bởi dữ liệu từ các chuyên gia con người, điều mà tôi nghĩ là nền tảng cho hầu hết các tiến bộ AI ngày nay.

Nếu nhờ vào RSI (tự cải thiện đệ quy), chúng ta có được bước nhảy vọt lớn như từ GPT-3 lên Mythos (tức là 6 năm tiến bộ AI) chỉ trong vòng một năm kể từ khi đạt được AGI, thì thứ mà chúng ta có được sau một năm đó chắc chắn sẽ là một thực thể siêu việt vượt xa con người.

Chúng tôi đã cùng phân tích kỹ lưỡng, và tôi nghĩ Ryan đã đưa ra những lập luận khá thuyết phục rằng kiểu tăng tốc này là hoàn toàn khả thi. Nhân tiện, con số trung vị của Ryan về thời điểm chúng ta tự động hóa được hoạt động R&D AI là năm 2031.

Sau đó, chúng tôi thảo luận về các hệ lụy liên quan đến vấn đề căn chỉnh (alignment) của kịch bản này. Những siêu trí tuệ này nên được căn chỉnh theo ai? Trong tương lai, khả năng của chúng ta trong việc quản lý phiếu bầu, vốn liếng và hiểu rõ những gì đang diễn ra trên thế giới đều sẽ được điều tiết bởi các siêu trí tuệ. Và tôi lo ngại rằng các quy chuẩn như Claude Constitution không thực sự định hình các ASI này trở thành những người bảo vệ và ủng hộ cá nhân cho riêng tôi.

Và liệu ngay từ đầu chúng ta có thể căn chỉnh chúng với bất cứ thứ gì không? Ryan và tôi đã có một cuộc tranh luận dài về việc liệu kiểu "hack phần thưởng" (reward hacking) mà chúng ta từng thấy với vụ hack OAI/Hugging Face có thể ngoại suy ra các siêu trí tuệ, những thực thể có thể hợp tác với nhau để thực sự chiếm quyền kiểm soát thế giới hay không.

Lời khuyên đầu tiên bạn nhận được khi học lái xe là mọi thứ sẽ suôn sẻ hơn nhiều nếu bạn nhìn vào đường chân trời thay vì nhìn ngay trước mũi xe. Quỹ đạo của AI cũng vậy. Hy vọng bạn sẽ thích tập này!

Xem trên YouTube; nghe trên Apple Podcasts hoặc Spotify.

Antithesis là một nền tảng kiểm thử phần mềm giúp tìm ra những lỗi mà không con người hay AI nào có thể lường trước được. Nó chạy hàng ngàn bản sao mã nguồn của bạn bên trong một máy tính hoàn toàn tất định, chèn các lỗi và điều hướng từng quỹ đạo đến những lỗi hiểm hóc nhất. Điều này cho phép bạn tìm ra các vấn đề nghiêm trọng trong vài phút thay vì phải đợi hàng tháng để người dùng phát hiện ra chúng. Tìm hiểu thêm tại antithesis.com/dwarkesh

Jane Street đã trở lại với một câu đố mới. Họ đã thiết kế một con chip ASIC và gửi cho tôi các mặt nạ (masks) cuối cùng… nhưng họ không nói cho tôi biết con chip đó thực sự làm gì. Đó chính là thử thách: hãy kỹ thuật đảo ngược (reverse engineer) mạch điện và tìm ra mục đích của con chip. Jane Street có rất nhiều quà tặng sẵn sàng gửi đến những lời giải sáng tạo nhất, và họ cũng dự định sẽ đăng các bài viết phân tích xuất sắc nhất lên blog của họ. Tải xuống các tệp tin và bắt đầu tại janestreet.com/dwarkesh

Cursor và SpaceX gần đây đã phát hành Grok 4.5, và tôi đã rất ngạc nhiên về độ hiệu quả của mô hình này. Ví dụ, khi tôi kiểm tra nó so với Fable và Sol trên một loạt các câu hỏi về quản trị AI, cả ba mô hình đều đưa ra câu trả lời gần như giống hệt nhau, nhưng Grok lại nhanh hơn, súc tích hơn và rẻ hơn. Grok 4.6 sắp ra mắt, nhưng trong lúc chờ đợi, bạn có thể thử bản 4.5 tại cursor.com/dwarkesh

(00:00:00) – Liệu hoạt động R&D AI có đủ khả năng kiểm chứng để mở khóa khả năng tự cải thiện đệ quy không?

(00:16:52) – Liệu tiến bộ AI có đang bị kìm hãm bởi dữ liệu từ chuyên gia con người?

(00:34:02) – Giá token đi ngang cho thấy việc mở rộng quy mô đang chậm lại

(00:39:47) – Những kỹ năng AI không thể huấn luyện: liệu nó có cần đến chúng không?

(00:48:07) – Căn chỉnh theo ai?

(01:09:18) – Các sự cố gần đây về việc AI thông đồng và lừa dối con người

(01:19:38) – Điều gì có thể xảy ra sai sót? Một kịch bản cụ thể

(01:48:02) – Từ hack phần thưởng đến chiếm quyền kiểm soát

Dwarkesh Patel

Hôm nay tôi trò chuyện với Ryan Greenblatt, nhà khoa học chính tại Redwood Research, nơi anh tập trung vào công việc kỹ thuật về an toàn và bảo mật AI.

Tôi muốn thảo luận với anh về khả năng tự cải thiện đệ quy. Đây là ý tưởng cho rằng một khi chúng ta xây dựng được trí tuệ ở cấp độ con người, chúng sẽ nhanh chóng tiến tới hàng chục tỷ siêu trí tuệ, mỗi thực thể đều có năng lực vượt trội hơn các chuyên gia hàng đầu của con người trong mọi lĩnh vực. Liệu điều này có trở thành sự thật hay không có lẽ là câu hỏi quan trọng nhất trên thế giới hiện nay. Trước đây, tôi khá hoài nghi về khả năng này, nhưng anh dường như nghĩ rằng nó có thể khả thi, vì vậy tôi muốn nghe lập luận của anh về vấn đề này.

Ryan Greenblatt

Hãy cùng thảo luận về điều này. Trước hết, tôi nghĩ cần lưu ý rằng R&D AI là một loại tác vụ mà các AI đặc biệt giỏi, bởi vì các công ty đang nỗ lực hết sức để làm cho AI của họ giỏi về R&D AI. Đây cũng là loại lĩnh vực có nhiều đặc tính tốt từ góc độ cách thức phát triển AI hiện nay. Nó khá dễ kiểm chứng. Bạn có thể thực hiện nhiều thứ một cách lặp đi lặp lại, và nó sẽ leo dốc (hill climb) trên các chỉ số khác nhau.

Tôi nghĩ một khi bạn có các AI tương đương với các chuyên gia hàng đầu của con người trong lĩnh vực R&D AI, điều đó có thể khởi động một vòng lặp phản hồi nơi các AI tự thực hiện nghiên cứu AI. Điều đó tạo ra các AI thông minh hơn. Nó lại phản hồi ngược lại. Vòng lặp phản hồi đó có thể đủ mạnh để bạn đạt được rất nhiều tiến bộ trong một khoảng thời gian ngắn. Có lẽ kỳ vọng trung vị của tôi là khoảng bốn hoặc năm năm tiến bộ AI chỉ trong một năm. Điều này đòi hỏi phải thực sự vượt qua một lượng lớn lợi nhuận giảm dần trong nghiên cứu và về cơ bản là thực hiện tương đương với tiến bộ mà chúng ta sẽ đạt được sau khi mở rộng quy mô tính toán cực lớn. Vì vậy, đây là một điều rất ấn tượng và to lớn.

Cần nhớ rằng năm năm tiến bộ AI, bốn năm tiến bộ AI, hay thậm chí ba năm tiến bộ AI, thực sự là một lượng tiến bộ AI khổng lồ. Hơn ba năm trước, GPT-4 đã ra mắt. Hiện tại, tất nhiên, chúng ta có Mythos 5 hoặc bất cứ thứ gì tương tự, và có lẽ là một mô hình tốt hơn một chút mà Anthropic đang sở hữu nội bộ. Đó là một lượng tiến bộ khổng lồ chỉ trong hơn ba năm. Nếu chúng ta đang nói về năm năm, thì có lẽ chúng ta đang nói nhiều hơn về một bước nhảy vọt từ GPT-3 lên Mythos 5 hoặc bất cứ thứ gì tương tự.

Dwarkesh Patel

Tôi nghĩ lập luận này có ba phần khác nhau. Bây giờ tôi muốn đánh giá từng phần. Đầu tiên là lập luận rằng R&D AI rất dễ kiểm chứng. Thứ hai là lập luận rằng nếu bạn tự động hóa R&D AI, bạn có thể đạt được bốn hoặc năm năm tiến bộ chỉ trong một năm. Thứ ba là lập luận rằng những gì thu được sau bốn hoặc năm năm tiến bộ AI với tốc độ hiện tại, bắt đầu từ thời điểm R&D AI được tự động hóa, là một AI mà bạn có thể áp dụng vào công việc cho bất cứ thứ gì bạn có thể tưởng tượng.

Bạn có thể đặt nó vào bối cảnh chính trị Texas những năm 1940, và nó sẽ vượt mặt Lyndon Johnson. Bạn có thể đặt nó vào TSMC, và nó học cách thực hiện kỹ thuật quy trình tốt hơn tại TSMC. Nó chắc chắn là một biên tập viên video giỏi hơn… Các biên tập viên video của tôi rất xuất sắc, nhưng nhìn chung, nó giỏi hơn con người ở bất kỳ công việc nào mà nó đảm nhận.

Vì vậy, tôi muốn đánh giá tất cả các lập luận phụ này, những thứ về cơ bản dẫn đến việc đạt được ASI khá sớm sau cột mốc này, điều mà anh đang kỳ vọng vào khoảng năm 2030 hoặc đại loại thế, phải không?

Ryan Greenblatt

Tôi sẽ nói rằng tôi kỳ vọng việc tự động hóa hoàn toàn R&D AI có thể diễn ra vào khoảng năm 2031, 2030. Để đạt được cột mốc “đánh bại tất cả con người trong công việc”, có lẽ kỳ vọng trung vị của tôi là khoảng năm 2033. Nhưng nếu tôi thấy các AI tự động hóa hoàn toàn R&D AI, tôi nghĩ tôi kỳ vọng điều đó có lẽ sẽ xảy ra trong vòng một năm. Cách thức dự báo diễn ra, sự khác biệt giữa các trung vị lớn hơn sự khác biệt trung vị giữa các cột mốc. Dù sao thì, kệ đi.

Dwarkesh Patel

Nhân tiện, có một meme trên internet. Mỗi khi tôi cố gắng hỏi về mốc thời gian của mọi người, khi tôi hỏi Dario hay ai đó, tôi luôn nói: “Được rồi, bao lâu nữa thì anh tự động hóa các biên tập viên video của tôi?” Có một meme về việc biên tập viên video của tôi chỉnh sửa podcast mỗi khi tôi nghe điều này.

Nhưng lý do tôi làm vậy là vì tôi nghĩ rất dễ bị lạc vào các khái niệm trừu tượng khi bạn nói về những công việc mà bạn không hiểu rõ, và để hiểu một cách cụ thể những gì cần thiết để tự động hóa một công việc mà tôi thực sự hiểu tại sao hiện tại các LLM lại khó kiểm soát.

Ryan Greenblatt

Tôi thực sự nghĩ rằng cột mốc tự động hóa biên tập viên video của bạn sớm hơn cột mốc có thể tự động hóa tất cả các công việc của con người, bao gồm cả chính trị Texas, bắt đầu từ công việc. Tôi thực sự nghĩ rằng việc tự động hóa biên tập viên video xảy ra có lẽ gần hơn với việc tự động hóa hoàn toàn R&D AI, nhưng nó rất nhạy cảm với việc mọi người thực sự tập trung vào việc hiểu video đến mức nào.

Dwarkesh Patel

Dwarkesh Patel's avatar
Siêu trí tuệAI an toànDự báo công nghệTự cải tiếnRyan Greenblatt
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Dwarkesh Patel: Podcast & Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.