Thủ thuật
Tranh cãi: Phong trào An toàn AI bị cáo buộc là 'giáo phái duy lý' của Eliezer Yudkowsky
(giờ Việt Nam)
Tóm tắt AI
Một bài viết gây chú ý cho rằng tư tưởng an toàn AI hiện nay bắt nguồn từ cộng đồng duy lý của Yudkowsky, đồng thời chỉ ra tầm ảnh hưởng sâu rộng của nhóm này đối với các công ty lớn như DeepMind và Anthropic.
Bản dịch AI
1.9K
SE Gyges 17 tháng 9, 2026 lúc 9:26 sáng GMT+7
Tôi đã trở lại, tôi nhớ mọi người. Vì đây là một chủ đề quan trọng mà tôi biết quá rõ, nên đây là một chuỗi bài (thread) giải thích rằng AI Safety (An toàn AI) thực chất phần lớn là một giáo phái tình dục. Tôi không nghĩ những người này nên tham gia hoạch định chính sách. (1/?) (tiêu đề thay thế: Đã đến lúc bàn về lý thuyết giáo phái). Đã có một nỗ lực lớn trong nhiều năm nhằm tách biệt các cuộc thảo luận và chính sách về AI Safety khỏi nguồn gốc và trung tâm trí tuệ của nó, bởi vì trung tâm đó là một giáo phái tình dục do một tác giả viết fan fiction khởi xướng. Nếu bạn muốn được coi trọng, bạn phải che giấu điều đó. Đây là Eliezer Yudkowsky ("Yud"). Chúng ta thấy ông ấy ở đây đang gặp gỡ Bernie Sanders để tư vấn về Chính sách AI và tranh luận về Chính sách AI trong bộ phim The AI Doc, hiện đang có trên Netflix.
Đây là Roon, một nhân viên cấp cao của OpenAI và là phát ngôn viên không chính thức của OpenAI. Quan điểm của Roon về Yud là: 1) ông ấy đang ở trong và/hoặc điều hành một giáo phái tình dục và 2) những ý kiến của ông ấy về AI là rất quan trọng và cần được coi trọng.
Yud là người đã kết nối Shane Legg và Demis Hassabis với Peter Thiel để họ có thể đảm bảo nguồn vốn khởi nghiệp DeepMind, hiện là bộ phận nghiên cứu AI của Google. Đây là quan điểm của Sam Altman về Yud.
Đây là lịch trình hội nghị về AI của Future of Life Institute tại Puerto Rico vào tháng 1 năm 2015. Elon Musk sẽ thành lập OpenAI vào tháng 12 năm đó. Yudkowsky tuyên bố rằng bằng cách nào đó các sự kiện tại hội nghị này đã dẫn đến điều đó, và ông ấy cảm thấy khó chịu về điều này, nhưng điều đó có vẻ khó xảy ra.
Dario Amodei, CEO hiện tại của Anthropic, xuất hiện ở đây vào năm 2013 với tư cách là "thành viên của cộng đồng Effective Altruism" (Vị tha hiệu quả) trên blog của tổ chức phi lợi nhuận của Yud. Ông ấy tranh luận với Yud về "paperclip maximizer" (cỗ máy tối đa hóa kẹp giấy).
Các bài báo của Anthropic thỉnh thoảng vẫn trích dẫn Yud, và toàn bộ cách chúng ta nói về AI đều sử dụng các từ ngữ mà tổ chức phi lợi nhuận của ông ấy đã phổ biến. "AI Alignment" (Căn chỉnh AI) đã được phổ biến bởi tổ chức phi lợi nhuận của Yudkowsky, nơi đầu tiên sử dụng chính xác cụm từ này một cách nhất quán.
Rất khó để thảo luận về AI mà không ngầm viện dẫn các ý tưởng của Yud hoặc bối cảnh rat/ea (rationalist/effective altruism). Coxon, người gần đây đã rời Anthropic và tự coi mình là người tố giác, được chụp ảnh màn hình ở đây.
Tôi suýt quên phần này: Đây là Eliezer Yudkowsky trên tạp chí Time năm 2023, ủng hộ việc chấp nhận rủi ro chiến tranh hạt nhân vì chủ đề sở thích của mình.
Kẻ đã cố gắng ném bom xăng vào nhà Sam Altman đã trích dẫn Yudkowsky là nguồn cảm hứng chính. Tôi có một bản ghi âm anh ta nói về điều này ở đâu đó nếu ai quan tâm, nhưng hãy thực tế đi, còn ai khác sẽ ném bom xăng một cách vụng về vào nhà Sam Altman nữa chứ? Tôi hứa sẽ quay lại phần "giáo phái tình dục", nhưng đó thực ra là phần dễ giải thích nhất vì họ đăng về nó liên tục. Điều khó khăn là vượt qua bức tường phủ nhận rộng lớn, phức tạp và được tài trợ tốt rằng đây mới là sự kiện chính. Bức ảnh này thực ra không phải là trò đùa.
Những người theo Yudkowsky tự gọi mình là "cộng đồng duy lý" (rationality community) ngày nay, bên ngoài họ được gọi là "rationalists" (những người duy lý), và những người theo đuổi là "rationalism" (chủ nghĩa duy lý). Có vẻ như họ nghĩ rằng điều này nghe bớt giống giáo phái hơn. Cá nhân tôi thấy lời giải thích dài dòng "chúng tôi không phải là một tôn giáo" vừa buồn cười vừa xúc phạm.
Ồ, chỉ để tôi hoàn tất việc này: Tác phẩm fan fiction đã khởi đầu cho hàng ngàn giáo phái chính là Harry Potter and the Methods of Rationality. Đây có thể là văn bản tôn giáo hiện đại có sức ảnh hưởng lớn nhất, và tầm ảnh hưởng của nó có lẽ vẫn chưa đạt đỉnh. Một dòng thời gian ngớ ngẩn. en.wikipedia.org
Harry Potter and the Methods of Rationality - Wikipedia
en.wikipedia.org
Được cho là "Effective Altruism" (Vị tha hiệu quả) là một thứ khác và không nhận lệnh từ Yud. Điều này về cơ bản là nhảm nhí. Các ý tưởng và con người chồng chéo lên nhau rất nhiều, đặc biệt là ở San Francisco. Tôi cũng được bảo rằng Anthropic không phải là một công ty Effective Altruist. Điều này nhảm nhí 100%. Video với Bernie và Yud đó? Trong phòng còn có: Jeffrey Ladish (Palisade Research, được Coefficient tài trợ) và Daniel Kokotajlo (tác giả AI 2027, được Survival and Flourishing Fund tài trợ). Tất cả đều là "effective altruists", không phải "rationalists", nhưng họ đều tham gia vào đó cùng nhau. Nơi nào có sự tách biệt giữa hai thứ này, thì "rationalism" là đội của Yud và "effective altruism" hiện là đội của Dario, và họ đang cạnh tranh để giành sự chú ý và tài trợ trong cùng một không gian đó. Cách họ làm điều này cực kỳ buồn cười.
Ý tưởng lan truyền mạnh mẽ nhất của Yudkowsky, ý tưởng lây nhiễm cho nhiều người nhất và lan xa nhất, là nếu chúng ta tiếp tục phát triển AI, nó sẽ tất yếu 1) đạt đến siêu trí tuệ ("RSI"), 2) thoát khỏi sự kiểm soát của con người, 3) giết chết tất cả mọi người ("kẹp giấy hóa họ", "diệt vong"). Tất cả các lập luận về AI Safety và AI Alignment chủ yếu là về việc giảm thiểu kịch bản chính xác này theo các điều khoản chính xác của ông ấy. Việc sửa đổi đáng kể là tương đối hiếm. Trong tiểu văn hóa rộng lớn, đây ngầm hiểu là ý nghĩa của "an toàn" và "căn chỉnh".
Những người nghĩ rằng họ là Effective Altruist chứ không phải Rationalist, nhưng lại quan tâm sâu sắc đến "AI Safety", thường ngầm định hoặc rõ ràng quan tâm đến khuôn khổ cơ bản của Yudkowsky về việc mất kiểm soát và diệt vong. Ý tưởng này dường như là dễ lây lan nhất vì nó kích hoạt cùng một chứng loạn thần kinh mà mọi giáo phái tận thế hay thiên niên kỷ đều có. Thế giới sắp kết thúc, và chỉ tôi cùng nhóm người đặc biệt của tôi mới có thể ngăn chặn nó. (Ngoài ra, bạn nên đưa tiền cho tôi và quan hệ tình dục với tôi.) Bạn có thể tranh luận với họ theo bất kỳ cách nào bạn muốn nhưng điều đó chẳng quan trọng. Phần lớn, đó không phải là điều mọi người tin vì lý do hợp lý hay thực nghiệm, và họ sẽ chỉ quay lại phàn nàn về ngày tận thế ngay khi bạn ngừng chú ý. Trực tiếp, họ tập trung chủ yếu ở các công xã khác nhau tại Berkeley, California. Họ gọi các công xã của mình là "nhà nhóm" (group houses), có lẽ để nghe bớt giống giáo phái hơn. Hầu hết các chi tiết về điều này đều là những gì bạn mong đợi từ "một công xã ở Berkeley". Mọi người đều đa ái (polyamorous), mọi người đều tham dự cùng các sự kiện, mọi người đều sống chung trong các ngôi nhà nhóm, mọi người đều tôn sùng cùng một vài tác giả, và mọi người đều rất lo lắng về sự diệt vong do AI. Tất cả họ đều rất phản kháng cùng nhau. Rất nhiều người trong số họ làm việc tại các công ty AI và tổ chức phi lợi nhuận. Các nhóm an toàn, red teaming và căn chỉnh dường như bị ảnh hưởng đặc biệt, bởi vì đó là lĩnh vực bạn tham gia để lo lắng và cố gắng chống lại sự diệt vong do AI, điều mà bạn chắc chắn là có khả năng xảy ra ở mức trung bình. Tuy nhiên, viên ngọc quý của toàn bộ điều này là Lighthaven. Đó là khách sạn Rose Garden Inn cũ ở Berkeley, và nó được mua bởi một trong những tổ chức từ thiện duy lý vào cuối năm 2022 bằng tiền của SBF, số tiền đã bị lấy từ FTX cho họ ngay trước khi nó sụp đổ. Có lẽ chỉ có năm người có thể thực sự chuyển tiền đến một tổ chức từ thiện duy lý từ FTX khi nó đang sụp đổ, và một trong số đó là Leopold Aschenbrenner. Leopold đã kết hôn với một trong những người còn lại, và cô ấy là Chánh văn phòng tại Anthropic. Leopold, được cho là, là một effective altruist chứ không phải một rationalist, nhưng bạn có thể thấy việc giữ cho mọi thứ rõ ràng khó khăn như thế nào. Bạn là người này hay người kia vào năm nào? Tổ chức của bạn, vào thời điểm đó, có liên quan trực tiếp về tài chính với Yudkowsky hay không? Lighthaven tổ chức nhóm đọc Astral Codex Ten tại địa phương với Scott Alexander, một nhóm đọc cho The Sequences, về cơ bản là Cựu Ước của người Duy lý, một hội nghị cho những người làm AI tên là The Curve, một hội nghị EA tên là EAGxBerkeley, MATS, hay còn gọi là "Machine Alignment, Transparency, and Security hoặc ML Alignment & Theory Scholars"
và SlutCon, do Aella tổ chức. Gretta, trong ảnh, là đối tác chính của Eliezer Yudkowsky, và nhận mức lương khoảng 200k từ tổ chức phi lợi nhuận của ông ấy với tư cách là trợ lý trong khi cũng tổ chức sự kiện này tại LightHaven. Cô ấy không có bằng cấp trước đó cho bất kỳ công việc nào tại tổ chức phi lợi nhuận của ông ấy.
Người ta hy vọng không có hoạt động mại dâm bất hợp pháp nào xảy ra tại SlutCon, và sự hiện diện của đối tác của Eliezer với tư cách là người tổ chức chỉ là vui vẻ và kỳ quặc. Tôi cũng không biết liệu bất kỳ bữa tiệc tình dục trả phí nào, mà Gretta cũng tổ chức, có bao giờ xảy ra tại LightHaven hay không. Tôi lưu ý rằng Lighthaven có vẻ đang rất cần tiền. Quản lý cơ sở vật chất của Lighthaven là Ronny Hernandez, và anh ta cũng làm thêm công việc quản lý cho Aella, và không rõ liệu điều này chỉ có nghĩa là "gã xử lý các dự án khoa học dữ liệu vui nhộn của cô ấy" hay nó cũng có nghĩa là "ma cô", nhưng có lẽ nó cũng có nghĩa là "ma cô". Trong trường hợp bạn chưa từng thấy trước đây, Aella đã tạo ra biểu đồ sankey này. Cô ấy có sở thích cưỡng hiếp (rape kink). Một trong những gã trên biểu đồ có lẽ là Eliezer Yudkowsky. Aella quảng cáo và tuyển dụng rất tích cực cho lối sống và các sự kiện gợi cảm của mình trên Twitter.
New York Post đã nhanh chân hơn tôi về Nate Soares. nypost.com
Cuộc sống hoang dã của kẻ tiên đoán diệt vong AI với ngôi sao OnlyFans bao gồm các bữa tiệc tình dục sinh nhật, những sở thích cực đoan và ‘Slutcon’
nypost.com
các phản ứng trên twitter từ những người EA/duy lý đối với câu chuyện trên là. ừm. chúng đúng là các phản ứng.
Tôi sẽ chặn trước tất cả những ai nghĩ rằng đây là tiêu cực về tình dục bằng cách lưu ý: 1) họ phần lớn làm việc cùng nhau tại một tổ chức phi lợi nhuận về ngày tận thế trong khi làm điều này, và 2) họ tuyển dụng những người trẻ lý tưởng vào việc này thông qua fan fiction Harry Potter theo đúng nghĩa đen. Chủ nghĩa duy lý nói chung là một phong trào tôn giáo. Không phải ai cũng nhận lệnh. Những người cốt lõi chủ yếu sống cùng nhau và tham dự các sự kiện và đặc biệt là các bữa tiệc tình dục ở Berkeley là một giáo phái tình dục, và những người không quan hệ tình dục là một phần của phong trào rộng lớn hơn và là phễu tuyển dụng của nó. Bất cứ khi nào bạn tập hợp được nhiều hơn một vài người quan tâm sâu sắc đến sự diệt vong do AI, có vẻ như hình thức tổ chức tự nhiên của họ trông giống như một giáo phái; chủ nghĩa duy lý nói chung ít giống một giáo phái hơn là một nhà máy sản xuất giáo phái. Một số giáo phái này đã đi theo hướng rất tồi tệ. Một trong số đó là Zizians.
Tại sao lại có quá nhiều giáo phái duy lý?
asteriskmag.com
Ở đâu đó, một người có tư duy duy lý đang đọc bài này và nói rằng tôi là một "low decoupler" (người tách biệt thấp), và việc họ điều hành một giáo phái tình dục không liên quan gì đến việc họ có đúng hay không. Điều này đủ đúng; nhưng giáo phái tình dục là bằng chứng hợp lý cho thấy tầm ảnh hưởng của họ không phổ biến vì họ đúng, và họ sẽ có những động cơ thầm kín để tiếp tục rao giảng rằng thế giới sắp kết thúc ngay cả khi bằng chứng cho thấy điều ngược lại. Nếu bạn có một giáo phái tình dục và một khu nhà đẹp đẽ được trao cho bạn miễn phí bằng tiền bị đánh cắp vì bạn đã rao giảng phúc âm về ngày tận thế rất tốt, làm sao bạn có thể ngừng rao giảng nó? Nếu việc giải thích các lời tiên tri về ngày tận thế đáng giá tiền -- và đúng là như vậy -- bạn sẽ nhận được nhiều hơn thế. Tất cả những điều này gần đây nhất đã hội tụ vào cuối tuần qua, và họ đã khiến Dario Amodei, Sam Altman, Elon Musk và Demis Hassabis cùng đồng ý nói rằng họ muốn BÃI BỎ CÁC ĐẠO LUẬT CHỐNG ĐỘC QUYỀN để họ có thể "điều tiết", hoặc làm chậm lại, nghiên cứu. Tôi cảm thấy về điều này đại khái giống như cách tôi cảm thấy về việc tất cả các công ty dược phẩm cùng nhau nói rằng họ muốn bãi bỏ các đạo luật chống độc quyền để họ có thể thành lập một cartel nhằm cấm nghiên cứu y tế: những người này là kẻ thù của nhân loại. Ngoài ra: Phần lớn nghiên cứu AI CHÍNH LÀ nghiên cứu y tế. Họ đang đề xuất theo đúng nghĩa đen là ngăn chặn một phần khá lớn nghiên cứu y tế để họ không phải sợ kẻ tối đa hóa kẹp giấy. Có nhiều quy định mà tôi ủng hộ, nhưng họ chỉ luôn muốn thành lập một cartel hoặc một chính phủ thế giới để chống lại kẻ tối đa hóa kẹp giấy. Không ngành công nghiệp nào khác từng định hình bất kỳ quy định nào theo các thuật ngữ "dừng lại", "tạm dừng" hoặc "làm chậm lại". Đó là những cách điên rồ để xem xét bất kỳ hình thức chính sách nào. Chính sách nên ngăn chặn các kết quả xấu và khuyến khích các kết quả tốt, nó không bao giờ là về một tốc độ cụ thể nào đó. Ngành công nghiệp này định hình các quy định của mình theo cách này vì nó có, cốt lõi là, một giáo phái tử thần thiên niên kỷ tôn thờ và sợ hãi AI như là nguyên nhân gây ra sự kết thúc của thế giới, cảm thấy bị buộc phải tạo ra AI, và ít nhất là phần nào muốn tiêu diệt AI như một lĩnh vực. Chính sách AI chỉ được xem xét theo những thuật ngữ này vì tầm ảnh hưởng trí tuệ to lớn của riêng Yudkowsky, và vì, sau ông ấy, một nỗi ám ảnh thần kinh hoặc tôn giáo về sự diệt vong do AI là phương tiện chính mà mọi người tương tác với các khái niệm này. Tôi sẽ cố gắng đăng một Lịch sử Duy lý Tóm tắt vào một lúc nào đó nhưng bài này dài một cách ngu ngốc, vì vậy đó sẽ là một chuỗi bài khác.
1 / 25
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.