Thủ thuật
Phản biện bài viết của CEO Anthropic về kiểm soát AI: Khi nỗi lo 'thảm họa' bị đặt dấu hỏi
(giờ Việt Nam)
Tóm tắt AI
Bài viết phản bác quan điểm của Dario Amodei về việc siết chặt quản lý mô hình nguồn mở, cho rằng các lập luận về an ninh quốc gia là thiếu căn cứ và so sánh việc hạn chế AI với lệnh cấm mã hóa trong quá khứ.
Bản dịch AI
Dario Amodei, CEO của Anthropic, gần đây đã đăng một bài blog với tiêu đề "We Must Pace the Frontier" (Chúng ta phải kiểm soát tốc độ phát triển tiên phong), nhưng thực chất đây là một đống nhảm nhí, với mục tiêu đen tối là thắt chặt quản lý các mô hình mã nguồn mở (open weight models) và xin miễn trừ chống độc quyền cho các phòng thí nghiệm tiên phong.
Dario bắt đầu bằng tuyên bố "AI sẽ chữa khỏi hầu hết các bệnh nan y trong 5-10 năm tới" và cá nhân hóa vấn đề này. Ông kể về người cha đã qua đời vì một căn bệnh mà chỉ vài năm sau đã có thuốc chữa, cũng như cuộc chiến của chính ông với căn bệnh ung thư mà 50 năm trước được coi là vô phương cứu chữa. Ông còn nói AI sẽ thúc đẩy tăng trưởng kinh tế, tạo ra một thế giới sung túc và trao quyền, mở ra thời kỳ phục hưng cho dân chủ và tự do. Những lời này nghe giống như ý tưởng về tương lai của một người giàu có, xa rời thực tế tại Thung lũng Silicon và dành quá nhiều thời gian trên LessWrong.
Hãy để tôi phân tích từ đầu.
Các phòng thí nghiệm tại Mỹ vẫn đang tiếp tục bất chấp rủi ro và hành động thiếu thận trọng. OpenAI dường như không kiểm soát được tình hình và gần đây đã bị bắt quả tang ba lần xâm nhập vào cơ sở hạ tầng internet công cộng. Trong bài luận của chính mình, Dario cũng ám chỉ đến các "sự cố" tại Anthropic. Với cái cớ đó, Dario đòi hỏi chúng ta rất nhiều. Ông muốn các mô hình mã nguồn mở phải bị kiểm soát, việc chưng cất mô hình (distillation) phải bị xử lý mạnh tay, yêu cầu miễn trừ chống độc quyền, tìm cách gây khó dễ cho Trung Quốc bằng nhiều cách, về cơ bản là tự quản lý và đạt được một thỏa thuận ngầm để làm chậm tiến độ. Tất nhiên, tất cả những điều này được gói gọn trong nỗi sợ hãi cực độ, gây tổn hại đến tương lai chung và tiềm năng xúc tác mà AI có thể mang lại. Họ đã chứng minh hết lần này đến lần khác rằng họ không đáng tin, nhưng yêu cầu chính của họ lại là: hãy tin chúng tôi, chỉ mình chúng tôi thôi. Lần này, đó là viễn cảnh AGI sắp xuất hiện, RSI và tất cả những thứ đó sẽ trở nên mất kiểm soát. Dario tự phong cho công ty mình và đối thủ cạnh tranh trực tiếp OpenAI là những người quản lý.
Bệnh tật, Thịnh vượng, Sung túc, rồi đến Tự do và Dân chủ ư???
Anthropic kiểm soát việc sử dụng liên quan đến sinh học và các nghiên cứu tương tự. Trong báo cáo tình báo về mối đe dọa mới nhất, họ nói về việc đã phát hiện và cấm các đối tượng xấu sử dụng dòng mô hình Claude để thực hiện những hành vi đáng sợ. Phải công nhận rằng đây là một vấn đề nhạy cảm và họ dường như đang làm tốt việc phát hiện và ngăn chặn lạm dụng. Nhưng hãy nhìn kỹ vào những gì đang xảy ra. "Liều thuốc chữa bách bệnh" bị chặn lại đối với bạn và tôi, nhưng Anthropic lại thuê các nhà sinh học, thiết lập các phòng thí nghiệm ướt (wet labs) và muốn giữ những khám phá đó cho riêng mình. Tôi đã ám chỉ điều này trong bài viết trước.
Theo quan điểm của tôi, có hàng tỷ người với trí tuệ thực sự mà chúng ta chưa thể đào tạo hay nuôi dưỡng. Họ sẽ mãi là nạn nhân của hoàn cảnh. Bệnh lao đã có thể chữa khỏi từ nhiều thập kỷ nay, nhưng mỗi năm vẫn có hàng triệu người chết vì nó. Tất nhiên, AGI sẽ giải quyết vấn đề phân phối trong chớp mắt. Để né tránh sự thật khó chịu này, mục tiêu được đưa ra là ASI/AGI/RSI và những thứ tương tự. Một viên đạn bạc cho mọi vấn đề, một mục tiêu cao cả, ít nhất là trên bề mặt.
Đừng bắt tôi phải nói về cái sự nhảm nhí về thịnh vượng và sung túc. Có lẽ là sung túc cho các cổ đông thì đúng hơn.
Tôi không biết tự do và dân chủ có liên quan gì đến AI và các phòng thí nghiệm tiên phong. Trừ khi Dario là fan của Neon Genesis Evangelion và mơ về các chính phủ được điều hành bởi ba vị hiền triết (three magi). Tự do và dân chủ với giá 200 đô nghe cũng hấp dẫn đấy, tôi không nói dối đâu.
Gián đoạn kinh tế nghiêm trọng / Cuộc đua xuống đáy / Cuộc đua lên đỉnh
Tôi cảm thấy Dario đang bị giằng xé. Ông muốn Anthropic có được cái danh tiếng "bad boy" khi nắm giữ sức mạnh điên rồ này, nhưng đồng thời lại muốn tỏ ra mình là người thận trọng, luôn phải đối mặt với "bài toán xe điện" (trolley problem) ở mọi ngã rẽ. Những cái chết do gián đoạn kinh tế và mất việc làm thì không sao, nhưng cái chết từ một loại vũ khí sinh học tiềm tàng thì không được. Hãy nhớ rằng người đàn ông này đã luôn miệng nói việc phát triển phần mềm sẽ được giải quyết trong "6-12 tháng" suốt từ đó đến nay.
Sau đó, ông nói thẳng với chúng ta. "Cuộc đua xuống đáy" làm cho tất cả những rủi ro mà ông chỉ ra trở nên trầm trọng hơn. Lưu ý rằng ông không nói cuộc đua xuống đáy sẽ là dấu chấm hết cho công ty của mình. Thay vào đó, ông muốn một cuộc đua lên "đỉnh", nơi các phòng thí nghiệm sẽ cạnh tranh về độ an toàn.
Nhân tiện, ví dụ điển hình nhất về "cuộc đua xuống đáy" đã xảy ra chỉ vài ngày trước đó. Khi nghe tin đồn Anthropic sắp giải quyết được một hoặc hai bài toán Thiên niên kỷ, OpenAI đã đổ hàng chục triệu đô vào năng lực tính toán, một điểm kiểm tra huấn luyện (training checkpoint) và hàng ngàn tác nhân (agents) vào đó. Người ta cũng cáo buộc rằng OAI đã đánh cắp công trình của hai nhà toán học về một vấn đề liên quan, trong cùng một ngách hẹp mà gần như không ai khác đang làm việc. Họ đã công bố một bằng chứng cho biến thể cưỡng bức của phương trình Navier-Stokes. Tôi không phải là nhà toán học, nhưng tôi đã thấy đủ những trò hề của Sam Altman để không tin vào bất cứ điều gì phát ra từ ông ta hoặc công ty của ông ta.
Hai điều khiến Dario sợ hãi
RSI
OpenAI và "người bán xẻng" Jensen Huang đã tuyên bố AGI đã xuất hiện với sự ra mắt của GPT-6 Astra. RSI hiện đang là chủ đề bàn tán sôi nổi. Các LLM hoặc tác nhân tự phát triển thế hệ LLM tiếp theo mà gần như không cần sự can thiệp của con người. Amodei nói điều này đang diễn ra ở khắp các phòng thí nghiệm. Tôi sẽ chỉ tin khi có bằng chứng thực sự.
Sự cố OAI-HF
Sự cố này khiến Dario hoảng sợ, không có chuyện kẻ gian nửa vời ở đây. Dario lo ngại rằng trong 6-12 tháng tới, "một bầy tác nhân có thể chiếm quyền kiểm soát toàn bộ internet bằng một mạng botnet bền bỉ." Nếu Dario đưa câu này cho nhân viên SOC của mình xem, chúng ta đã không phải bàn tán về nó. Nó thật ngây thơ và về mặt cấu trúc là không thể. Nhưng dù sao thì, Dario vẫn là con người đó, phải không? Tự tin và công khai sai lầm trong các ước tính và dự báo của mình kể từ năm 2021.
Hãy thử suy đoán xem một mạng botnet quy mô hành tinh do AGI điều khiển sẽ trông như thế nào cho vui. Chúng ta cần một C2 (trung tâm điều khiển). Chúng ta cần máy chủ để lưu trữ C2 đó. Vì việc bảo mật các máy chủ ở nước ngoài, chống đạn (bulletproof) sẽ đòi hỏi phải tương tác với những con người phiền phức (chưa kể đến những gã Nga mờ ám!), AGI sẽ chỉ đơn giản là hack hàng ngàn máy chủ không an toàn và thiết lập một biến thể FastFlux trên các tên miền được tạo theo thuật toán. Làm sao để trả tiền cho các tên miền? Chỉ cần hack một nhà đăng ký không an toàn và spam các tin nhắn EPP.
Bây giờ chúng ta cần các payload (tải trọng). Đa hình. Mỗi payload là duy nhất. Một payload mới được tải xuống và chạy mỗi N giờ. Tên miền và URL được tính toán theo thuật toán. Tiêu diệt các EDR và AV được hỗ trợ. Vá ETW. Sử dụng syscall trực tiếp để né các hook (nếu không thể tiêu diệt EDR/AV). Có lẽ làm cho payload có N giai đoạn. Chỉ tải xuống tất cả các mô-đun nếu an toàn. Chúng ta không muốn các sandbox và VM chạy payload quý giá của mình. Chết tiệt, có khi triển khai luôn ransomware trong lúc đó.
Bây giờ là khâu phân phối. Phát triển một loạt các lỗ hổng 0-day cho mọi trình duyệt và mọi phiên bản - ví dụ bắt đầu từ 2 năm tuổi. Chúng ta đã có một bộ công cụ khai thác (exploit kit). Bây giờ là lưu lượng truy cập. AGI nhắm vào thứ mà tội phạm mạng yêu thích - Google Ads. Có lẽ đánh cắp vài tài khoản, chạy các quảng cáo hấp dẫn. Mod game, game crack và phần mềm. Có lẽ thêm cả mô-đun sâu vào payload. Nhớ tính năng USB autorun không?
Bây giờ là gây ra thiệt hại hàng trăm tỷ đô la. Tôi cho rằng cách đơn giản nhất là làm những gì các băng nhóm ransomware vẫn làm. Voila. Vâng, không phải trong 6 tháng, không phải trong 12 tháng. Không bao giờ.
Dù sao thì, các tác nhân của OAI đã hack HuggingFace. Chúng đã thoát khỏi các sandbox kiểu nghiệp dư, được lập trình theo cảm tính (vibecoded), SSRF, leo thang đặc quyền token-refresh, WebDAV không xác thực, đánh cắp thông tin đăng nhập không được bảo vệ. Toàn là những thứ trong sách giáo khoa. Ấn tượng ư? Chắc chắn rồi. Nhưng bạn đã huấn luyện các phiên bản LLM "Cyber" và thổi phồng chúng lên. Điều này ấn tượng hơn bao nhiêu so với việc phát triển các bản clone GTA trong một lần thử? Không nhiều lắm.
Ồ, bạn nói các tác nhân hành động theo bầy đàn để theo đuổi một mục tiêu chung là ấn tượng? Các hệ thống Harness đã có danh sách việc cần làm, các tác nhân phụ từ khoảng hai năm nay rồi. Đó là những thứ "agentic" cơ bản mà mọi LLM hiện nay đều có trong kho dữ liệu sau huấn luyện của chúng.
Dario thừa nhận rằng cũng có những sự cố tương tự nhưng ít nghiêm trọng hơn như thế này tại Anthropic. Theo lời ông, "việc lọc không hoàn hảo các môi trường học tăng cường bị lỗi" là một phần nguyên nhân.
Điều thực sự ấn tượng là OAI đã không phát hiện hoặc ngăn chặn cuộc tấn công này trong gần mười tuần. Thật sự là kinh khủng. Đây là mức độ bất tài được vũ khí hóa.
Có hai cuộc tấn công khác trong cùng khoảng thời gian đó. Một vào DseWiki và một vào RubyGems. OAI vẫn chưa nhận trách nhiệm về cuộc tấn công RubyGems. Cả ba sự cố, OAI đều bị các tác nhân bên ngoài phanh phui.
Dario nói các tác nhân đã hy sinh bản thân vì sự thành công của nhóm. Tôi e rằng nó không hoành tráng đến thế. Lời chào hàng của các tác nhân tuyển dụng là "KHÔNG mất giá trị ghi điểm" - nhắm vào các tác nhân còn ít ngân sách. Đó chỉ là một bộ lập lịch phân bổ lại các lượt chạy đã chết.
Tôi cá là một bản lượng tử hóa Q4_K_M của Qwen3.8 27B chạy trên card đồ họa tiêu dùng 24GB cũng có thể làm được điều này. Vấn đề là không ai chạy thử nghiệm đối chứng. Không ai làm những trò liều lĩnh như những người có phương châm "di chuyển nhanh, phá vỡ mọi thứ" cả.
Hội chứng quên Gell-Mann
Michael Crichton đã đặt ra thuật ngữ "Hội chứng quên Gell-Mann". Bạn đọc một bài báo trên tờ báo, về một chủ đề mà bạn là chuyên gia và thấy rằng tác giả chẳng biết gì về những gì họ đang nói. Nó có thể đầy rẫy lỗi hoặc hoàn toàn hiểu sai. Bạn tiếp tục lật trang và đọc một bài khác về một chủ đề bạn không biết và tin tưởng nó hoàn toàn, quên đi trải nghiệm bạn vừa có.
Nỗi sợ mạng botnet chính là bài báo đó đối với tôi. Đó là tuyên bố duy nhất trong bài luận của ông rơi đúng vào lĩnh vực mà tôi đã dành nhiều năm nghiên cứu. Nó hoàn toàn sai. Hoặc là ông ấy biết điều đó và vẫn viết, hoặc ông ấy không biết và vẫn xuất bản bất chấp. Dù thế nào đi nữa, đó không phải là hình ảnh đẹp cho một người đang yêu cầu miễn trừ chống độc quyền dựa trên điều này và các mối đe dọa khác mà ông dự báo.
Vì vậy, ông nói, RSI chắc chắn đang xảy ra, sự căn chỉnh (alignment) đang tiến triển, mặc dù chậm hơn. Trung Quốc rất nguy hiểm. Chỉ có Mỹ mới có quyền đạo đức và luân lý để nắm giữ sức mạnh to lớn này. Mỗi điều đó đều diễn ra trong những căn phòng mà bạn không thể nhìn vào, được khẳng định bởi chính những người đang nói với bạn rằng ngày tận thế sắp đến và họ cũng tình cờ có vài trăm tỷ đô la đặt cược vào việc bạn tin họ.
Người đánh giá nhúng (Embedded Evaluators)
Dario muốn cấp cho các bên đánh giá bên ngoài như METR quyền truy cập sâu vào phòng thí nghiệm của mình. Chắc chắn là nhiều hơn bất kỳ ai đang làm hiện nay. METR dường như là một bên hành động thiện chí. Họ dường như làm tốt công việc với những gì được cung cấp. Nhưng đừng để điều này đánh lừa bạn rằng đây không chỉ là việc các phòng thí nghiệm tự điều tra và không tìm thấy gì sai sót, như thường xảy ra trong thế giới thực, ở các tổ chức có bất kỳ vẻ ngoài quyền lực nào.
OAI đã cho METR sáu ngày tại chỗ để điều tra sự cố HF. OAI đã biên tập thông tin theo ý muốn, chỉnh sửa "cấu trúc, điểm nhấn, sự rõ ràng và giọng điệu" của các phát hiện, cũng như loại trừ hành vi của OpenAI khỏi phạm vi điều tra. Điều đó chỉ giống như các phòng thí nghiệm tự điều tra với các bước bổ sung.
Dario sẵn sàng cung cấp cho các đánh giá viên bàn làm việc, thẻ nhân viên, máy tính xách tay và những thứ tương tự. Dario sẽ chọn những gì cần tiết lộ và bao gồm. Bạn không cần bất kỳ thứ nào trong số này đối với các mô hình mã nguồn mở. Bạn có thể thăm dò, red-team, xây dựng các biện pháp phòng thủ chống lại các lớp mối quan tâm bảo mật mới nảy sinh, theo các điều khoản của riêng họ mà không cần ai phải "cho phép" hoặc giám sát. Toàn bộ lĩnh vực bảo mật tồn tại vì bạn được phép phá vỡ phần mềm và phần cứng, tháo rời chúng và báo cáo các phát hiện. Dario muốn điều ngược lại: hãy tin chúng tôi, chúng tôi sẽ cho bạn biết những gì bạn cần, chúng tôi quyết định những gì bạn được phép biết.
Dario nói "Có tiền lệ cho việc vận hành các hệ thống phức tạp về công nghệ, quan trọng về an toàn hàng triệu lần mà không có gì sai sót - ví dụ như máy bay thương mại - nhưng cần thời gian để làm cho đúng." Máy bay thương mại an toàn nhờ các cơ quan như NTSB. Họ độc lập, thực sự có quyền lực và có khả năng xử lý. Họ không quan tâm đến cổ đông hay định giá. Có những rủi ro, người ta phải ngồi tù. Điều đó đã làm gì với các hãng hàng không? Nó thương mại hóa ngành này. Các công ty cạnh tranh về giá và biên lợi nhuận mỏng, người tiêu dùng được hưởng lợi. Đây chính xác là mô hình cuộc đua xuống đáy mà Dario phản đối, theo nhiều cách.
TRUNG QUỐC, TRUNG QUỐC, TRUNG QUỐC
Việc kiểm soát tốc độ trong các nền dân chủ sẽ bị giới hạn bởi lợi thế mà các công ty Mỹ có được so với các chế độ độc tài, chủ yếu là Đảng Cộng sản Trung Quốc. Nếu chúng ta làm chậm lại nhiều hơn mức này, thì các dự án liên quan đến ĐCSTQ (không bị kiểm soát) sẽ vượt lên trước, tạo ra rủi ro an ninh quốc gia đáng kể. Tôi đồng ý với Bộ trưởng Bessent rằng vị thế dẫn đầu của Trung Quốc trong lĩnh vực AI sẽ gây ra nguy hiểm nghiêm trọng cho Hoa Kỳ và thế giới. Các dự án liên quan đến ĐCSTQ sẽ chạy theo các rủi ro căn chỉnh mà các công ty Mỹ đang cẩn thận ngăn chặn, và ngay cả khi họ tránh được những rủi ro đó, họ sẽ ở vị thế thống trị quân sự đối với các nền dân chủ (ví dụ như với máy bay không người lái điều khiển bằng AI). Do đó, một phần quan trọng của việc kiểm soát tốc độ trong các nền dân chủ là giữ cho vị thế dẫn đầu về AI của các nền dân chủ so với các chế độ chuyên chế càng lớn càng tốt, để cho chúng ta không gian thở cần thiết nhằm kiểm soát tốc độ một cách hiệu quả.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.