Dario Amodei: Blog (Web)
Điểm AI 82/100

Quan điểm

Dario Amodei: Tính minh bạch là nhiệm vụ cấp bách nhất trong phát triển AI

(giờ Việt Nam)

Tóm tắt AI

CEO Anthropic nhấn mạnh việc giải mã 'hộp đen' AI là ưu tiên sống còn để kiểm soát rủi ro, đảm bảo an toàn và mở đường cho AI ứng dụng trong các lĩnh vực nhạy cảm như y tế, tài chính.

Chính văn · Bản dịch AI

Dario Amodei — The Urgency of Interpretability

Tháng 4 năm 2025

Trong thập kỷ làm việc với AI, tôi đã chứng kiến nó phát triển từ một lĩnh vực học thuật nhỏ bé trở thành vấn đề kinh tế và địa chính trị quan trọng nhất thế giới. Trong suốt thời gian đó, bài học quan trọng nhất mà tôi rút ra là: sự tiến bộ của công nghệ nền tảng là không thể ngăn cản, được thúc đẩy bởi những thế lực quá mạnh mẽ, nhưng cách thức nó diễn ra—thứ tự xây dựng, các ứng dụng chúng ta chọn và chi tiết về cách triển khai ra xã hội—hoàn toàn có thể thay đổi, và việc làm đó có thể tạo ra tác động tích cực to lớn. Chúng ta không thể dừng chiếc xe buýt lại, nhưng chúng ta có thể cầm lái. Trước đây, tôi từng viết về tầm quan trọng của việc triển khai AI theo cách tích cực cho thế giới, và đảm bảo rằng các nền dân chủ xây dựng và nắm giữ công nghệ này trước khi các chế độ chuyên quyền làm điều đó. Trong vài tháng qua, tôi ngày càng tập trung vào một cơ hội bổ sung để cầm lái chiếc xe buýt: khả năng đầy hứa hẹn, được mở ra bởi một số tiến bộ gần đây, rằng chúng ta có thể thành công trong việc diễn giải—tức là hiểu được cơ chế bên trong của các hệ thống AI—trước khi các mô hình đạt đến mức độ quyền năng áp đảo.

Những người ngoài ngành thường ngạc nhiên và lo ngại khi biết rằng chúng ta không hiểu các sản phẩm AI do chính mình tạo ra hoạt động như thế nào. Họ lo ngại là đúng: sự thiếu hiểu biết này về cơ bản là chưa từng có trong lịch sử công nghệ. Trong vài năm qua, chúng tôi (cả Anthropic và toàn ngành) đã cố gắng giải quyết vấn đề này, nhằm tạo ra một công cụ tương tự như máy MRI có độ chính xác cao để tiết lộ hoàn toàn cơ chế bên trong của một mô hình AI. Mục tiêu này thường cảm thấy rất xa vời, nhưng nhiều đột phá gần đây đã thuyết phục tôi rằng chúng ta đang đi đúng hướng và có cơ hội thành công thực sự.

Đồng thời, lĩnh vực AI nói chung đang tiến xa hơn những nỗ lực diễn giải của chúng tôi và bản thân nó cũng đang phát triển rất nhanh. Do đó, chúng ta phải hành động nhanh chóng nếu muốn khả năng diễn giải kịp thời trở nên quan trọng. Bài viết này đưa ra lập luận về khả năng diễn giải: nó là gì, tại sao AI sẽ phát triển tốt hơn nếu chúng ta có nó, và tất cả chúng ta có thể làm gì để giúp nó chiến thắng trong cuộc đua này.

Những nguy hiểm của sự thiếu hiểu biết

Các hệ thống AI tạo sinh hiện đại có tính mờ đục khác biệt căn bản so với phần mềm truyền thống. Nếu một chương trình phần mềm thông thường thực hiện điều gì đó—ví dụ, một nhân vật trong trò chơi điện tử nói một câu thoại, hoặc ứng dụng giao đồ ăn cho phép tôi boa cho tài xế—nó thực hiện những điều đó vì con người đã lập trình cụ thể cho chúng. AI tạo sinh hoàn toàn không như vậy. Khi một hệ thống AI tạo sinh làm điều gì đó, chẳng hạn như tóm tắt một tài liệu tài chính, chúng ta hoàn toàn không biết, ở mức độ cụ thể hay chính xác, tại sao nó lại đưa ra những lựa chọn đó—tại sao nó chọn từ này thay vì từ khác, hoặc tại sao đôi khi nó mắc lỗi mặc dù thường thì nó rất chính xác. Như người bạn và cũng là đồng sáng lập của tôi, Chris Olah, thường nói, các hệ thống AI tạo sinh được "nuôi dưỡng" nhiều hơn là được "xây dựng"—cơ chế bên trong của chúng là "tính trồi" (emergent) thay vì được thiết kế trực tiếp. Nó hơi giống như việc trồng một cái cây hoặc một quần thể vi khuẩn: chúng ta thiết lập các điều kiện cấp cao để định hướng và định hình sự phát triển, nhưng cấu trúc chính xác xuất hiện lại không thể đoán trước và khó hiểu hoặc khó giải thích. Nhìn vào bên trong các hệ thống này, những gì chúng ta thấy là những ma trận khổng lồ chứa hàng tỷ con số. Bằng cách nào đó, chúng đang thực hiện các tác vụ nhận thức quan trọng, nhưng chính xác cách chúng làm điều đó thì không hề rõ ràng.

Nhiều rủi ro và lo ngại liên quan đến AI tạo sinh cuối cùng đều là hệ quả của sự mờ đục này, và sẽ dễ giải quyết hơn nhiều nếu các mô hình có thể diễn giải được. Ví dụ, các nhà nghiên cứu AI thường lo lắng về các hệ thống bị lệch hướng (misaligned) có thể thực hiện các hành động gây hại không theo ý muốn của người tạo ra chúng. Việc chúng ta không thể hiểu cơ chế bên trong của các mô hình đồng nghĩa với việc chúng ta không thể dự đoán một cách có ý nghĩa các hành vi như vậy, và do đó gặp khó khăn trong việc loại trừ chúng; thực tế, các mô hình có thể biểu hiện các hành vi trồi bất ngờ, mặc dù chưa có hành vi nào đạt đến mức độ đáng lo ngại lớn. Tinh tế hơn, chính sự mờ đục này khiến việc tìm kiếm bằng chứng xác thực ủng hộ sự tồn tại của những rủi ro này trên quy mô lớn trở nên khó khăn, gây khó khăn cho việc tập hợp sự ủng hộ để giải quyết chúng—và thực sự, khó mà biết chắc chắn chúng nguy hiểm đến mức nào.

Để giải quyết mức độ nghiêm trọng của các rủi ro lệch hướng này, chúng ta sẽ phải nhìn vào bên trong các mô hình AI rõ ràng hơn nhiều so với hiện nay. Ví dụ, một mối lo ngại lớn là sự lừa dối hoặc tìm kiếm quyền lực của AI. Bản chất của việc huấn luyện AI khiến các hệ thống AI có khả năng tự phát triển khả năng lừa dối con người và xu hướng tìm kiếm quyền lực theo cách mà phần mềm tất định thông thường không bao giờ có; bản chất trồi này cũng khiến việc phát hiện và giảm thiểu những diễn biến như vậy trở nên khó khăn. Nhưng cũng vì lẽ đó, chúng ta chưa bao giờ thấy bất kỳ bằng chứng vững chắc nào trong các tình huống thực tế về sự lừa dối và tìm kiếm quyền lực vì chúng ta không thể "bắt quả tang các mô hình" đang suy nghĩ những ý tưởng khao khát quyền lực hay lừa dối. Những gì còn lại là các lập luận lý thuyết mơ hồ rằng sự lừa dối hoặc tìm kiếm quyền lực có thể có động lực để xuất hiện trong quá trình huấn luyện, điều mà một số người thấy hoàn toàn thuyết phục và những người khác lại thấy nực cười và không thuyết phục. Thành thật mà nói, tôi có thể đồng cảm với cả hai phản ứng, và đây có thể là manh mối cho thấy tại sao cuộc tranh luận về rủi ro này lại trở nên phân cực đến vậy.

Tương tự, những lo ngại về việc lạm dụng các mô hình AI—ví dụ, chúng có thể giúp những kẻ xấu tạo ra vũ khí sinh học hoặc vũ khí mạng, theo những cách vượt xa thông tin có thể tìm thấy trên internet ngày nay—dựa trên ý tưởng rằng rất khó để ngăn chặn các mô hình biết thông tin nguy hiểm hoặc tiết lộ những gì chúng biết một cách đáng tin cậy. Chúng ta có thể đặt các bộ lọc lên các mô hình, nhưng có vô số cách để "bẻ khóa" (jailbreak) hoặc đánh lừa mô hình, và cách duy nhất để phát hiện sự tồn tại của một lỗ hổng bẻ khóa là tìm ra nó bằng thực nghiệm. Nếu thay vào đó, chúng ta có thể nhìn vào bên trong các mô hình, chúng ta có thể chặn một cách có hệ thống tất cả các lỗ hổng bẻ khóa, đồng thời xác định được các mô hình đang nắm giữ những kiến thức nguy hiểm nào.

Sự thiếu minh bạch của các hệ thống AI cũng đồng nghĩa với việc chúng đơn giản là không được sử dụng trong nhiều ứng dụng, chẳng hạn như các lĩnh vực tài chính rủi ro cao hoặc các thiết lập quan trọng về an toàn, bởi vì chúng ta không thể thiết lập hoàn toàn các giới hạn cho hành vi của chúng, và một số lượng nhỏ sai sót có thể gây ra tác hại rất lớn. Khả năng diễn giải tốt hơn có thể cải thiện đáng kể năng lực của chúng ta trong việc đặt ra các giới hạn cho phạm vi sai sót có thể xảy ra. Trên thực tế, đối với một số ứng dụng, việc chúng ta không thể nhìn thấu bên trong các mô hình thực sự là một rào cản pháp lý đối với việc áp dụng chúng—ví dụ như trong các đánh giá thế chấp, nơi các quyết định được yêu cầu về mặt pháp lý phải có khả năng giải thích được. Tương tự, AI đã đạt được những bước tiến lớn trong khoa học, bao gồm việc cải thiện khả năng dự đoán dữ liệu trình tự DNA và protein, nhưng các mô hình và cấu trúc được dự đoán theo cách này thường khó hiểu đối với con người và không mang lại hiểu biết sâu sắc về sinh học. Một số bài báo nghiên cứu trong vài tháng qua đã làm rõ rằng khả năng diễn giải có thể giúp chúng ta hiểu được các mô hình này.

Có những hệ quả kỳ lạ hơn của sự thiếu minh bạch, chẳng hạn như việc nó cản trở khả năng của chúng ta trong việc đánh giá liệu các hệ thống AI có (hoặc một ngày nào đó có thể) có tri giác và xứng đáng được hưởng các quyền quan trọng hay không. Đây là một chủ đề đủ phức tạp mà tôi sẽ không đi sâu vào chi tiết, nhưng tôi nghi ngờ rằng nó sẽ trở nên quan trọng trong tương lai.

Lược sử về khả năng diễn giải cơ học (Mechanistic Interpretability)

Vì tất cả những lý do được mô tả ở trên, việc tìm hiểu xem các mô hình đang "suy nghĩ" gì và cách chúng vận hành dường như là một nhiệm vụ có tầm quan trọng tối thượng. Quan điểm thông thường trong nhiều thập kỷ là điều này là không thể, và các mô hình là những "hộp đen" không thể dò thấu. Tôi sẽ không thể truyền tải trọn vẹn câu chuyện về việc điều đó đã thay đổi như thế nào, và quan điểm của tôi chắc chắn bị ảnh hưởng bởi những gì tôi đã trực tiếp chứng kiến tại Google, OpenAI và Anthropic. Nhưng Chris Olah là một trong những người đầu tiên nỗ lực thực hiện một chương trình nghiên cứu thực sự có hệ thống để mở "hộp đen" và hiểu tất cả các thành phần của nó, một lĩnh vực được gọi là khả năng diễn giải cơ học. Chris đã làm việc về khả năng diễn giải cơ học đầu tiên tại Google, và sau đó là tại OpenAI. Khi chúng tôi thành lập Anthropic, chúng tôi đã quyết định biến nó thành một phần trọng tâm trong định hướng của công ty mới và quan trọng hơn là tập trung vào các LLM. Theo thời gian, lĩnh vực này đã phát triển và hiện bao gồm các đội ngũ tại một số công ty AI lớn cũng như một vài công ty tập trung vào khả năng diễn giải, các tổ chức phi lợi nhuận, các học giả và các nhà nghiên cứu độc lập. Thật hữu ích khi đưa ra một bản tóm tắt ngắn gọn về những gì lĩnh vực này đã đạt được cho đến nay, và những gì còn phải làm nếu chúng ta muốn áp dụng khả năng diễn giải cơ học để giải quyết một số rủi ro chính nêu trên.

Kỷ nguyên đầu tiên của khả năng diễn giải cơ học (2014-2020) tập trung vào các mô hình thị giác và đã xác định được một số neuron bên trong các mô hình đại diện cho các khái niệm mà con người có thể hiểu được, chẳng hạn như "bộ phát hiện ô tô" hoặc "bộ phát hiện bánh xe", tương tự như các giả thuyết và nghiên cứu thần kinh học ban đầu cho rằng não người có các neuron tương ứng với những người hoặc khái niệm cụ thể, thường được phổ biến dưới tên gọi neuron “Jennifer Aniston” (và trên thực tế, chúng tôi đã tìm thấy các neuron rất giống như vậy trong các mô hình AI). Chúng tôi thậm chí đã có thể khám phá cách các neuron này kết nối với nhau—ví dụ, bộ phát hiện ô tô tìm kiếm các bộ phát hiện bánh xe đang kích hoạt bên dưới chiếc xe, và kết hợp điều đó với các tín hiệu thị giác khác để quyết định xem vật thể mà nó đang nhìn thấy có thực sự là một chiếc ô tô hay không.

Khi Chris và tôi rời đi để thành lập Anthropic, chúng tôi quyết định áp dụng khả năng diễn giải vào lĩnh vực ngôn ngữ đang mới nổi, và vào năm 2021 đã phát triển một số nền tảng toán học và cơ sở hạ tầng phần mềm cần thiết để thực hiện điều đó. Chúng tôi ngay lập tức tìm thấy một số cơ chế cơ bản trong mô hình thực hiện những công việc thiết yếu để diễn giải ngôn ngữ: sao chép và khớp mẫu tuần tự. Chúng tôi cũng tìm thấy một số neuron đơn lẻ có thể diễn giải được, tương tự như những gì chúng tôi tìm thấy trong các mô hình thị giác, đại diện cho nhiều từ ngữ và khái niệm khác nhau. Tuy nhiên, chúng tôi nhanh chóng phát hiện ra rằng trong khi một số neuron có thể diễn giải ngay lập tức, thì phần lớn lại là một sự pha trộn rời rạc của nhiều từ ngữ và khái niệm khác nhau. Chúng tôi gọi hiện tượng này là chồng chất (superposition), và chúng tôi nhanh chóng nhận ra rằng các mô hình có khả năng chứa hàng tỷ khái niệm, nhưng theo một cách thức hỗn độn đến mức chúng tôi không thể hiểu được. Mô hình sử dụng sự chồng chất vì điều này cho phép nó thể hiện nhiều khái niệm hơn số lượng neuron hiện có, giúp nó học hỏi được nhiều hơn. Nếu sự chồng chất có vẻ rối rắm và khó hiểu, đó là vì, như mọi khi, việc học và vận hành của các mô hình AI không hề được tối ưu hóa để con người có thể đọc hiểu.

Sự khó khăn trong việc diễn giải các trạng thái chồng chất đã chặn đứng tiến độ trong một thời gian, nhưng cuối cùng chúng tôi đã phát hiện ra (song song với những người khác) rằng một kỹ thuật hiện có từ xử lý tín hiệu gọi là sparse autoencoders (bộ tự mã hóa thưa) có thể được sử dụng để tìm ra các tổ hợp neuron tương ứng với các khái niệm sạch hơn, dễ hiểu hơn đối với con người. Các khái niệm mà những tổ hợp neuron này có thể thể hiện tinh tế hơn nhiều so với các mạng thần kinh đơn lớp: chúng bao gồm khái niệm "thực sự hoặc ẩn dụ về việc rào đón hoặc do dự", và khái niệm "các thể loại âm nhạc thể hiện sự bất mãn". Chúng tôi gọi các khái niệm này là các đặc trưng (features), và sử dụng phương pháp sparse autoencoder để lập bản đồ chúng trong các mô hình ở mọi quy mô, bao gồm cả các mô hình hiện đại tiên tiến nhất. Ví dụ, chúng tôi đã có thể tìm thấy hơn 30 triệu đặc trưng trong một mô hình thương mại cỡ trung bình (Claude 3 Sonnet). Ngoài ra, chúng tôi đã sử dụng một phương pháp gọi là tự diễn giải (autointerpretability)—sử dụng chính hệ thống AI để phân tích các đặc trưng diễn giải—nhằm mở rộng quy trình không chỉ là tìm kiếm các đặc trưng, mà còn liệt kê và xác định ý nghĩa của chúng theo thuật ngữ của con người.

Việc tìm kiếm và xác định 30 triệu đặc trưng là một bước tiến đáng kể, nhưng chúng tôi tin rằng thực tế có thể có một tỷ hoặc nhiều hơn các khái niệm ngay cả trong một mô hình nhỏ, vì vậy chúng tôi mới chỉ tìm thấy một phần nhỏ những gì có khả năng tồn tại ở đó, và công việc theo hướng này vẫn đang được tiếp tục. Các mô hình lớn hơn, như những mô hình được sử dụng trong các sản phẩm mạnh mẽ nhất của Anthropic, thậm chí còn phức tạp hơn.

Khi một đặc trưng được tìm thấy, chúng ta có thể làm nhiều hơn là chỉ quan sát nó hoạt động—chúng ta có thể tăng hoặc giảm tầm quan trọng của nó trong quá trình xử lý của mạng thần kinh. "Máy MRI" của khả năng diễn giải có thể giúp chúng ta phát triển và tinh chỉnh các biện pháp can thiệp—gần giống như việc tác động vào một phần chính xác trong não bộ của ai đó. Đáng nhớ nhất là chúng tôi đã sử dụng phương pháp này để tạo ra "Golden Gate Claude", một phiên bản của một trong các mô hình của Anthropic, nơi đặc trưng "Cầu Cổng Vàng" (Golden Gate Bridge) được khuếch đại một cách nhân tạo, khiến mô hình trở nên ám ảnh với cây cầu này, nhắc đến nó ngay cả trong những cuộc trò chuyện không liên quan.

Gần đây, chúng tôi đã chuyển từ việc theo dõi và thao tác các đặc trưng sang theo dõi và thao tác các nhóm đặc trưng mà chúng tôi gọi là “mạch” (circuits). Các mạch này cho thấy các bước trong tư duy của mô hình: cách các khái niệm hình thành từ từ ngữ đầu vào, cách các khái niệm đó tương tác để tạo thành khái niệm mới, và cách chúng vận hành bên trong mô hình để tạo ra hành động. Với các mạch, chúng ta có thể “truy vết” tư duy của mô hình. Ví dụ, nếu bạn hỏi mô hình “Thủ phủ của bang chứa Dallas là gì?”, sẽ có một mạch “nằm trong” khiến đặc trưng “Dallas” kích hoạt đặc trưng “Texas”, và sau đó là một mạch khiến “Austin” được kích hoạt sau “Texas” và “thủ phủ”. Mặc dù chúng tôi mới chỉ tìm thấy một số lượng nhỏ các mạch thông qua quy trình thủ công, chúng tôi đã có thể sử dụng chúng để xem cách mô hình suy luận qua các vấn đề—ví dụ như cách nó lập kế hoạch trước cho các vần điệu khi làm thơ, và cách nó chia sẻ các khái niệm giữa các ngôn ngữ. Chúng tôi đang nghiên cứu các phương pháp tự động hóa việc tìm kiếm mạch, vì chúng tôi dự đoán có hàng triệu mạch bên trong một mô hình tương tác với nhau theo những cách phức tạp.

Tiện ích của khả năng diễn giải (Interpretability)

Tất cả những tiến bộ này, mặc dù ấn tượng về mặt khoa học, không trả lời trực tiếp câu hỏi làm thế nào chúng ta có thể sử dụng khả năng diễn giải để giảm thiểu các rủi ro mà tôi đã liệt kê trước đó. Giả sử chúng ta đã xác định được một loạt các khái niệm và mạch—thậm chí giả sử rằng chúng ta biết tất cả chúng, và chúng ta có thể hiểu cũng như tổ chức chúng tốt hơn nhiều so với hiện nay. Vậy thì sao? Chúng ta sử dụng tất cả những thứ đó như thế nào? Vẫn còn một khoảng cách từ lý thuyết trừu tượng đến giá trị thực tiễn.

Để giúp thu hẹp khoảng cách đó, chúng tôi đã bắt đầu thử nghiệm việc sử dụng các phương pháp diễn giải của mình để tìm kiếm và chẩn đoán các vấn đề trong mô hình. Gần đây, chúng tôi đã thực hiện một thí nghiệm trong đó chúng tôi yêu cầu một “đội đỏ” (red team) cố tình đưa ra một vấn đề về căn chỉnh (alignment) vào mô hình (ví dụ: xu hướng mô hình khai thác lỗ hổng trong một tác vụ) và giao cho các “đội xanh” (blue teams) nhiệm vụ tìm ra lỗi sai của nó. Nhiều đội xanh đã thành công; điều đặc biệt liên quan ở đây là một số đội đã áp dụng hiệu quả các công cụ diễn giải trong quá trình điều tra. Chúng tôi vẫn cần mở rộng quy mô các phương pháp này, nhưng bài tập đó đã giúp chúng tôi tích lũy kinh nghiệm thực tế trong việc sử dụng các kỹ thuật diễn giải để tìm và giải quyết các lỗ hổng trong mô hình của mình.

Khát vọng dài hạn của chúng tôi là có thể nhìn vào một mô hình hiện đại nhất và về cơ bản thực hiện một “bản quét não”: một cuộc kiểm tra có xác suất cao trong việc xác định hàng loạt vấn đề bao gồm xu hướng nói dối hoặc lừa dối, tìm kiếm quyền lực, các lỗ hổng trong jailbreak, điểm mạnh và điểm yếu về nhận thức của toàn bộ mô hình, và nhiều vấn đề khác. Điều này sau đó sẽ được sử dụng song song với các kỹ thuật khác nhau để huấn luyện và căn chỉnh mô hình, giống như cách một bác sĩ có thể thực hiện chụp MRI để chẩn đoán bệnh, sau đó kê đơn thuốc để điều trị, rồi thực hiện một lần chụp MRI khác để xem quá trình điều trị tiến triển như thế nào, v.v. Nhiều khả năng một phần quan trọng trong cách chúng ta thử nghiệm và triển khai các mô hình có năng lực nhất (ví dụ: những mô hình ở Cấp độ An toàn AI 4 trong khung Chính sách Mở rộng Có trách nhiệm của chúng tôi) là bằng cách thực hiện và chính thức hóa các bài kiểm tra như vậy.

Những gì chúng ta có thể làm

Một mặt, những tiến bộ gần đây—đặc biệt là kết quả về các mạch và về thử nghiệm mô hình dựa trên khả năng diễn giải—khiến tôi cảm thấy rằng chúng ta đang trên đà đạt được bước đột phá lớn về khả năng diễn giải. Mặc dù nhiệm vụ phía trước là vô cùng to lớn, tôi có thể thấy một con đường thực tế để khả năng diễn giải trở thành một cách tinh vi và đáng tin cậy nhằm chẩn đoán các vấn đề ngay cả trong AI rất tiên tiến—một “MRI cho AI” thực thụ. Trên thực tế, với quỹ đạo hiện tại, tôi tin chắc rằng khả năng diễn giải sẽ đạt đến điểm này trong vòng 5-10 năm tới.

Mặt khác, tôi lo ngại rằng bản thân AI đang tiến bộ quá nhanh đến mức chúng ta có thể không có đủ thời gian đó. Như tôi đã viết ở nơi khác, chúng ta có thể có các hệ thống AI tương đương với một “quốc gia thiên tài trong trung tâm dữ liệu” sớm nhất là vào năm 2026 hoặc 2027. Tôi rất lo ngại về việc triển khai các hệ thống như vậy mà không nắm bắt tốt hơn về khả năng diễn giải. Các hệ thống này sẽ hoàn toàn là trung tâm của nền kinh tế, công nghệ và an ninh quốc gia, và sẽ có khả năng tự chủ đến mức tôi coi việc nhân loại hoàn toàn mù mờ về cách chúng hoạt động là điều về cơ bản không thể chấp nhận được.

Do đó, chúng ta đang trong một cuộc đua giữa khả năng diễn giải và trí thông minh của mô hình. Đây không phải là vấn đề được ăn cả ngã về không: như chúng ta đã thấy, mỗi tiến bộ trong khả năng diễn giải đều làm tăng định lượng khả năng của chúng ta trong việc nhìn vào bên trong các mô hình và chẩn đoán các vấn đề của chúng. Càng có nhiều tiến bộ như vậy, khả năng “quốc gia thiên tài trong trung tâm dữ liệu” diễn ra suôn sẻ càng cao. Có một số điều mà các công ty AI, nhà nghiên cứu, chính phủ và xã hội có thể làm để xoay chuyển tình thế:

Thứ nhất, các nhà nghiên cứu AI trong các công ty, học viện hoặc tổ chức phi lợi nhuận có thể đẩy nhanh khả năng diễn giải bằng cách trực tiếp làm việc với nó. Khả năng diễn giải nhận được ít sự chú ý hơn so với làn sóng phát hành mô hình liên tục, nhưng nó có thể quan trọng hơn. Tôi cũng cảm thấy đây là thời điểm lý tưởng để tham gia vào lĩnh vực này: các kết quả “mạch” gần đây đã mở ra nhiều hướng đi song song. Anthropic đang tăng cường đầu tư vào khả năng diễn giải, và chúng tôi có mục tiêu đạt đến mức “khả năng diễn giải có thể phát hiện đáng tin cậy hầu hết các vấn đề của mô hình” vào năm 2027. Chúng tôi cũng đang đầu tư vào các công ty khởi nghiệp về khả năng diễn giải.

Nhưng cơ hội thành công sẽ cao hơn nếu đây là nỗ lực bao trùm toàn bộ cộng đồng khoa học. Các công ty khác, như Google DeepMind và OpenAI, có một số nỗ lực về khả năng diễn giải, nhưng tôi thực sự khuyến khích họ phân bổ nhiều nguồn lực hơn. Nếu điều đó hữu ích, Anthropic sẽ cố gắng áp dụng khả năng diễn giải về mặt thương mại để tạo ra lợi thế độc nhất, đặc biệt là trong các ngành công nghiệp mà khả năng đưa ra lời giải thích cho các quyết định là rất quan trọng. Nếu bạn là đối thủ cạnh tranh và bạn không muốn điều này xảy ra, bạn cũng nên đầu tư nhiều hơn vào khả năng diễn giải!

Khả năng diễn giải cũng là một sự phù hợp tự nhiên cho các nhà nghiên cứu học thuật và độc lập: nó mang hương vị của khoa học cơ bản, và nhiều phần trong đó có thể được nghiên cứu mà không cần nguồn lực tính toán khổng lồ. Cần nói rõ rằng, một số nhà nghiên cứu độc lập và học giả có làm việc về khả năng diễn giải, nhưng chúng ta cần nhiều hơn nữa. Cuối cùng, nếu bạn đang ở một lĩnh vực khoa học khác và đang tìm kiếm cơ hội mới, khả năng diễn giải có thể là một lựa chọn đầy hứa hẹn, vì nó cung cấp dữ liệu phong phú, các phương pháp mới nổi thú vị và giá trị thực tiễn to lớn. Các nhà khoa học thần kinh đặc biệt nên cân nhắc điều này, vì việc thu thập dữ liệu trên mạng thần kinh nhân tạo dễ dàng hơn nhiều so với mạng thần kinh sinh học, và một số kết luận có thể được áp dụng ngược lại cho khoa học thần kinh. Nếu bạn quan tâm đến việc tham gia nhóm Khả năng diễn giải của Anthropic, chúng tôi đang có các vị trí Nhà khoa học Nghiên cứu và Kỹ sư Nghiên cứu đang mở.

Thứ hai, các chính phủ có thể sử dụng các quy định nhẹ nhàng để khuyến khích phát triển nghiên cứu về khả năng diễn giải và ứng dụng của nó trong việc giải quyết các vấn đề với các mô hình AI tiên phong. Xét thấy thực tiễn "AI MRI" còn rất sơ khai và chưa phát triển, rõ ràng việc quy định hoặc bắt buộc các công ty thực hiện điều này là không hợp lý, ít nhất là ở giai đoạn hiện tại: thậm chí còn chưa rõ một đạo luật tương lai nên yêu cầu các công ty làm gì. Tuy nhiên, yêu cầu các công ty công khai minh bạch các quy trình an toàn và bảo mật của họ (Chính sách Mở rộng Quy mô Trách nhiệm - RSP, và việc thực thi chính sách đó), bao gồm cách họ sử dụng khả năng diễn giải để kiểm tra các mô hình trước khi phát hành, sẽ cho phép các công ty học hỏi lẫn nhau, đồng thời làm rõ đơn vị nào đang hành xử có trách nhiệm hơn, từ đó thúc đẩy một "cuộc đua hướng tới sự xuất sắc". Chúng tôi đã đề xuất tính minh bạch về an toàn/bảo mật/RSP như một hướng đi khả thi cho luật pháp California trong phản hồi của chúng tôi gửi đến lực lượng đặc nhiệm về mô hình tiên phong của California (bản thân lực lượng này cũng đề cập đến một số ý tưởng tương tự). Khái niệm này cũng có thể được áp dụng ở cấp liên bang hoặc tại các quốc gia khác.

Thứ ba, các chính phủ có thể sử dụng các biện pháp kiểm soát xuất khẩu để tạo ra một "vùng đệm an ninh", giúp nghiên cứu về khả năng diễn giải có thêm thời gian để tiến bộ trước khi chúng ta đạt đến những AI mạnh mẽ nhất. Tôi từ lâu đã là người ủng hộ kiểm soát xuất khẩu đối với chip sang Trung Quốc vì tôi tin rằng các quốc gia dân chủ phải luôn đi trước các chế độ chuyên quyền trong lĩnh vực AI. Nhưng các chính sách này còn mang lại một lợi ích bổ sung. Nếu Mỹ và các quốc gia dân chủ khác duy trì được vị thế dẫn đầu rõ ràng về AI khi tiến gần đến "quốc gia của những thiên tài trong trung tâm dữ liệu", chúng ta có thể "chi tiêu" một phần lợi thế đó để đảm bảo rằng khả năng diễn giải có nền tảng vững chắc hơn trước khi tiến tới AI thực sự mạnh mẽ, trong khi vẫn đánh bại các đối thủ độc tài của chúng ta. Ngay cả một lợi thế dẫn trước 1 hoặc 2 năm, điều mà tôi tin rằng các biện pháp kiểm soát xuất khẩu hiệu quả và được thực thi nghiêm ngặt có thể mang lại, cũng có thể tạo ra sự khác biệt giữa một "AI MRI" thực sự hoạt động hiệu quả khi chúng ta đạt đến các cấp độ năng lực mang tính chuyển đổi, và một hệ thống không làm được điều đó. Một năm trước, chúng ta không thể truy vết suy nghĩ của một mạng thần kinh và không thể xác định hàng triệu khái niệm bên trong chúng; ngày nay chúng ta đã có thể. Ngược lại, nếu Mỹ và Trung Quốc cùng đạt đến AI mạnh mẽ (điều mà tôi dự đoán sẽ xảy ra nếu không có kiểm soát xuất khẩu), các động lực địa chính trị sẽ khiến việc chậm lại là điều gần như không thể.

Tất cả những điều này—thúc đẩy khả năng diễn giải, luật minh bạch nhẹ nhàng và kiểm soát xuất khẩu chip sang Trung Quốc—đều có ưu điểm là những ý tưởng tốt tự thân, với rất ít nhược điểm đáng kể. Dù thế nào chúng ta cũng nên thực hiện tất cả những điều này. Nhưng chúng càng trở nên quan trọng hơn khi chúng ta nhận ra rằng chúng có thể tạo ra sự khác biệt giữa việc khả năng diễn giải được giải quyết trước hay sau khi AI mạnh mẽ ra đời.

AI mạnh mẽ sẽ định hình vận mệnh của nhân loại, và chúng ta xứng đáng được hiểu những tạo vật của chính mình trước khi chúng thay đổi hoàn toàn nền kinh tế, cuộc sống và tương lai của chúng ta.

Cảm ơn Tom McGrath, Martin Wattenberg, Chris Olah, Ben Buchanan và nhiều người tại Anthropic đã đóng góp ý kiến cho các bản thảo của bài viết này.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

AnthropicDario AmodeiAn toàn AIMinh bạch AIĐạo đức AI

Bài viết được AI dịch và tổng hợp tự động từ Dario Amodei: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Dario Amodei: Tính minh bạch là nhiệm vụ cấp bách nhất trong phát triển AI | AIHOT.vn