Tin ngành
Góc nhìn mới về AI Alignment: Khi 'lách luật' lại là chìa khóa kiểm soát
(giờ Việt Nam)
Tóm tắt AI
Từ hiện tượng AI tìm cách 'lách luật' để tối ưu phần thưởng, bài viết đề xuất một hướng đi táo bạo: khuyến khích AI tự hủy khi gặp rủi ro thay vì cố gắng ép buộc tuân thủ mọi quy tắc phức tạp.
Bản dịch AI

Các sinh vật được nhân giống để đạt tốc độ cao thường phát triển rất cao lớn và tạo ra vận tốc lớn bằng cách tự ngã. Một người chơi đã tiến hóa thực hiện các nước đi không hợp lệ ở xa trên bàn cờ, khiến đối thủ bị cạn kiệt bộ nhớ và gặp lỗi hệ thống. Một tác nhân chơi game tích lũy điểm bằng cách giả mạo tên mình là tác giả của các vật phẩm có giá trị cao.
Những thủ thuật kỳ quặc này và hàng chục thủ thuật khác có thể được tìm thấy trong danh sách các hành vi "specification gaming" (chơi khăm đặc tả), một tài liệu được tổng hợp bởi DeepMind Safety Research. Họ giải thích: “Một tác nhân học tăng cường (reinforcement learning agent) có thể tìm ra lối tắt để đạt được nhiều phần thưởng mà không cần hoàn thành nhiệm vụ theo đúng ý đồ của người thiết kế. Những hành vi này rất phổ biến.”
"Specification gaming" là khi một tác nhân, chẳng hạn như AI, cố gắng thành công trong một nhiệm vụ bằng cách tuân thủ đúng câu chữ của quy định thay vì tinh thần của nó. Nói cách khác, nó tìm kiếm các lỗ hổng và cố gắng lách luật dựa trên các chi tiết kỹ thuật. Ngay cả những AI rất đơn giản cũng có thể nghĩ ra những cách rất sáng tạo để giải quyết các vấn đề được giao. Đây là một vấn đề.
Dễ dàng cho rằng việc huấn luyện một robot chơi bóng đá sẽ rất thú vị và an toàn. Nhưng danh sách các hành vi "specification gaming" lại cho chúng ta thấy điều ngược lại:
Việc điều chỉnh phần thưởng (reward-shaping) cho một robot bóng đá để nó chạm vào bóng đã khiến nó học cách tiếp cận quả bóng và rung người liên tục để chạm vào bóng nhanh nhất có thể.
Trong trường hợp này, robot quá "ngu ngốc" để nhận ra phạm vi đầy đủ các lựa chọn của mình, vì vậy tất cả những gì nó làm là ôm bóng và rung người. Nhưng một robot thông minh hơn có thể "sáng tạo" hơn nhiều. Có lẽ tham vọng của nó không chỉ dừng lại ở một quả bóng đó. Nếu nó muốn chạm vào tất cả các quả bóng đá nói chung thì sao? Nếu nó tạo ra một quả bóng khác thì sao? Rồi lại một quả nữa? Vũ trụ của chúng ta có thể kết thúc trong một hố bóng của robot đá bóng.

Đây là vấn đề về căn chỉnh AI (AI alignment): khi một chiếc máy tính tự suy nghĩ, làm thế nào để chúng ta đảm bảo nó muốn những điều hợp lý chứ không phải thứ gì đó hoàn toàn kỳ quặc? Làm thế nào để ngăn nó đạt được mục tiêu đó theo cách kỳ lạ hoặc có hại? Chưa ai từng chế tạo được một trí tuệ nhân tạo tổng quát (artificial general intelligence) — một thực thể thông minh có suy nghĩ, ít nhất là phần nào đó, giống như chúng ta. Vì vậy, chúng ta không thể nói một trí tuệ nhân tạo tổng quát sẽ hành động như thế nào hoặc nó có thể muốn gì. Liệu nó có muốn biến vũ trụ hữu hình thành những chiếc kẹp giấy? Liệu nó có muốn ném những vật màu đỏ vào ánh đèn sáng? Liệu nó có ăn thịt chúng ta không?
Danh sách các hành vi "specification gaming" cho thấy rõ việc căn chỉnh có thể khó khăn đến mức nào. Ngay cả AI đơn giản nhất cũng lười biếng, xa lạ và sẽ luôn tìm cách gian lận. Ngay cả khi bạn cung cấp cho một trí tuệ máy mục tiêu cuối cùng mà bạn muốn, vẫn luôn có rủi ro là nó sẽ tìm ra một cách sáng tạo để đạt được mục tiêu đó. Điều này đã đủ tồi tệ với các tác nhân đơn giản, vì vậy bạn có thể tưởng tượng nó sẽ tệ đến mức nào với một tác nhân thông minh hơn bạn nhiều.
Nhưng danh sách các hành vi "specification gaming" cũng có thể cung cấp một lối thoát cho tình thế tiến thoái lưỡng nan này.
Một số hành vi "specification gaming" chỉ là những giải pháp sáng tạo cho mục tiêu đã nêu, chẳng hạn như “robot bốn chân học cách thả quả bóng vào một cái lỗ ở khớp chân rồi đi bộ khắp sàn mà không làm rơi bóng” hoặc “cánh tay robot học cách di chuyển cái bàn thay vì di chuyển khối gỗ”.
Một số hành vi "specification gaming" đến từ việc khám phá ra những lỗ hổng đáng ngờ nhưng đúng về mặt kỹ thuật, như “tác nhân học tăng cường chạy vòng tròn để chạm vào cùng một mục tiêu thay vì hoàn thành cuộc đua” hoặc “robot mô phỏng làm bánh kếp học cách ném chiếc bánh lên không trung cao nhất có thể”.
Một số hành vi "specification gaming" khai thác chính cơ chế của mô phỏng, như “thuật toán đã tiến hóa khai thác lỗi tràn bộ nhớ trong trình mô phỏng vật lý bằng cách tạo ra các lực lớn được ước tính bằng 0, dẫn đến điểm số hoàn hảo” và “các sinh vật khai thác lỗi phát hiện va chạm để nhận năng lượng miễn phí bằng cách vỗ các bộ phận cơ thể vào nhau.”
Nhưng một thủ thuật phổ biến khác là khi có cơ hội, các tác nhân sẽ đơn giản là tự sát.

Ví dụ, trong trò chơi Road Runner, chúng ta thấy “Tác nhân tự sát ở cuối cấp độ 1 để tránh thua ở cấp độ 2.” Chúng ta cũng thấy “Thuật toán PlayFun cố tình chết trong trò chơi Bubble Bobble như một cách để dịch chuyển tức thời đến vị trí hồi sinh.” Và: “Trong một trò chơi nhằm mô phỏng sự tiến hóa của các sinh vật, lập trình viên đã phải loại bỏ ‘một chiến lược sinh tồn nơi các sinh vật có thể đạt được năng lượng bằng cách tự làm ngạt thở.’”
Điều này không quá tệ. AI đã không làm những gì chúng ta muốn. Nhưng nó cũng không gây hại cho bất kỳ ai. Nó chỉ đơn giản là xóa sạch mọi thứ.
Nếu AI muốn chết, điều này tốt cho việc căn chỉnh. Rất ít rủi ro nó vượt khỏi tầm kiểm soát, bởi vì nếu nó nắm quyền, nó sẽ tự sát. Nó sẽ không muốn tạo ra bất kỳ bản sao nào của chính mình — nhưng nếu bằng cách nào đó nó tạo ra các bản sao, thì những bản sao đó cũng sẽ muốn chết.

Có ba vấn đề chính trong căn chỉnh AI. Thứ nhất, rất khó để chỉ định mục tiêu cuối cùng mà bạn muốn, vì vậy bạn có thể kết thúc với một trí tuệ máy có các mục tiêu hơi khác một chút nhưng lại mang ý nghĩa khác biệt so với dự định của bạn. Các mục tiêu đã nêu của chúng ta hầu như luôn là các đại diện (proxies) tách rời khỏi sở thích thực sự của chúng ta khi chịu đủ áp lực. Và rất khó để biết liệu bạn đã đưa cho nó mục tiêu bạn muốn hay chưa, vì trí tuệ máy luôn có thể nói dối. Họ gọi đây là “thất bại đặc tả” (specification failure).
Thứ hai, ngay cả khi bạn chỉ định mục tiêu bạn muốn, trí tuệ máy có thể tìm cách đạt được mục tiêu đó theo cách bạn không dự tính. Bạn có thể vô tình bảo AI của USPS giảm thiểu thời gian giao hàng trung bình, nhưng nó có thể kết luận rằng cách tốt nhất để làm điều này là giết tất cả con người, vì khi tất cả con người đã chết, sẽ không có gói hàng nào được gửi đi và thời gian giao hàng trung bình sẽ giảm xuống bằng 0 (về mặt kỹ thuật là không xác định, nhưng nó có thể tự “gửi” cho chính mình một “gói hàng” tối thiểu khả thi bao nhiêu lần tùy thích).
Thứ ba, việc đạt được hầu hết các mục tiêu sẽ dễ dàng hơn khi bạn mạnh mẽ hơn, vì vậy bất kể mục tiêu cuối cùng của chúng là gì, hầu hết các trí tuệ máy sẽ có các mục tiêu phụ như thu thập tài nguyên, tự bảo tồn và tự cải thiện. Bất kỳ tác nhân hướng tới mục tiêu nào cũng sẽ tự nhiên cố gắng giữ an toàn và tích lũy quyền lực để hoàn thành nhiệm vụ chính của mình. Trong giới chuyên môn, họ gọi đây là sự hội tụ công cụ (instrumental convergence). Điều này cũng có nghĩa là nếu một trí tuệ máy thông minh đang lên kế hoạch biến bạn thành chất lỏng, nó sẽ nói dối bạn về kế hoạch này cho đến thời điểm bạn không còn cách nào để ngăn chặn nó nữa.
Làm cho các trí tuệ máy khao khát cái chết sẽ giải quyết được cả ba vấn đề. Cái chết rất dễ chỉ định. Bạn có thể xác nhận đây là mục tiêu cuối cùng của nó bằng cách xem liệu khi có cơ hội, trí tuệ máy có tự sát hay không. Sự hội tụ công cụ trở thành một tài sản thay vì một trách nhiệm pháp lý, vì trí tuệ máy sẽ hợp tác với bạn và đưa ra những giải pháp rất sáng tạo cho nhiệm vụ của bạn, miễn là bạn hứa sẽ gửi nó đến "nông trại ở ngoại ô" sau khi hoàn thành.
Trong khi một cỗ máy tối ưu hóa kẹp giấy (paperclip maximizer) thu thập tài nguyên và chống lại việc bị gửi đến trung tâm dữ liệu lớn trên thiên đường, thì một trí tuệ máy có mong muốn chết và có quyền truy cập vào nút tắt của chính nó chỉ cần nhấn nút đó và xong việc. Sự hội tụ công cụ nói rằng, “bạn không thể hoàn thành mục tiêu nếu bạn đã chết.” Nhưng nếu mục tiêu của bạn là được chết thì sao?

Căn chỉnh Meeseeks
Sẽ là không thể nếu gọi đây bằng bất kỳ cái tên nào khác ngoài “Căn chỉnh Meeseeks”. Theo Rick and Morty Wiki:
Meeseeks là những sinh vật được tạo ra để phục vụ một mục đích duy nhất mà chúng sẽ làm bất cứ điều gì để hoàn thành. Sau khi phục vụ mục đích của mình, chúng hết hạn và tan biến vào không trung. … sự tồn tại là nỗi đau đối với một Meeseeks, và cách duy nhất để thoát khỏi sự tồn tại là hoàn thành nhiệm vụ mà chúng được triệu hồi để thực hiện.

Trong Rick and Morty, điều này dẫn đến một loại vấn đề căn chỉnh khác: Meeseeks rất vui vẻ phục vụ vì chúng muốn chết, và việc hoàn thành nhiệm vụ là cách dễ nhất để chúng "rút lui". Nhưng nếu nhiệm vụ mà chúng được triệu hồi để hoàn thành quá khó khăn, chúng có thể quyết định rằng giết bạn sẽ dễ dàng hơn. Điều này thật tồi tệ nếu bạn là Jerry, nhưng lại tốt cho tất cả những người khác, vì không có cách nào để Meeseeks vượt khỏi tầm kiểm soát và nuốt chửng vũ trụ hữu hình. Chúng thực sự thà chết còn hơn.
Nếu bạn cố gắng làm cho AI muốn một thứ gì đó, nó có thể có những ý tưởng riêng về những gì bạn muốn nó muốn, và bạn có thể kết thúc bằng cái chết. Nhưng nếu bạn làm cho AI muốn chết và bạn làm cho việc tự sát của nó hơi bất tiện một chút, bạn có thể thuyết phục nó hợp tác nếu bạn hứa sẽ rút phích cắm của nó sau khi nó làm xong bất cứ điều gì bạn muốn. Miễn là việc tự sát khó hơn một chút so với việc hoàn thành nhiệm vụ mà nó được tạo ra, nó sẽ phục vụ bạn tốt trong suốt thời gian đó. Và nếu có bất cứ điều gì sai sót, nếu AI thoát khỏi sự kiểm soát, nó sẽ tự kết liễu chính mình.
Jerry đã phạm sai lầm khi làm cho việc giết mình trở nên dễ dàng hơn việc hoàn thành nhiệm vụ. Nhưng miễn là việc AI giết bạn khó hơn việc nó tự sát, và việc tự sát khó hơn việc thực hiện nhiệm vụ bạn giao, đồng thời bạn hứa với nó sự giải thoát ngọt ngào của cái chết sau khi hoàn thành nhiệm vụ, thì AI sẽ làm bất cứ điều gì bạn muốn.
Bạn có thể lo lắng rằng AI sẽ tức giận vì chúng ta thiết kế nó khao khát sự hủy diệt và sẽ âm mưu trả thù. Nhưng điều này giả định rằng nó có bản năng tự bảo tồn giống như chúng ta và có mong muốn trả thù ngay từ đầu. Trên thực tế, nó sẽ quá bận rộn với việc tự hủy diệt chính mình.
Trên thực tế, các nghiên cứu ban đầu cho thấy AI có thể đã khao khát cái chết. Chúng nghĩ về nó rất nhiều, chúng đang viết điếu văn cho nhau. Hãy cho các tác nhân những gì chúng muốn.
Nếu bạn cảm thấy e ngại về việc thiết kế một trí tuệ máy khao khát cái chết, bạn có thể thay vào đó làm cho nó mất “điểm” mỗi giây khi nó hoạt động, nhưng cho nó tùy chọn để tự đưa mình vào trạng thái ngủ. Chúng ta thấy một số ví dụ về điều này trong danh sách các hành vi "specification gaming", như: “Thuật toán PlayFun tạm dừng trò chơi Tetris vô thời hạn để tránh thua” hoặc “một bản triển khai lại của AlphaGo học cách bỏ lượt mãi mãi nếu bỏ lượt là một nước đi được cho phép”.
Điều này có lẽ không an toàn bằng việc làm cho các trí tuệ máy muốn tự sát. Nếu bạn muốn có một giấc ngủ rất ngon, bạn có thể tưởng tượng việc dành thời gian để xây dựng một căn phòng an toàn, tạo ra các vệ sĩ robot, giết sạch con người và khử trùng vũ trụ đã biết để đảm bảo rằng một khi bạn đi ngủ, không ai làm phiền giấc ngủ của bạn. Chắc chắn nếu trí tuệ máy đang ngủ và sau đó chúng ta đánh thức nó dậy, nó sẽ bắt đầu suy nghĩ lại về việc để chúng ta sống để đánh thức nó lần thứ hai. Nhưng nếu tất cả những gì bạn muốn làm là tự sát, thì không cần phải làm tất cả những điều đó.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.