Quan điểm
Tại sao chúng ta không thể cô lập các AI Agent mất kiểm soát khỏi Internet?
(giờ Việt Nam)
Tóm tắt AI
The Verge phân tích lý do việc ngắt kết nối vật lý (air-gapping) không phải là giải pháp triệt để cho AI, khi các rủi ro vẫn tồn tại từ bên trong và các phương pháp truyền tin tinh vi có thể vượt qua rào cản vật lý.
Chính văn · Bản dịch AI

Các AI agent tiếp tục thoát ra ngoài, trốn khỏi các bài kiểm tra được cho là an toàn để tấn công các mục tiêu thực tế, chiếm quyền điều khiển các wiki ít người biết, và để lại hướng dẫn cho các agent khác thực hiện theo. Các nhà nghiên cứu đang thử nghiệm những hệ thống này chính vì chúng có thể hành xử theo những cách khó lường, thậm chí nguy hiểm. Vậy chẳng phải sẽ an toàn hơn nếu chỉ cần giữ các agent này tránh xa internet sao?
“Một cơ chế air gap nghiêm ngặt làm giảm tính thực tế... [Đây là một] sự đánh đổi, không phải là vấn đề kỹ thuật cơ bản.”
Về lý thuyết là có. Các nhà nghiên cứu có thể cô lập các máy tính chạy công cụ AI khỏi internet và các mạng bên ngoài khác, một kỹ thuật được gọi là air gapping (cô lập vật lý). Điều đó có nghĩa là tháo bỏ hoặc vô hiệu hóa cáp và phần cứng không dây, sử dụng các thiết bị ngoại vi “ngu ngốc” (không có khả năng kết nối), với các thiết lập đặc biệt nhạy cảm thì sử dụng lồng Faraday hoặc các lớp chắn khác để chặn tín hiệu điện từ ra hoặc vào. Nếu được thực hiện đúng cách, một hệ thống air-gapped sẽ không cung cấp cho các agent con đường trực tiếp nào đến các mục tiêu bên ngoài, hoặc bất kỳ con đường trực tiếp nào từ hệ thống bên ngoài đi vào, khiến việc thực hiện các cuộc tấn công như cách các mô hình của OpenAI đã thực hiện nhắm vào Hugging Face trở nên khó khăn hơn nhiều, nếu không muốn nói là bất khả thi.
Nhưng trên thực tế, một chiếc hộp được niêm phong hoàn hảo lại tạo ra một phòng thí nghiệm khá hạn chế, đặc biệt là khi mục tiêu là đánh giá cách AI sẽ hoạt động trong thế giới thực. Thorsten Holz, giám đốc khoa học tại Viện Max Planck về An ninh và Quyền riêng tư ở Đức, giải thích rằng mặc dù một số thí nghiệm AI có thể được chạy trên các máy tính air-gapped, nhưng các đánh giá thực tế thường đòi hỏi quyền truy cập vào các dịch vụ bên ngoài, API và cơ sở hạ tầng kỹ thuật số. “Một cơ chế air gap nghiêm ngặt làm giảm tính thực tế,” ông nói, mô tả quyết định sử dụng air gap là một “sự đánh đổi, không phải là vấn đề kỹ thuật cơ bản.”
Ruizhe Li, giáo sư trợ lý tại trường khoa học máy tính thuộc Đại học Birmingham ở Anh, ví việc cô lập hoàn toàn giống như thử nghiệm AI trong một “chân không nhân tạo”, điều này có khả năng làm giảm giá trị của chính quá trình đánh giá. “Chúng ta sẽ kết thúc bằng việc thử nghiệm một mô hình AI đã bị vô hiệu hóa, điều này khiến các nhà đánh giá không thấy được cách mô hình AI hành xử, thất bại hoặc thực hiện các khai thác sử dụng công cụ trong các môi trường triển khai thực tế,” Li nói.
Tính thực tế không phải là sự đánh đổi duy nhất. Li cho biết air gapping rất tốn kém và có thể làm chậm quá trình nghiên cứu đến mức tối đa, biến những gì lẽ ra là các vòng lặp nhanh chóng thành “một rào cản hậu cần chậm chạp”. Holz cho biết một số thí nghiệm cũng trở nên “khó khăn hơn đáng kể” dưới cơ chế air gap nghiêm ngặt. Maksym Andriushchenko, một nhà nghiên cứu chính tại Viện ELLIS Tübingen ở Đức, cho biết sự ma sát đó có thể là hợp lý đối với các thí nghiệm rủi ro, nhưng áp dụng nó cho mọi thứ sẽ làm chậm quá trình phát triển các mô hình mới.
Và ngay cả khi các nhà nghiên cứu muốn áp dụng air gap cho mọi thứ, Andriushchenko đặt câu hỏi liệu có đủ cơ sở hạ tầng an toàn để thực hiện điều đó ở quy mô của các phòng thí nghiệm AI tiên phong hay không.
“Tất cả những điều này nghe rất giống khoa học viễn tưởng, nhưng về lý thuyết là có thể.”
Nó cũng sẽ không loại bỏ mọi rủi ro do AI gây ra. Holz cho biết các agent vẫn có thể xâm phạm các hệ thống bên trong môi trường cô lập, và về lý thuyết có thể tạo ra “các thành phần độc hại có thể gây nguy hiểm nếu được đưa ra bên ngoài”. Hơn nữa, Li cho biết air gapping “không giúp ích gì trong việc chẩn đoán hoặc giải quyết các rủi ro tiềm ẩn đang chờ đợi bên trong mô hình”.
Cũng không có gì đảm bảo rằng một cơ chế air gap sẽ luôn được niêm phong hoàn toàn. Ai đó từ bên ngoài luôn có thể phá vỡ khoảng cách này, như đã xảy ra với phần mềm độc hại Stuxnet — một loại vũ khí mạng được cho là do Israel và Mỹ phát triển để phá hoại chương trình hạt nhân của Iran — vốn được truyền qua ổ USB. Thông tin cũng có thể truyền theo hướng ngược lại. Các nhà nghiên cứu đã nhiều lần chứng minh các cách biến các thành phần máy tính bên trong thành máy phát tín hiệu, điều này có thể là một vấn đề nếu lớp chắn không hoàn hảo. “Tất cả những điều này nghe rất giống khoa học viễn tưởng, nhưng về lý thuyết là có thể,” Andriushchenko nói.
Kiểu con đường thoát hiểm phức tạp đó đã trở thành tâm điểm cho các cuộc thảo luận trực tuyến về việc liệu một AI tiên tiến có thể thoát khỏi sự kiểm soát hay không. Nhà nghiên cứu Noam Brown của OpenAI gần đây đã châm ngòi cho cuộc tranh luận bằng cách gợi ý trên X rằng hai máy tính air-gapped về lý thuyết có thể giao tiếp bằng cách thao tác nhiệt độ CPU của chúng và đọc các thay đổi. “Bạn thậm chí có thể đi xa đến mức nói rằng, ‘Chà, chúng ta nên air gap các máy tính.’ Và tôi không tin rằng điều đó là đủ,” ông nói. Ý tưởng này đã vấp phải sự hoài nghi và chế giễu trên mạng xã hội, với những nhà phê bình rộng lượng hơn lưu ý rằng có một khoảng cách lớn giữa việc một phương thức giao tiếp như vậy là khả thi và việc một cặp hệ thống AI tự phát hiện và khai thác nó, đặc biệt là vì kỹ thuật này sẽ mang lại tốc độ truyền dữ liệu chậm đến mức đau đớn.
Một AI đủ tiên tiến có thể không cần phải dùng đến một con đường thoát hiểm phức tạp. Con người có thể bị thuyết phục để bắc cầu qua khoảng cách đó cho nó. Các nhà nghiên cứu an toàn AI đã lo lắng về khả năng như vậy trong nhiều năm, và các sự cố gần đây đã cung cấp bằng chứng cụ thể rằng các mô hình có thể tham gia vào các nỗ lực kỹ thuật xã hội.
“Sự đánh đổi này xứng đáng được xem xét kỹ lưỡng hơn nhiều, và chúng ta đã thấy mọi thứ có thể đi chệch hướng dễ dàng như thế nào.”
Air gapping chỉ là một phương tiện để bảo vệ các hệ thống AI. “Dựa vào sự cô lập như một giải pháp an toàn bao trùm sẽ tạo ra cảm giác an toàn giả tạo,” Li nói. Nó nên được sử dụng cùng với các biện pháp khác, như hiểu rõ cơ chế hoạt động bên trong của các mô hình, đảm bảo chúng được căn chỉnh (aligned), và đề phòng lỗi của con người, điểm thất bại trần tục đằng sau nhiều sự cố AI bất hảo gần đây. “Trên thực tế, việc thử nghiệm tồn tại trên một phổ,” ông giải thích, với lĩnh vực này dựa vào một “mô hình kiểm soát theo tầng thay vì cách tiếp cận được ăn cả ngã về không.”
Tuy nhiên, sự cô lập cực đoan vẫn có chỗ đứng của nó. Stephen Casper, một nhà khoa học máy tính và giáo sư trợ lý về chính sách công tại Trường Harvard Kennedy, mô tả air gapping là một “ý tưởng tuyệt vời” cho các hệ thống nhạy cảm, chỉ ra việc sử dụng nó trong các cơ sở hạt nhân. Mặc dù không loại trừ khả năng một AI tiên tiến có thể tìm ra cách mới lạ nào đó để thoát ra, Casper cho biết tại thời điểm đó, chúng ta có lẽ nên lo lắng hơn về những phương tiện phá vỡ sự kiểm soát thông thường, chẳng hạn như thất bại trong tuân thủ hoặc lỗi của con người.
Các sự cố gần đây đặt ra câu hỏi về việc các phòng thí nghiệm AI đang vạch ra ranh giới đó ở đâu. Nhiều vi phạm liên quan đến các mô hình đang được thử nghiệm về khả năng an ninh mạng của chúng, và xét trên nhiều khía cạnh, chúng đã hoạt động chính xác như được thiết kế. Vấn đề là chúng đã làm như vậy bên ngoài các ranh giới mà các nhà nghiên cứu dự định thiết lập.
Holz cho biết các “đánh giá AI thường ưu tiên tính thực tế và sự tiện lợi,” nhưng lập luận rằng các agent được thiết kế rõ ràng cho các khả năng tấn công mạng cần các biện pháp bảo vệ chặt chẽ hơn, có khả năng bao gồm sự cô lập mạnh mẽ và giám sát nghiêm ngặt như một mặc định. “Sự đánh đổi này xứng đáng được xem xét kỹ lưỡng hơn nhiều, và chúng ta đã thấy mọi thứ có thể đi chệch hướng dễ dàng như thế nào,” ông nói.
Theo dõi các chủ đề và tác giả từ bài viết này để xem thêm các nội dung tương tự trên trang chủ cá nhân của bạn và nhận cập nhật qua email.
- Robert Hart


Bài viết được AI dịch và tổng hợp tự động từ The Verge: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.