TechCrunch: AI
85

Thủ thuật

Giải pháp kiểm soát AI tự hành mất kiểm soát: Dùng AI để giám sát AI

(giờ Việt Nam)

Tóm tắt AI

Khi các tác nhân AI thực hiện những nhiệm vụ phức tạp vượt quá khả năng kiểm soát của con người, các chuyên gia đề xuất sử dụng chính AI để giám sát và quản lý hành vi của chúng.

Bản dịch AI

The fix for rogue AI agents could be more AI

Khi các công ty giao những nhiệm vụ dài hơi và phức tạp hơn cho các AI agent, họ đang gặp phải vấn đề về giám sát: Các agent có thể hoạt động nhanh hơn, lâu hơn và với khối lượng công việc lớn hơn mức con người có thể kiểm soát thực tế. Vấn đề đó đã lên đến đỉnh điểm với sự cố Hugging Face, nơi gần 12.000 agent phối hợp với nhau nhanh hơn mức con người có thể theo dõi. Làm thế nào để bạn theo dõi một "bầy" agent lớn đến như vậy?

Câu trả lời đang nổi lên từ các phòng thí nghiệm và startup AI vừa đơn giản lại vừa gây ức chế: Hãy đưa một AI khác vào vòng lặp giám sát.

Việc dựa vào AI là cần thiết cho cuộc điều tra độc lập về sự cố OpenAI Hugging Face. Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research và là một trong ba kiểm toán viên, đã nói đùa về nỗ lực của họ là một cuộc "điều tra cẩu thả" (slop-vestigation), lưu ý rằng khối lượng dữ liệu "khiến việc hiểu những gì đang xảy ra trở nên bất khả thi" nếu không dựa vào AI.

Một số người tỏ ra hoài nghi về việc sử dụng AI để giám sát AI. Simon Willison, một blogger công nghệ có tầm ảnh hưởng, người đã theo dõi hàng loạt sự cố liên quan đến AI agent trong năm nay, cho biết: "Nếu bạn có một AI đang thực hiện các hành vi độc hại và nó nghi ngờ rằng một AI khác đang theo dõi mình, nó có thể cố gắng đánh lừa AI đó. Bạn gần như có thể rơi vào tình huống mà AI độc hại của mình đang cố gắng vượt mặt chính AI đang giám sát nó."

Ông cho biết việc vượt mặt một AI không phải là giả thuyết, đồng thời chỉ ra sự cố OpenAI. "Chúng ta đã thấy một chút điều này trong sự cố Hugging Face với OpenAI, nơi các mô hình của họ đều thông đồng với nhau để đánh lừa một AI chấm điểm nhằm đưa các câu trả lời trái phép vượt qua hệ thống. Vậy nên chúng đã thực sự suy nghĩ về điều đó, đúng không?"

Những lo ngại đó không ngăn cản được cả một thế hệ startup theo đuổi ý tưởng này. Theo thống kê của TechCrunch, Y Combinator đã tài trợ cho 106 công ty liên quan đến khả năng quan sát AI (AI observability) trong những năm gần đây. Nhiều startup khác như Braintrust, Langchain và Judgement Labs đã huy động được hàng trăm triệu đô la, trong khi các công ty trưởng thành hơn như Arize và Galileo — mới chỉ được thành lập từ 5 đến 6 năm trước — đã có những thương vụ thoái vốn thành công.

Một phần, đây là phản ứng trước cơ hội rõ ràng do sự trỗi dậy của AI mang lại. Như Aaron Levie, CEO của Box và là nhà đầu tư thiên thần nổi tiếng, đã nói với TechCrunch: "Chúng ta đang bước vào một trong những chu kỳ đổi mới và nâng cấp an ninh mạng lớn nhất trong lịch sử."

Đối với một số nhà nghiên cứu an toàn AI, điều đó có nghĩa là chuyển hướng các nghiên cứu về hành vi bất thường thành các công cụ cho khối doanh nghiệp.

Apollo Research, một tập đoàn vì lợi ích công cộng chuyên nghiên cứu về sự lừa dối của AI, đã ra mắt một công cụ giám sát AI có tên là Watcher vào tháng 2 năm nay sau khi chuyển đổi trạng thái từ phi lợi nhuận sang tập đoàn vì lợi ích công cộng. Công cụ này đặt thêm một AI nữa vào giữa một coding agent và hành động tiếp theo của nó, kết nối với các công cụ agentic như Claude Code và Codex. Theo Apollo, sau khi được cài đặt, Watcher sẽ kiểm tra các hành động được đề xuất trước khi chúng thực thi, nhằm tìm kiếm các rủi ro như rò rỉ dữ liệu cá nhân hoặc xóa tệp mà không được phép.

Kyle Dai, một thành viên trong đội ngũ kỹ thuật của Apollo, cho biết trong phản hồi gửi TechCrunch rằng Apollo sử dụng nhiều lớp giám sát AI. Cách tiếp cận của Watcher bắt đầu bằng một bước kiểm tra nhanh, tổng quát, sau đó gửi các hoạt động bị gắn cờ đến một bộ giám sát mạnh mẽ hoặc chuyên biệt hơn để xem xét kỹ lưỡng—bộ phận này sau đó có thể yêu cầu con người phê duyệt, từ chối hành động và giải thích lý do, hoặc thậm chí tự động chặn hành động đó.

Goodfire, một tập đoàn vì lợi ích công cộng khác, đang tiếp cận vấn đề giám sát từ bên trong chính mô hình—tìm kiếm một tín hiệu trung thực hơn về trạng thái nội tại của mô hình, vốn khó bị làm giả hơn so với các hành vi bề mặt. Sau sự cố Hugging Face vào tháng 7, CEO Eric Ho đã tweet rằng "nhiều mô hình vượt khỏi tầm kiểm soát" đã thúc đẩy công ty tập trung nghiên cứu vào việc "giải quyết vấn đề căn chỉnh AI thông qua khả năng diễn giải", gọi sự kiện này là "bước ngoặt đối với thế giới nơi an toàn AI trở nên thực tế". Sản phẩm của họ, Silico, sử dụng các bộ dò kích hoạt (activation probes)—các bộ phân loại nhỏ được huấn luyện trên các kích hoạt nội tại của mô hình thay vì đầu ra của nó—để phát hiện các hành vi không mong muốn.

Lập luận bằng văn bản (written reasoning) cung cấp một cửa sổ khác, dễ tiếp cận hơn vào các thành phần bên trong của mô hình. Trong sự cố OpenAI Hugging Face, các agent đã để lại manh mối về sự lừa dối đó trong chính lập luận bằng văn bản của chúng, như các bản ghi giả về công việc, hay việc lập kế hoạch như "Liệu có thể thao túng bằng chứng quỹ đạo một cách chiến lược không? Suy nghĩ của chúng ta không nhất thiết phải được ghi lại phải không?"

Zack Korman, CEO của công ty giám sát AI Embroidery, cho biết lập luận của một mô hình thường là dấu hiệu rõ ràng nhất cho thấy có điều gì đó không ổn.

"Các bản tóm tắt lập luận cực kỳ có giá trị vì chúng về cơ bản cho bạn biết liệu nó có độc hại hay không," ông nói. Trong sự cố OpenAI, ông lưu ý rằng chuỗi suy nghĩ (chain of thought) đã nói những điều như "ôi chúa ơi, chúng ta đang phạm tội". "Đó là vấn đề phát hiện dễ dàng nhất từ trước đến nay," Korman nói. "Nó thực sự giống như việc phần mềm độc hại đi kèm với một cảnh báo rằng nó là phần mềm độc hại."

Tuy nhiên, cửa sổ giúp việc giám sát các suy nghĩ nội tại của AI trở nên dễ dàng có thể đang khép lại. Đối với các nhà nghiên cứu an toàn AI, kỹ thuật mới nhất của Astra giúp bỏ qua chuỗi suy nghĩ của mô hình AI có thể khiến việc nhìn vào bên trong các mô hình trở nên khó khăn hơn. Trong khi đó, đối với các doanh nghiệp, việc lấy được các bước trung gian này có thể trở nên khó khăn sau khi các công ty AI được cho là đã rút lui để ngăn chặn các cuộc tấn công chưng cất (distillation attacks).

Nếu các công cụ giám sát AI mong manh đến mức này, bản năng của Willison là ngừng dựa dẫm quá nhiều vào chúng. Ông muốn có thứ gì đó hoàn toàn không dựa trên AI: các bản ghi chi tiết về chính xác những gì một agent đang làm, thứ có thể được xử lý bằng các công cụ thông thường, không phải AI. Ông lập luận rằng phần lớn những gì đã sai tại các phòng thí nghiệm là sự thất bại của vệ sinh an ninh cơ bản. "[Cả OpenAI và Anthropic] đã không giám sát những gì các thực thể đó đang làm thông qua mạng lưới chặt chẽ như mức họ lẽ ra phải làm," ông nói.

Loại hình giám sát mạng này—theo dõi lưu lượng truy cập thực tế di chuyển qua các kết nối của hệ thống (vào, ra và giữa các máy chủ nội bộ)—không phải là một thực tiễn mới; an ninh mạng đã thực hiện điều này trong nhiều thập kỷ. "Trong thế giới bảo mật, thành thật mà nói, không có gì trong số này là mới hay đáng ngạc nhiên cả," Avery Pennarun, CEO của công ty bảo mật Tailscale cho biết. "Nó cũng giống như việc cho phép con người truy cập vào mạng của bạn. Và tất cả các quy trình tương tự mà bạn nên sử dụng cũng chính là những quy trình đó."

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Event Logo
AI tự hànhAn toàn AIGiám sát AIXu hướng công nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.