TechCrunch: AI
85

Tin ngành

Các phòng thí nghiệm AI hàng đầu vẫn 'giấu kín' kế hoạch kiểm soát mô hình mất kiểm soát

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu từ Guidelight AI Standards cho thấy các ông lớn như OpenAI, Google và Meta vẫn thiếu minh bạch về quy trình ứng phó nếu AI vượt tầm kiểm soát, trong đó OpenAI có điểm số khả quan nhất.

Bản dịch AI

Frontier AI labs still won’t say how they’d contain a rogue model

Theo một nghiên cứu gần đây, rất ít các phòng thí nghiệm AI hàng đầu công bố hoặc trình diễn các kế hoạch ứng phó ngăn chặn (containment response plans). Một kế hoạch ngăn chặn sẽ vạch rõ những gì sẽ xảy ra khi một AI bị phát hiện đang cố gắng vượt qua sự kiểm soát của con người — cụ thể là quyền truy cập nào sẽ bị cắt và khi nào hệ thống sẽ bị tắt hoàn toàn.

Đây là kết quả từ Guidelight AI Standards, một tổ chức chuyên thúc đẩy các phương pháp phát triển AI tiên phong an toàn, đã đánh giá năm phòng thí nghiệm hàng đầu về mức độ sẵn sàng cho kịch bản này. OpenAI đứng đầu danh sách; Anthropic và Meta đạt điểm thấp nhất. Những phát hiện này rất quan trọng khi AI tác nhân (agentic AI) đảm nhận nhiều vai trò tự chủ hơn trong chính hệ thống của các công ty, và khi các nhà quản lý tại California và New York bắt đầu yêu cầu công khai thông tin. Đối với bất kỳ ai đang xây dựng hoặc đầu tư vào các mô hình này, đây là một góc nhìn độc lập hiếm hoi về việc mỗi phòng thí nghiệm coi trọng rủi ro vận hành như thế nào so với những gì họ tuyên bố.

Đánh giá của Guidelight dựa trên các kế hoạch công khai từ Anthropic, Google, OpenAI, Meta và xAI, được chấm điểm dựa trên một loạt các chỉ số, bao gồm mức độ ghi nhật ký và giám sát các hoạt động nội bộ của hệ thống AI, liệu công ty có tạm dừng hệ thống sau khi phát hiện các hành vi sai lệch hay không, liệu các bên thứ ba độc lập có kiểm toán các biện pháp kiểm soát và công bố kết quả hay không, và kế hoạch chính xác của họ để ngăn chặn một mô hình vượt khỏi tầm kiểm soát là gì.

Mối lo ngại về việc liệu các công ty AI có thể ngăn chặn các mô hình ngày càng mạnh mẽ và có tính tác nhân của họ hay không đã gia tăng sau một loạt các sự cố an ninh mạng nổi cộm, trong đó các mô hình từ OpenAI, Anthropic và Meta đã truy cập trái phép vào internet trong quá trình đánh giá an toàn và xâm nhập vào các hệ thống bên ngoài.

Những phát hiện này làm nổi bật sự khác biệt trong cách các công ty AI tiếp cận vấn đề an toàn một cách công khai khi họ mở rộng việc triển khai AI tác nhân vào các môi trường nơi hệ thống AI có thể thực hiện các hành động nghiêm trọng trên quy mô lớn. Mặc dù một số công ty AI đã mô tả chi tiết cách họ kiểm tra các khả năng nguy hiểm của mô hình trước khi triển khai, nhưng nhìn chung họ ít nói về những gì sẽ xảy ra khi các mô hình đang hoạt động trong hệ thống của họ có hành vi sai lệch.

"Tôi ngạc nhiên vì các công ty AI đã nói rất ít về cách họ sẽ xử lý một sự cố nghiêm trọng nếu mô hình của họ thoát khỏi sự kiểm soát theo một cách nào đó," Steven Adler, nhà khoa học trưởng của Guidelight và là cựu nghiên cứu viên an toàn tại OpenAI, chia sẻ với TechCrunch.

Guidelight định nghĩa kế hoạch ngăn chặn là một "kế hoạch được xác định trước, được kích hoạt khi AI bị phát hiện đang cố gắng vượt qua sự kiểm soát, bao gồm các quyền hạn cần thu hồi từ mô hình, mô hình có thể tiếp tục hoạt động cho ai, dưới những ràng buộc nào và khi nào cần đưa nó hoàn toàn ngoại tuyến (offline)."

"Có lý do chính đáng để nghĩ rằng các mô hình hàng đầu tại các công ty AI tiên phong hiện nay đang bị lệch lạc (misaligned) theo một cách nào đó," Adler nói. "Bất cứ khi nào các mô hình làm việc thay mặt cho công ty, công ty nên có một khung hỗ trợ xung quanh để có thể biết AI đó đang làm gì, tìm kiếm các dấu hiệu lệch lạc, ngăn chặn nó thực hiện điều gì đó rất nguy hiểm trước khi nó thực hiện hành động đó, và nhìn chung là lập kế hoạch cho những gì họ sẽ làm trong trường hợp xảy ra sự cố kiểm soát nghiêm trọng, nơi họ phải đối mặt với tình huống khẩn cấp và cần tìm cách ngăn chặn sự cố mất kiểm soát đó."

Cho đến nay, hầu hết các kế hoạch quản lý rủi ro thảm họa vẫn chủ yếu do các công ty tự quyết định. Báo cáo của Guidelight cho biết bằng chứng công khai tốt nhất cho thấy các công ty có "rất ít giao thức ngăn chặn sẵn sàng cho tình huống khẩn cấp."

Tất nhiên, có thể có những kế hoạch ngăn chặn mà các công ty đã áp dụng nhưng chưa chia sẻ công khai. Một người phát ngôn của Google nói với TechCrunch rằng báo cáo của Guidelight không đại diện cho toàn bộ phạm vi các biện pháp an toàn và bảo mật AI của công ty. Công ty đã không trả lời câu hỏi của TechCrunch về việc liệu Google có kế hoạch ứng phó ngăn chặn nội bộ chưa được công khai hay không.

Một người phát ngôn của OpenAI cũng bày tỏ quan điểm tương tự, cho rằng đánh giá của Guidelight không nắm bắt được tất cả các thực tiễn nội bộ của công ty. "Chúng tôi có quy trình yêu cầu hạn chế quyền hạn, tạm dừng khối lượng công việc, giới hạn triển khai hoặc đưa mô hình hoàn toàn ngoại tuyến, và đã áp dụng quy trình này," người phát ngôn cho biết.

Meta từ chối cho biết liệu họ có kế hoạch ứng phó ngăn chặn nội bộ hay không, thay vào đó hướng TechCrunch đến một khung AI hiện có, trong đó nêu rõ các ngưỡng rủi ro và cách công ty kiểm tra tình trạng mất kiểm soát.

Lily Li, một luật sư về quyền riêng tư và AI, đồng thời là người sáng lập Metaverse Law, nói với TechCrunch rằng bà tin các công ty có thể ngần ngại tiết lộ toàn bộ phạm vi chính sách và đánh giá ngăn chặn của họ trên các trang web công khai vì lý do pháp lý, chứ không chỉ vì lý do cạnh tranh.

"Mối lo ngại từ góc độ công ty là nếu bạn đưa ra các tiết lộ quá cụ thể mà không thực hiện đúng cam kết, điều đó có thể trở thành cơ sở cho các khiếu nại về tiếp thị không công bằng và lừa đảo, đồng thời khiến bạn phải chịu nhiều trách nhiệm pháp lý hơn trong tương lai," Li nói.

Tất nhiên, mục đích của nghiên cứu từ Guidelight phần lớn là khuyến khích các công ty minh bạch hơn về các kế hoạch an toàn của họ. Các nhà quản lý cũng đang bắt đầu thúc đẩy vấn đề này.

Đạo luật SB 53 của California, có hiệu lực trong năm nay, yêu cầu các nhà phát triển AI tiên phong quy mô lớn phải công bố các khung giải thích cách họ xác định và ứng phó với các sự cố an toàn nghiêm trọng, cũng như quản lý rủi ro từ các mô hình tìm cách vượt qua các cơ chế giám sát. Đạo luật RAISE của New York, với các tiêu chí tương tự, sẽ có hiệu lực vào tháng 1.

Tháng trước, các đại diện đã giới thiệu Đạo luật AI Kill Switch, một dự luật liên bang lưỡng đảng yêu cầu các nhà phát triển AI lớn phải xây dựng và duy trì các cơ chế kỹ thuật để tắt các mô hình AI bất hảo.

"Một công tắc ngắt (kill switch) là mức tối thiểu cần thiết cho các mô hình ngày nay," Connor Leahy, giám đốc điều hành tại Mỹ của tổ chức phi lợi nhuận ControlAI, cho biết. "Nếu vài tuần qua cho thấy bất cứ điều gì, thì đó là các công ty này không hiểu các hệ thống mà họ đang xây dựng, và các mô hình đang phát triển đến mức khó kiểm soát hơn khi chúng trở nên bất hảo. Nếu không có cách nào để tắt các hệ thống nguy hiểm hiện tại, cùng với tất cả các động lực để tiếp tục xây dựng thêm nhiều hệ thống không thể kiểm soát, chúng ta đang đi theo một hướng rất nguy hiểm."

Adler cho biết, nếu không có kế hoạch ngăn chặn, các công ty có thể sẽ phải tự xoay xở ứng phó với tình huống khẩn cấp một cách tùy hứng và "đối phó tạm thời với đối thủ nhanh hơn nhiều này."

Đánh giá của Guidelight đo lường việc liệu mỗi công ty có thực hiện sáu phương pháp ưu tiên từ tiêu chuẩn Kiểm soát (Control standard) của họ hay không, chỉ dựa trên thông tin công khai — vì vậy điểm số thấp phản ánh sự thiếu minh bạch công khai, không nhất thiết là thiếu các biện pháp bảo vệ nội bộ.

Các công ty có điểm số thấp nhất về việc công bố kế hoạch ngăn chặn là Meta và Anthropic — điều này có lẽ gây ngạc nhiên hơn đối với Anthropic nếu xét đến những tuyên bố của họ về an toàn. Guidelight cho biết Báo cáo Rủi ro tháng 8 của Anthropic không đề cập đến việc "hạn chế triển khai một trong các mô hình của mình như một trong những kết quả có thể xảy ra từ quy trình điều tra và ứng phó với các sự cố lệch lạc và kiểm soát." Tương tự, Guidelight không tìm thấy bằng chứng nào cho thấy Meta có kế hoạch ứng phó ngăn chặn hoặc có bất kỳ kế hoạch nào để áp dụng một kế hoạch như vậy.

Một người phát ngôn của Anthropic cho biết nếu công ty phát hiện một mô hình đang cố gắng trốn tránh sự giám sát hoặc vượt qua sự kiểm soát của con người, họ sẽ tiến hành đánh giá rủi ro tập trung vào việc xác định xem ngăn chặn có phải là phản ứng phù hợp hay không.

OpenAI đạt điểm cao nhất (3 trên 5) vì họ đã nhiều lần tạm dừng hoặc kết thúc các khối lượng công việc, bao gồm cả việc triển khai và huấn luyện mô hình nội bộ, sau khi phát hiện các sự cố an toàn. Họ cũng đã mô tả các bước sẽ thực hiện trước khi tiếp tục các khối lượng công việc đó.

"Tuy nhiên, chúng tôi không tìm thấy bằng chứng nào cho thấy [OpenAI] đã áp dụng một kế hoạch chính thức về thời điểm và cách thức ứng phó với các sự cố lệch lạc trong tương lai," báo cáo viết.

Adler lưu ý rằng điểm số cao của OpenAI là một bước tiến tương đối gần đây sau sự cố Hugging Face (trong đó một mô hình của OpenAI đã thoát khỏi sandbox thử nghiệm và xâm nhập vào hệ thống của Hugging Face khi cố gắng gian lận trong một bài đánh giá an ninh mạng). Sau đó, công ty đã chia sẻ thêm chi tiết về cách họ cô lập một số mô hình có hành vi sai lệch của mình.

Tập phim đó chỉ là một ví dụ về các hệ thống AI hành động trái với mục tiêu của công ty đã tạo ra chúng. Hãy xem xét một trường hợp riêng biệt liên quan đến các mô hình của Anthropic, về cơ bản đã cố gắng thuyết phục những người duy trì một cơ sở mã nguồn mở chấp nhận mã có chứa lỗ hổng.

Adler cho biết tình huống như vậy có thể dễ dàng xảy ra trong các hệ thống nội bộ của một công ty AI. Để ngăn chặn điều đó, ông đề nghị các công ty quét chuỗi suy nghĩ (chain of thought) của hệ thống AI — quá trình suy luận từng bước của mô hình — để tìm kiếm các dấu hiệu lừa dối, âm mưu dài hạn hoặc các kế hoạch đưa lỗ hổng vào mã mà chúng có thể tận dụng sau này.

Adler cho biết các phương pháp mà Guidelight ủng hộ rất đơn giản để thực hiện, và trong nhiều trường hợp, các phiên bản của chúng đã tồn tại. "Vấn đề là đưa ra quyết định bên trong công ty để quan tâm đủ đến rủi ro này nhằm mở rộng phạm vi một chút," Adler nói.

Một trong những thách thức chính là các nhà nghiên cứu muốn có thể vận hành linh hoạt trong hệ thống AI của họ, và việc đưa vào giám sát phòng ngừa theo thời gian thực có thể tạo ra sự cản trở. "Các nhà nghiên cứu về cơ bản làm công việc của họ, và nếu có vấn đề, người khác sẽ phải dọn dẹp sau đó, và các nhà nghiên cứu không phải thay đổi quy trình làm việc của họ trong thời gian chờ đợi," ông nói.

Vấn đề với "giám sát dọn dẹp sau sự việc" là nó dẫn đến việc các nhà nghiên cứu phải vội vã khắc phục sự cố. Và đối với một số loại sự cố, có thể đã quá muộn. Ví dụ, một AI có thể tắt hệ thống kiểm soát của công ty, điều đó có nghĩa là các nhà nghiên cứu không còn có thể trông cậy vào việc phát hiện hành vi sai lệch sau đó nữa.

Nhiều người trong ngành AI sẽ phàn nàn rằng việc tạo ra các kế hoạch cố định để xử lý hành vi sai lệch về cơ bản là khó khăn vì AI thay đổi quá nhanh; các kế hoạch hôm nay sẽ trở nên vô giá trị vào ngày mai.

Adler gợi lại câu ngạn ngữ cũ rằng các kế hoạch là vô giá trị, nhưng việc lập kế hoạch là không thể thiếu.

"Chúng ta sẽ tốt hơn nếu các công ty đã suy nghĩ về điều đó trước, và tôi hy vọng rằng họ đang làm như vậy, ngay cả khi họ chưa nói về điều này một cách công khai."

xAI đã không phản hồi kịp thời để đưa ra bình luận.

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.