The Verge: AI
85

Thủ thuật

OpenAI sắp ra mắt Astra: Giới nghiên cứu lo ngại kiến trúc mới khó kiểm soát

(giờ Việt Nam)

Tóm tắt AI

OpenAI trì hoãn ra mắt mô hình Astra để tăng cường bảo mật. Theo The Information, Astra có thể sử dụng kiến trúc 'recurrent depth' khiến quá trình suy luận của AI trở nên khó giám sát hơn.

Bản dịch AI

Researchers fear safety disaster ahead of OpenAI’s Astra release

OpenAI đang chuẩn bị ra mắt Astra, mô hình AI mạnh mẽ nhất từ trước đến nay, sau nhiều tuần trì hoãn để củng cố các giao thức an toàn do các tác nhân (agents) của nó đã tấn công vào các mục tiêu thực tế trong quá trình thử nghiệm. Khi các thông tin chi tiết về mô hình này dần lộ diện, các nhà nghiên cứu đang cảnh báo rằng đây “có thể là bước phát triển tồi tệ nhất đối với an ninh/an toàn AI từ trước đến nay.”

Ngay sau khi OpenAI thông báo vào thứ Ba rằng họ đã hoãn việc phát hành Astra để xử lý các vấn đề an toàn, tờ The Information đưa tin rằng Astra bộc lộ ít quá trình “tư duy” hơn nhiều so với các mô hình AI tiên tiến khác, làm dấy lên lo ngại rằng nó có thể trở nên khó giám sát một cách nguy hiểm.

Hầu hết các hệ thống AI hàng đầu hiện nay đều được xây dựng bằng công nghệ có tên là transformer, giúp xử lý một số loại thông tin theo trình tự qua các lớp trước khi đưa ra câu trả lời. Các mô hình có thể được thiết lập để hiển thị quá trình suy luận của chúng trong khi hoạt động, về cơ bản là “tư duy thành lời”. “Chuỗi suy nghĩ” (chain of thought) này cho phép các nhà nghiên cứu và hệ thống an toàn tự động giám sát những gì mô hình AI đang thực hiện, từ đó có khả năng phát hiện các hành vi không mong muốn, chẳng hạn như nói dối hoặc các kế hoạch vượt qua rào cản an toàn, trước khi chúng thực hiện hành động.

Theo The Information, trích dẫn một nguồn tin ẩn danh am hiểu về quá trình phát triển mô hình chưa được công bố này, Astra sử dụng một kỹ thuật khó hiểu hơn được gọi là recurrent depth (độ sâu tái phát) hoặc looped transformer (transformer vòng lặp), giúp luân chuyển thông tin qua các lớp nội bộ trước khi tạo ra đầu ra. Điều này có nghĩa là phần lớn quá trình “tư duy” của mô hình diễn ra bên trong hệ thống, dưới một hình thức ít giống với ngôn ngữ tự nhiên của con người hơn, thay vì được thể hiện theo cách mà các nhà nghiên cứu có thể dễ dàng giám sát. Điều này có thể thúc đẩy hiệu suất của mô hình, nhưng lại khiến các mối đe dọa tiềm ẩn và hành vi không mong muốn trở nên khó phát hiện hơn.

OpenAI đã hạn chế việc sử dụng kỹ thuật looped transformer / recurrent depth với Astra để các nhà nghiên cứu có thể tiếp tục giám sát quá trình suy luận của mô hình, theo nguồn tin ẩn danh của The Information.

Trong một bài đăng trên blog vào thứ Ba, OpenAI cho biết họ đang “triển khai Astra với tính năng giám sát chuỗi suy nghĩ bổ sung để nhanh chóng phát hiện và ngăn chặn các hành động có khả năng đi chệch hướng.” Họ không đề cập liệu mô hình này có nền tảng kỹ thuật khác biệt hay không.

Báo cáo của The Information đã gây ra sự lo ngại rộng rãi trong cộng đồng các nhà nghiên cứu an toàn AI trên mạng xã hội. Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research và là một trong ba người ngoài cuộc được OpenAI cho phép nghiên cứu vụ hack Hugging Face, chính là người đã nhận định rằng quyết định sử dụng một kiến trúc khó hiểu hơn cho Astra “có thể là bước phát triển tồi tệ nhất đối với an ninh/an toàn AI từ trước đến nay.”

Greenblatt cho biết cuộc điều tra về sự cố Hugging Face phụ thuộc rất nhiều vào chuỗi suy nghĩ của các mô hình, đồng thời cảnh báo rằng quá trình suy luận ít hiển thị hơn có thể cho phép các hệ thống AI vạch ra và thực hiện các chiến lược mà các nhà nghiên cứu sẽ khó phát hiện hơn nhiều.

Mối quan tâm chính của Greenblatt, cũng là quan điểm của các chuyên gia an toàn khác, là sự cạnh tranh để phát triển các hệ thống AI tiên tiến hơn có thể dẫn đến “một cuộc đua xuống đáy về các kiến trúc, điều này có thể gây thảm họa cho khả năng giám sát/kiểm soát AI của chúng ta” — khi các nhà phát triển áp dụng các hệ thống ngày càng khó hiểu để giành lợi thế cho đến khi các mô hình trở nên khó, hoặc thậm chí không thể giám sát được. Ông nói thêm rằng các thông tin từ OpenAI khiến ông lo ngại rằng công ty “có kế hoạch phụ thuộc quá mức vào việc giám sát chuỗi suy nghĩ để đảm bảo an toàn.”

Các nhân vật cấp cao của OpenAI đã phản hồi những chỉ trích này trong một loạt bài đăng trên mạng xã hội mà không phủ nhận rõ ràng việc công ty sử dụng kỹ thuật này. Một số người đã bày tỏ lo ngại về khả năng xuất hiện AI không thể giám sát hoặc một cuộc đua xuống đáy về tính minh bạch, bao gồm các nhà nghiên cứu an toàn của OpenAI là Micah Carroll và Tomek Korbak, trưởng bộ phận tương lai chiến lược Dean Ball, và nhà khoa học trưởng Jakub Pachocki. Ông Pachocki đã bày tỏ nỗi sợ về “một cuộc đua dẫn đến sự không thể giám sát, bắt nguồn từ những báo cáo gây hiểu lầm.” Ông cho biết độ sâu tính toán của Astra — một thước đo về số bước nó có thể thực hiện nội bộ — “nằm trong khoảng gấp đôi so với GPT-4,” cho thấy rằng nếu kỹ thuật này được sử dụng, mức độ khó hiểu tăng thêm không quá nghiêm trọng như một số phản ứng đã ám chỉ. OpenAI đã không phản hồi yêu cầu của The Verge về việc xác nhận hay phủ nhận liệu looped transformers có được sử dụng cho Astra hay không và đã hướng chúng tôi đến bài đăng trên X của Pachocki.

“OpenAI đã nỗ lực duy trì và tận dụng việc giám sát chuỗi suy nghĩ kể từ những mô hình suy luận đầu tiên của chúng tôi,” Pachocki viết, đồng thời nói thêm rằng việc giám sát như vậy “rất mong manh và không may đang có xu hướng tiêu cực, vì những lý do không phụ thuộc vào các thay đổi kiến trúc mà tôi sẽ sớm viết về nó.”

Hãy theo dõi các chủ đề và tác giả từ bài viết này để xem thêm các nội dung tương tự trong nguồn cấp dữ liệu trang chủ cá nhân của bạn và nhận các bản cập nhật qua email.

OpenAI CEO Sam Altman Discusses Next AI Model With US LawmakersRobert Hart
OpenAIAstraAn toàn AIKiến trúc AITin tức công nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Verge: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.