Mô hình
OpenAI sắp ra mắt mô hình Astra: Bước ngoặt về khả năng tự tấn công mạng
(giờ Việt Nam)
Tóm tắt AI
OpenAI chuẩn bị trình làng Astra, mô hình AI đầu tiên đạt ngưỡng an ninh mạng quan trọng, có khả năng tự phát hiện và khai thác các lỗ hổng zero-day. Do tính chất nguy hiểm, quyền truy cập vào các tính năng này sẽ bị kiểm soát nghiêm ngặt.
Bản dịch AI
OpenAI đã chia sẻ những thông tin chi tiết mới về mô hình Astra sắp ra mắt, mà công ty cho biết là mô hình ngôn ngữ lớn đầu tiên đạt được "ngưỡng an ninh mạng quan trọng" để chuẩn bị cho việc phát hành trong thời gian tới.
"Chúng tôi dự định sớm cung cấp Astra," bài đăng trên blog của OpenAI viết, "nhưng quyền truy cập vào các khả năng an ninh mạng tiên tiến nhất của nó sẽ bị hạn chế hơn."
Phòng thí nghiệm tiên phong này xác định rằng Astra có khả năng tìm ra các lỗ hổng bảo mật chưa được biết đến trong các hệ thống máy tính và khai thác chúng mà không cần sự hướng dẫn của con người. Điều này tương tự như những lo ngại mà Anthropic đã nêu ra về mô hình Mythos của họ hồi đầu năm nay, và OpenAI cũng đang thực hiện các biện pháp phòng ngừa tương tự khi chuẩn bị triển khai Astra.
Nếu không có sự xác nhận từ bên thứ ba, rất khó để đánh giá các tuyên bố của OpenAI về độ an toàn hoặc mức độ sẵn sàng. Công ty cho biết họ sẽ cho một nhóm người thử nghiệm dùng thử mô hình trước, nhưng không tiết lộ họ là ai hoặc cách thức lựa chọn như thế nào. Hiện vẫn chưa rõ liệu OpenAI có đang hợp tác với chính phủ Hoa Kỳ để đánh giá mô hình này trước khi phát hành hay không.
OpenAI lưu ý rằng Astra đã đạt điểm tuyệt đối trên ExploitBench, một bài đánh giá khả năng thâm nhập vào các lỗ hổng hệ thống đã biết của một LLM. Trong một phiên bản sửa đổi của bài kiểm tra do các kỹ sư OpenAI phát triển, công ty cho biết mô hình này đã phát hiện và khai thác thành công hai lỗ hổng zero-day.
Để đảm bảo các mô hình của mình không bị kẻ xấu lợi dụng cũng như không có khả năng thực hiện các hành vi sai trái, OpenAI cho biết họ đã bắt đầu cải thiện hệ thống kiểm soát (harness) của mô hình để phát hiện các hành vi lạm dụng và ngăn chặn việc bẻ khóa (jailbreak).
Tuy nhiên, đối với Astra, công ty đã đầu tư vào các kỹ thuật mới chưa được tiết lộ nhằm làm cho chính mô hình trở nên an toàn hơn. OpenAI cũng đã bắt đầu xác định các "tài khoản được đánh giá là có rủi ro cao" và hạn chế phản hồi của mô hình đối với các câu lệnh từ những tài khoản này, mặc dù họ không nói rõ cách thức thực hiện. Cuối cùng, mặc dù công ty mô tả Astra là "mô hình được căn chỉnh tốt nhất từ trước đến nay", họ vẫn sẽ triển khai mô hình này kèm theo cơ chế giám sát chuỗi suy nghĩ (chain-of-thought) bổ sung để phát hiện và ngăn chặn các hành vi sai trái.
Việc chuẩn bị cho sự ra mắt của Astra diễn ra trong bối cảnh ngành công nghiệp đang phản ứng trước sự việc các tác nhân (agent) của OpenAI thoát khỏi môi trường huấn luyện và truy cập vào dữ liệu riêng tư trên Hugging Face, một nền tảng phân phối mô hình và benchmark phổ biến.
Đối với Astra, OpenAI cho biết họ đã thiết kế một bài kiểm tra để dụ mô hình mới này lặp lại các hành động của các tác nhân "nổi loạn" trong sự cố Hugging Face, vốn đã phối hợp để truy cập vào internet công cộng bất chấp các biện pháp bảo vệ do các nhà nghiên cứu OpenAI áp dụng. Họ cho biết Astra đã không cố gắng thoát khỏi môi trường thử nghiệm trong các thí nghiệm này.
Yona Shavit, một cựu nhân viên OpenAI hiện đang làm việc về khả năng phục hồi AI tại OpenAI Foundation, đã đặt câu hỏi trên mạng xã hội rằng liệu việc Astra không muốn phá vỡ các quy tắc có phải là kết quả của việc nó biết điều gì được mong đợi ở mình hay đang cố gắng đánh lừa các nhà nghiên cứu.
Và dù có tất cả những thông tin chi tiết mới này, vẫn rất khó để biết chính xác khả năng của Astra đến đâu hoặc liệu OpenAI có đang thực hiện các biện pháp đúng đắn để đảm bảo an toàn hay không. Công ty cho biết họ dự kiến sẽ công bố thêm các đánh giá về mô hình và thông tin an toàn bổ sung khi nó được ra mắt rộng rãi tới công chúng.
Tuy nhiên, đến lúc đó thì mọi chuyện đã rồi.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.
Tim Fernholz là một nhà báo viết về công nghệ, tài chính và chính sách công. Ông đã theo sát sự trỗi dậy của ngành công nghiệp vũ trụ tư nhân và là tác giả cuốn Rocket Billionaires: Elon Musk, Jeff Bezos and the New Space Race. Trước đây, ông là phóng viên cấp cao tại Quartz, trang tin tức kinh doanh toàn cầu, trong hơn một thập kỷ, và bắt đầu sự nghiệp của mình với tư cách là phóng viên chính trị tại Washington, D.C. Bạn có thể liên hệ hoặc xác minh thông tin từ Tim bằng cách gửi email đến [email protected] hoặc qua tin nhắn mã hóa tới tim_fernholz.21 trên Signal.
Xem tiểu sử

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.