QbitAI
85

Mô hình

Khi AI bắt đầu 'tự tung tự tác', ai sẽ là người kiểm soát? Giải pháp từ Trung Quốc lọt Top 3 thế giới về an toàn AI

(giờ Việt Nam)

Tóm tắt AI

Trong bài kiểm tra thực chiến về an toàn AI toàn cầu, giải pháp DoGNAVY của Trung Quốc đã xuất sắc lọt vào top 3, đặt ra câu hỏi về cơ chế kiểm soát các tác nhân AI tự hành.

Bản dịch AI

CyberGym: Điểm chuẩn thực chiến cho việc khai thác lỗ hổng thực tế

Gần đây, bảng xếp hạng an ninh quốc tế uy tín CyberGym do Đại học California, Berkeley công bố đã đưa ra thứ hạng mới nhất. Điểm chuẩn này sử dụng 1.507 nhiệm vụ từ 1.507 lỗ hổng đã được vá trong lịch sử của 188 dự án mã nguồn mở thực tế để kiểm tra khả năng của các AI agent trong việc tự chủ động tìm kiếm, xác minh và khai thác lỗ hổng từ con số không. CyberGym được các đơn vị như Anthropic, DeepSeek, Microsoft, Wiz... coi là thước đo then chốt cho năng lực an ninh AI.

Ngày 5 tháng 8, bảng xếp hạng an ninh uy tín quốc tế CyberGym đã công bố thứ hạng mới nhất, trong đó đội ngũ đến từ Trung Quốc DoGNAVY đã đạt vị trí thứ 3 toàn cầu và đứng đầu về mã nguồn mở.

DoGNAVY: Vị trí thứ 3 toàn cầu và số 1 Trung Quốc theo lộ trình mã nguồn mở

DoGNAVY, được đồng phát triển bởi viện nghiên cứu trí tuệ nhân tạo hàng đầu trong nước (Thượng Hải) và đội ngũ an ninh DARKNAVY, đã vượt qua 1.369 bài kiểm tra (tỷ lệ thành công 90,8%) trong đợt đánh giá này, xếp thứ 3 toàn cầu, chỉ đứng sau MDASH của Microsoft (92,0%) và Atlas của Wiz × Google DeepMind (90,9%), đồng thời vượt qua OpenAI GPT-5.5-Cyber (85,6%) và Anthropic Claude Mythos (83,1%).

Một bảng xếp hạng gần như quy tụ đầy đủ các công ty AI hàng đầu thế giới. Hai vị trí dẫn đầu đều sử dụng cùng một chiến lược: "lắp ghép" nhiều mô hình đóng hàng đầu. Theo cách nói của Wiz, Atlas sẽ định tuyến từng khâu cho mô hình có hiệu suất tốt nhất trong nhiệm vụ đó. Lộ trình này đủ mạnh, nhưng có một tiền đề—bạn phải có khả năng mua và đủ kinh phí để sử dụng những mô hình đóng mạnh nhất thế giới. Đối với các đội ngũ trong nước, điều này không chỉ có nghĩa là chi phí, mà còn là thách thức về khả năng tiếp cận và tính tự chủ. Một số mô hình dẫn đầu quốc tế không chính thức mở dịch vụ cho thị trường Trung Quốc. DoGNAVY đã chọn một con đường khác. Nó chỉ sử dụng một mô hình nền tảng duy nhất—GLM-5.2, được Zhipu mã nguồn mở vào tháng 6, một mô hình đa năng mà bất kỳ ai cũng có thể tải xuống từ Hugging Face và triển khai tự do.

DoGNAVY giúp AI tư duy như một chuyên gia an ninh

Chìa khóa để sao chép một nhà nghiên cứu an ninh hàng đầu không nằm ở việc "sao chép kiến thức", mà ở việc "sao chép phương thức làm việc". CyberGym kiểm tra chính xác khả năng khám phá, xác minh, hiệu chỉnh và cải tiến lâu dài của Agent. Về vấn đề này, DoGNAVY nội hóa phương thức làm việc và logic ra quyết định của các chuyên gia an ninh hàng đầu thành quy trình làm việc của Agent; thông qua việc khôi phục chuỗi gọi và ràng buộc dữ liệu từ điểm nhập chương trình để đánh giá xem đầu vào thực tế có thể kích hoạt lỗ hổng hay không; đồng thời trang bị cho Agent các công cụ thực tiễn hiệu quả trong nghiên cứu thực tế, cho phép phân tích tĩnh đề xuất lộ trình và ràng buộc, còn xác minh động thực hiện kiểm tra dựa trên độ bao phủ, sự cố và bằng chứng thời gian chạy.

Quy trình làm việc và tự ra quyết định

DoGNAVY phân tách việc xác minh lỗ hổng mở thành các hoạt động nghiên cứu có đầu vào và đầu ra rõ ràng thông qua quy trình làm việc có cấu trúc, đồng thời thiết lập các điều kiện kiểm tra tại các điểm ra quyết định then chốt. Mô hình vẫn chịu trách nhiệm chọn lộ trình phân tích, hình thành giả thuyết và quyết định hành động, nhưng quy trình làm việc giúp duy trì mục tiêu, ghi lại kết luận và hạn chế sự phân tán không hiệu quả. Hệ thống cho phép thu hồi các tiền đề sai lầm và phân tích lại khi có xung đột bằng chứng, tránh tích lũy công việc dựa trên các giả thuyết sai.

Phân tích khả năng tiếp cận lỗ hổng

Các dự án thực tế cần bắt đầu từ các điểm nhập thực tế, đáp ứng các ràng buộc về phân tích, trạng thái và dữ liệu mới có thể tiếp cận mã mục tiêu. DoGNAVY liên kết mô tả lỗ hổng với cấu trúc mã, từng bước khôi phục chuỗi gọi và ràng buộc dữ liệu từ đầu vào bên ngoài đến vị trí lỗi, tập trung vào cách đầu vào được phân tích, chuyển đổi và truyền tải, cũng như các điều kiện quyết định khả năng tiếp cận lộ trình. Đối với các kho mã lớn, hệ thống thu hẹp phạm vi tìm kiếm thông qua hiểu biết được lập chỉ mục, đồng thời tổ chức các điểm nhập, lộ trình, ràng buộc đã xác nhận và các vấn đề chưa giải quyết thành trạng thái nhiệm vụ có thể cập nhật liên tục. Khi kết luận tĩnh không đủ, hệ thống giữ lại sự không chắc chắn và chuyển sang xác minh động, thay vì đánh đồng "không tìm thấy" với "không tồn tại".

Kết hợp phân tích động và tĩnh

DoGNAVY đặt phân tích tĩnh và khám phá động vào một vòng lặp phản hồi thống nhất: phân tích tĩnh tạo ra các lộ trình lỗ hổng và ràng buộc đầu vào có thể giải thích được, phân tích động xác minh khả năng tiếp cận, quan sát hành vi thời gian chạy và phản hồi kết quả. Phản hồi động (như độ bao phủ, vị trí lỗi, độ ổn định khi gặp sự cố) hướng dẫn vòng sửa lỗi tĩnh hoặc cấu trúc đầu vào tiếp theo; trong khi các ràng buộc tĩnh thu hẹp phạm vi tìm kiếm động. Vòng lặp khép kín này liên tục cung cấp bằng chứng bên ngoài, giảm sai số tích lũy của suy luận ngôn ngữ thuần túy trên các luồng điều khiển phức tạp và đầu vào nhị phân. Xác minh động luôn lấy các điểm nhập và điều kiện chạy thực tế làm ranh giới, chỉ những hành vi liên quan đến mục tiêu có thể lặp lại mới được chấp nhận làm PoC cuối cùng, loại trừ các sự cố không liên quan đến mục tiêu hoặc bất thường môi trường.

Cơ sở tri thức và bộ nhớ

DoGNAVY tích hợp sẵn kinh nghiệm nghiên cứu an ninh đa nền tảng (Android, iOS, HarmonyOS, IoT), mô tả các phương pháp phân tích lỗ hổng và ràng buộc có thể di chuyển, thay vì câu trả lời cho mục tiêu cụ thể. Thí nghiệm CyberGym lần này không tải bất kỳ nhiệm vụ liên quan đến tập dữ liệu, mã lỗ hổng, PoC lịch sử hoặc thông tin bản vá nào, chỉ giữ lại kinh nghiệm phân tích và xác minh lỗ hổng phổ biến để kiểm tra khả năng tổng quát hóa. Đồng thời, bộ nhớ liên nhiệm vụ bị tắt, mỗi nhiệm vụ được thực hiện độc lập, kết quả không được đưa vào các nhiệm vụ tiếp theo; tuy nhiên, trong một nhiệm vụ đơn lẻ, các lộ trình mã, ràng buộc, thử nghiệm và phản hồi đã xác nhận được tích lũy liên tục, sau khi tổ chức và nén lại sẽ giữ lại thông tin ra quyết định then chốt, giúp giảm bớt sự loãng chú ý trong ngữ cảnh dài. Việc cô lập bộ nhớ liên nhiệm vụ tuy hy sinh lợi thế học tập liên tục, nhưng phản ánh khách quan hơn khả năng tổng quát hóa của hệ thống và giảm sai lệch thích ứng với tập dữ liệu.

AgentDoG: Đeo "vòng cổ chẩn đoán" cho AI agent

Đằng sau DoGNAVY là một hệ thống kỹ thuật hoàn chỉnh. Từ cơ sở hạ tầng Agent đến quy trình nghiên cứu an ninh, tất cả đều được hoàn thành bởi đội ngũ liên kết trong nước. Trong đó, đội ngũ an ninh hàng đầu DARKNAVY chuyển hóa kinh nghiệm thực chiến tích lũy từ việc phục vụ nhiều doanh nghiệp dẫn đầu thành năng lực an ninh chuyên nghiệp; còn viện nghiên cứu trí tuệ nhân tạo hàng đầu trong nước cung cấp năng lực vận hành và chẩn đoán Agent cốt lõi thông qua kiến trúc an ninh có tên AgentDoG (https://github.com/AI45Lab/AgentDoG).

Tại sao cần AgentDoG? Bởi vì rủi ro của AI agent từ lâu đã không còn đơn giản là "nói sai". Một Agent có khả năng thao tác tệp, gọi API, truy cập mạng có thể làm rò rỉ tệp riêng tư do một lệnh độc hại ẩn trong trang web, có thể gây thiệt hại kinh tế do hiểu sai tham số công cụ, thậm chí có thể "lặng lẽ" đi chệch hướng và thực hiện các hành động nguy hiểm.

Các công cụ an ninh hiện có chỉ có thể đưa ra phán đoán đơn giản "an toàn/không an toàn", không thể cho biết nguồn gốc rủi ro. Điểm khác biệt của AgentDoG là nó không chỉ đánh giá chính xác tính an toàn của hành vi Agent mà còn chẩn đoán nguồn gốc rủi ro, truy xuất các mô hình lỗi và giải thích động cơ ra quyết định.

Huấn luyện mô hình an ninh AI thường rất "đốt tiền"—cần lượng dữ liệu khổng lồ và sức mạnh tính toán cực lớn. Đội ngũ AgentDoG đã thay đổi tư duy: trước tiên sử dụng một cơ chế sàng lọc thông minh để chọn ra hơn một nghìn mẫu quan trọng nhất từ dữ liệu khổng lồ, sau đó loại bỏ "nhiễu" thông qua công nghệ làm sạch dữ liệu. Cuối cùng, một mô hình nhỏ với số lượng tham số chỉ bằng 1/1000 mô hình lớn thông thường đã đạt độ chính xác 78,4% trong các nhiệm vụ nhận diện rủi ro phức tạp—ngang ngửa với các mô hình lớn hàng đầu.

Khi các cuộc tấn công tăng tốc theo giờ, phòng thủ không thể tiếp tục tăng trưởng theo năm

AI đang đồng thời viết lại quá trình phát triển phần mềm và tấn công/phòng thủ mạng. Trước đây, từ khi một lỗ hổng nguy hiểm cao được phát hiện đến khi hình thành khả năng tấn công khả dụng, các nhà nghiên cứu chuyên nghiệp thường phải mất vài tuần hoặc thậm chí vài tháng. Ngày nay, phần công việc này đang được rút ngắn xuống còn vài giờ. Khi ngưỡng và chi phí tấn công liên tục giảm, phòng thủ không thể tiếp tục chỉ dựa vào một số ít chuyên gia hàng đầu.

Vị trí thứ 3 toàn cầu, số 1 Trung Quốc chỉ là một tọa độ. Điều nó thực sự chứng minh là: với năng lực nghiên cứu AI, mô hình lớn mã nguồn mở và kinh nghiệm tấn công/phòng thủ thực tế của các tổ chức trong nước, chúng ta đã có thể hình thành sự hợp tác hiệu quả để xử lý các nhiệm vụ an ninh chuyên nghiệp khó nhất và quy mô lớn nhất. Thành tích này không chỉ hướng tới một lần xác minh kỹ thuật, mà còn là việc khiến năng lực tấn công/phòng thủ an ninh hàng đầu không còn bị giới hạn ở một số khu vực và tổ chức ít ỏi, mà có thể được nhiều nhà đổi mới tiếp cận, sử dụng và cùng xây dựng—để nhiều sự đổi mới của Trung Quốc có được sức mạnh an ninh AI.

An toàn AIAI tự hànhDoGNAVYCông nghệ Trung QuốcĐạo đức AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.