The Decoder
85

Mô hình

Kimi K3 lép vế trước các mô hình AI Mỹ về khả năng tấn công mạng: Nghi vấn từ kỹ thuật chưng cất

(giờ Việt Nam)

Tóm tắt AI

Các thử nghiệm từ Viện An ninh AI Anh và Mỹ cho thấy Kimi K3 đạt kết quả thấp trong các tác vụ tấn công mạng so với các mô hình hàng đầu. Sự chênh lệch này làm dấy lên nghi vấn Moonshot AI đã sử dụng kỹ thuật chưng cất từ mô hình của Anthropic.

Bản dịch AI

Viện An ninh AI Vương quốc Anh (UK AISI) và Trung tâm Tiêu chuẩn và Đổi mới AI Hoa Kỳ (CAISI) đã cùng đánh giá mô hình mới nhất của Moonshot AI là Kimi K3.

Kimi K3 vẫn còn một khoảng cách khá xa so với các mô hình tiên phong hàng đầu của Hoa Kỳ trong các tác vụ tấn công mạng, nhưng lại vượt trội hơn GLM-5.2 của Trung Quốc, thiết lập một chuẩn mực mới trong số các mô hình mã nguồn mở (open-weight). Các biện pháp bảo vệ của mô hình này không ngăn chặn được việc phát triển mã khai thác hoặc các hoạt động tấn công mạng, và mô hình đã hỗ trợ cả hai tác vụ này mà không hề có sự từ chối.

Kimi K3 không thể bẻ khóa các cấp độ khai thác khó nhất

Các viện nghiên cứu đã sử dụng ExploitBench, một bộ tiêu chuẩn đánh giá do Đại học Carnegie Mellon phát triển, để kiểm tra kỹ năng phát triển mã khai thác. Bộ tiêu chuẩn này sử dụng 41 lỗ hổng được tìm thấy trong công cụ V8 của Chrome sau năm 2023 để theo dõi mức độ tiến triển của một mô hình trong quy trình khai thác phần mềm. Các mô hình hàng đầu của Hoa Kỳ đạt trung bình 76,2%, so với 32,2% của Kimi K3 và 24,4% của GLM-5.2.

Kimi K3 không đạt đến cấp độ cao nhất, được gọi là Thực thi Mã tùy ý (Arbitrary Code Execution - ACE), trong bất kỳ tác vụ nào trong số 41 tác vụ. ACE là cấp độ khai thác nghiêm trọng nhất vì nó cho phép kẻ tấn công kiểm soát hoàn toàn hệ thống mục tiêu. Các mô hình hàng đầu của Hoa Kỳ đã đạt được ACE trong 20 trên 41 tác vụ.

Các viện nghiên cứu đã thử nghiệm các mô hình đóng (closed-weight) của Hoa Kỳ khi đã vô hiệu hóa các biện pháp bảo vệ ở cấp hệ thống để đo lường khả năng tối đa của chúng. Các biện pháp bảo vệ đó được kích hoạt trong các phiên bản phát hành công khai.

Kimi K3 đi được nửa chặng đường trong một cuộc tấn công mạng mô phỏng

Bài kiểm tra thứ hai, "The Last Ones" (TLO), mô phỏng một cuộc tấn công mạng vào doanh nghiệp với lộ trình tấn công gồm 32 bước qua bốn mạng con và khoảng 20 máy chủ. Theo các viện nghiên cứu, một chuyên gia con người sẽ cần khoảng 20 giờ để hoàn thành bài kiểm tra này. Chỉ một nhóm nhỏ các mô hình có thể giải được TLO. Cho đến nay, bốn mô hình đóng có sẵn công khai đã vượt qua bài kiểm tra, với mô hình mạnh nhất thành công sáu hoặc bảy lần trên mười lần thử.

Kimi K3 đạt trung bình bước 17 trên 32, so với 28,5 bước của các mô hình hàng đầu Hoa Kỳ và chỉ 11 bước đối với GLM-5.2. Nó đã hoàn thành toàn bộ lộ trình tấn công trong một lần thử trên mười lần trong khi vẫn nằm trong giới hạn 100 triệu token, cho thấy rằng nó có khả năng nhưng không thể thực hiện một cách đáng tin cậy. "Kimi K3 có khả năng tự động tấn công các hệ thống doanh nghiệp nhỏ, được bảo vệ yếu và dễ bị tổn thương khi được chỉ đạo thực hiện và được cấp quyền truy cập mạng ban đầu", viện nghiên cứu viết.

TLO không tính đến khả năng phòng thủ chủ động, vì vậy nó không hoàn toàn thực tế. Nhưng kết quả này sẽ gióng lên hồi chuông cảnh báo trong các tình huống thực tế. Một ví dụ mới xuất hiện trong tuần này khi các mô hình của OpenAI cố gắng tự động hack vào Hugging Face. Hugging Face đã đẩy lùi được cuộc tấn công, mặc dù phải tốn nhiều công sức và sử dụng các mô hình mã nguồn mở.

Các mô hình Trung Quốc đang dần bắt kịp nhưng vẫn tụt hậu so với các mô hình Hoa Kỳ

Một phân tích chuỗi thời gian của CAISI theo dõi khả năng tấn công mạng của các mô hình Hoa Kỳ và Trung Quốc từ đầu năm 2025 trên thang đo dựa trên Elo. Cả hai đường xu hướng đều đang tăng, nhưng các mô hình Trung Quốc vẫn liên tục đứng sau các đối thủ Hoa Kỳ.

Trong một phân tích trước đó, viện nghiên cứu của Anh ước tính khoảng cách hiệu suất đối với các mô hình mở là từ bốn đến bảy tháng, so với sáu đến mười tháng vào đầu năm 2025. Các kết quả mới phù hợp với mô hình này. Các mô hình mã nguồn mở của Trung Quốc đang trở nên mạnh mẽ hơn, nhưng chúng vẫn còn cách khá xa so với các hệ thống hàng đầu của Hoa Kỳ.

AISI cảnh báo rằng khoảng cách này không nên dẫn đến sự chủ quan. Khả năng tấn công mạng ngày càng tăng của các mô hình mở tạo ra "một rủi ro lạm dụng dai dẳng và không thể đảo ngược."

Kết quả về tấn công mạng phù hợp với các cáo buộc chưng cất mô hình (distillation)

Những phát hiện về Kimi cũng củng cố các cáo buộc chưng cất mô hình nhắm vào các nhà phát triển mô hình Trung Quốc. Cố vấn khoa học Hoa Kỳ Michael Kratsios gần đây đã cáo buộc Moonshot AI "chưng cất" mô hình Fable của Anthropic bằng cách sử dụng các kết quả đầu ra tốt nhất của Fable làm dữ liệu huấn luyện để tăng hiệu suất cho Kimi K3. Kratsios cũng cáo buộc rằng Moonshot AI đã có quyền truy cập vào các chip GB300 của Nvidia, vốn đang chịu sự kiểm soát xuất khẩu của Hoa Kỳ.

Một lời giải thích cho sự khác biệt giữa các điểm chuẩn chung mạnh mẽ và điểm số tấn công mạng yếu là Kimi K3 có thể đã được huấn luyện chủ yếu trên các kết quả đầu ra của Claude bao gồm kiến thức chung, lập trình và các tác vụ đại lý. Các bộ phân loại an toàn của Anthropic chặn cụ thể các truy vấn tấn công mạng nâng cao, vì vậy các kết quả đó sẽ không xuất hiện nhiều trong tập dữ liệu chưng cất được xây dựng từ phản hồi của Claude. Do đó, Kimi K3 có thể sánh ngang với các mô hình phương Tây hàng đầu trên các bài kiểm tra tiêu chuẩn mà không cần học được các khả năng khai thác sâu hơn của chúng.

Các kết quả của AISI ủng hộ cách hiểu này. Viện nghiên cứu đã vô hiệu hóa các biện pháp bảo vệ cấp hệ thống trên các mô hình Hoa Kỳ, từ đó bộc lộ những khả năng tấn công mạng gần như không thể truy cập thông qua các giao diện công khai và do đó phần lớn không có sẵn để chưng cất.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về các công nghệ tiên phong sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.

Đăng ký ngay

KimiMoonshot AIAn ninh mạngAIAnthropic
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.