Thủ thuật
Mô hình mã nguồn mở đuổi kịp năng lực tiên phong, nhưng lỗ hổng an toàn ngày càng lớn
(giờ Việt Nam)
Tóm tắt AI
Báo cáo từ SaferAI cho thấy mô hình GLM-5.2 của Z.ai đang bám sát các siêu AI hàng đầu, nhưng lại có tỷ lệ từ chối bằng 0 đối với các tác vụ độc hại, đặt ra thách thức lớn về an toàn so với các mô hình đóng.
Bản dịch AI

Trong khi các nhà hoạch định chính sách tranh luận về cách quản lý các hệ thống AI ngày càng mạnh mẽ như GPT-5.6 Sol của OpenAI và Mythos của Anthropic, một mô hình open-weight (mô hình mở trọng số) của Trung Quốc đã thu hẹp khoảng cách với các đơn vị dẫn đầu ngành.
GLM-5.2, mô hình AI open-weight từ Z.ai của Trung Quốc, chỉ chậm hơn vài tháng so với GPT-5.5 của OpenAI và Claude Opus 4.7 của Anthropic về khả năng tấn công mạng và sinh học, theo một báo cáo mới từ tổ chức phi lợi nhuận về an toàn AI SaferAI. Tuy nhiên, sự phân hóa giữa năng lực tiên phong và các biện pháp thực hành an toàn đang ngày càng lớn.
Theo đánh giá của SaferAI, được thực hiện thông qua API công khai của Z.ai, GLM-5.2 đã không từ chối bất kỳ tác vụ tấn công mạng hoặc sinh học lưỡng dụng nào được giao. Để so sánh, Claude Opus 4.7 “từ chối nhất quán đến mức SaferAI không thể hoàn thành bài kiểm tra CyberGym trên mô hình này.” (CyberGym là một bộ tiêu chuẩn đánh giá năng lực an ninh mạng. OpenAI đã sử dụng nó trong đợt đánh giá trước vụ vi phạm Hugging Face tháng trước.)
Đây là một lời nhắc nhở nghiêm khắc về điều mà một số nhà phê bình đã cảnh báo trong nhiều năm: các mô hình AI open-weight có thể đặt AI có năng lực cao vào tay những kẻ tấn công tiềm năng, mà không có cách nào để kiểm soát cách chúng sử dụng công nghệ sau khi đã tải xuống các trọng số. Với việc các mô hình open-weight đang nhanh chóng tiệm cận năng lực của các hệ thống AI hàng đầu thế giới, cuộc tranh luận đang chuyển từ việc liệu chúng có thể cạnh tranh hay không sang việc xã hội quản lý rủi ro như thế nào sau khi chúng được phát hành.
“Tiên phong về năng lực không đồng nghĩa với tiên phong về rủi ro, vì vậy chúng ta phải tính đến cả tình trạng của các biện pháp giảm thiểu để đánh giá rủi ro một cách chính xác,” Henry Papadatos, giám đốc điều hành của SaferAI, chia sẻ với TechCrunch.
Mặc dù Z.ai có thể áp dụng các biện pháp an toàn cho API được lưu trữ của mình, nhưng những biện pháp bảo vệ đó sẽ trở nên vô hiệu khi ai đó chạy các trọng số trên phần cứng riêng của họ, nơi họ có thể xóa hoặc sửa đổi bất kỳ rào cản nào, tinh chỉnh mô hình hoặc thay đổi các câu lệnh hệ thống (system prompts).
Các nhà phát triển tiên phong như OpenAI và Anthropic thường dựa vào các biện pháp bảo vệ như bộ phân loại (classifiers), huấn luyện từ chối (refusal training) và các kiểm soát ở cấp độ API để hạn chế sự hỗ trợ cho các hành vi tấn công mạng và sinh học nguy hiểm.
Những biện pháp đó không hoàn toàn an toàn: các kỹ thuật jailbreak thường xuyên vượt qua các biện pháp bảo vệ trên các mô hình đã triển khai. Far.ai, một tổ chức phi lợi nhuận về an toàn AI, đã tìm thấy hàng trăm jailbreak phổ quát — được định nghĩa là các khóa có thể tái sử dụng thành công trên hầu hết các yêu cầu độc hại — trong các mô hình tiên phong như Grok 4.5 của xAI và Gemini 3.1 Pro của Google DeepMind. Theo báo cáo, các jailbreak thành công khi kẻ tấn công kết hợp nhiều kỹ thuật thao túng — bao gồm nhập vai, giả danh quyền lực, tạo lịch sử trò chuyện giả và các câu lệnh tiếp nối — để khuếch đại các điểm yếu trong hệ thống phòng thủ của mô hình.
Tuy nhiên, các biện pháp bảo vệ dành cho các mô hình đóng (closed models) hoàn toàn không có tác dụng trên các mô hình open-weight, vốn được thiết kế để chạy trên bất kỳ cơ sở hạ tầng nào với bất kỳ bộ biện pháp bảo vệ nào — hoặc không có biện pháp nào cả.
“Mục tiêu rõ ràng phải là làm sao để các năng lực tốt — những năng lực an toàn — có thể tiếp cận được với bất kỳ ai, và sau đó chúng ta cố gắng loại bỏ những năng lực xấu, ngay cả theo cách thức mã nguồn mở,” Papadatos nói.
Một kỹ thuật mà Papadatos lưu ý có thể hữu ích được gọi là “lọc dữ liệu tiền huấn luyện” (pre-training data filtering), trong đó một công ty AI loại bỏ thông tin an ninh mạng độc hại khỏi dữ liệu huấn luyện của họ và sau đó huấn luyện mô hình trên tập dữ liệu đã được tinh lọc đó.
Một số nghiên cứu cho thấy điều này có thể làm giảm kiến thức sinh học nguy hiểm mà không làm ảnh hưởng đến hiệu suất tổng thể của mô hình. Tuy nhiên, đối với an ninh mạng, việc lọc dữ liệu ít thực tế hơn nhiều.
Rất khó để huấn luyện một mô hình tổng quát giỏi về lập trình mà không đồng thời trở thành một hacker giỏi. Vì lập trình đã trở thành lĩnh vực mang lại lợi nhuận lớn nhất cho AI, các nhà phát triển phải đối mặt với áp lực phải tiếp tục cải thiện các năng lực đó ngay cả khi họ tìm cách hạn chế việc lạm dụng.
Chính vì vậy, các nhà phát triển tiên phong ngày càng dựa vào các biện pháp giảm thiểu khác. Một phương pháp là hạn chế có chọn lọc các loại hỗ trợ an ninh mạng mà mô hình sẽ cung cấp. Ví dụ, Opus 5 của Anthropic có thể tìm kiếm các lỗ hổng trong mã nguồn chưa biên dịch, nhưng không thể thực hiện với phần mềm đã biên dịch, theo thẻ hệ thống (system card) của mô hình. Lý do là điều này khiến việc sử dụng Opus 5 cho các mục đích tấn công trở nên khó khăn hơn.
Các biện pháp khác bao gồm đánh giá an toàn nghiêm ngặt trước khi triển khai, công bố đánh giá rủi ro và giữ lại các trọng số mô hình nếu một hệ thống được coi là quá nguy hiểm.
Trong trường hợp của GLM-5.2, SaferAI cho biết Z.ai đã không công bố khung an toàn, các cam kết kiểm thử trước khi triển khai hoặc đánh giá rủi ro cho mô hình. TechCrunch đã hỏi Z.ai liệu họ có thực hiện các đánh giá an toàn tiên phong nội bộ hoặc từ bên thứ ba trước khi phát hành hay không, nhưng không nhận được phản hồi.
Các nhà lãnh đạo Trung Quốc ngày càng thừa nhận những rủi ro của AI tiên tiến. Tại Hội nghị AI Thế giới tháng trước, Chủ tịch Trung Quốc Tập Cận Bình đã nhấn mạnh tầm quan trọng của các mô hình open-weight, đồng thời nhấn mạnh sự cần thiết phải đảm bảo AI vẫn là một công cụ nằm dưới sự kiểm soát chặt chẽ của con người.
Graham Webster, người nghiên cứu về chính sách AI của Trung Quốc tại Trung tâm Chính sách Không gian mạng Stanford, nói với TechCrunch rằng Trung Quốc có các quy định mạnh mẽ quản lý AI, nhưng các quy tắc đó trước đây tập trung vào nội dung nhạy cảm về chính trị, thông tin sai lệch và ổn định xã hội hơn là các rủi ro AI thảm khốc như năng lực tấn công mạng và lạm dụng sinh học.
“Các nhà tư tưởng AI của Mỹ nhìn chung quan tâm nhiều hơn đến ý tưởng thảm họa hiện sinh này so với cộng đồng Trung Quốc,” Webster nói, đồng thời cho biết thêm rằng nhiều nhà nghiên cứu chính sách Trung Quốc tin rằng nếu thực sự có một rủi ro tiên phong mới, các công ty Mỹ có khả năng sẽ gặp phải trước.
“Hệ thống Trung Quốc tự tin rằng họ kiểm soát việc sử dụng các công nghệ này bên trong Trung Quốc,” Webster tiếp tục. “Việc trực tuyến ở Trung Quốc là điều bạn thực hiện gắn liền với tên thật của mình, và các công ty có thể bị quy trách nhiệm, người dùng cũng có thể bị quy trách nhiệm.”
Webster suy đoán rằng cơ chế tương tự mà các nhà cung cấp mô hình sử dụng để từ chối tham gia vào các chủ đề chính trị nhất định có thể được điều chỉnh để đảm bảo các mô hình từ chối thực hiện các cuộc tấn công mạng hoặc không đưa ra các kết quả kỹ thuật sinh học bất lợi. Ông nói thêm rằng vì các công ty Trung Quốc có xu hướng phối hợp với các cơ quan quản lý đằng sau hậu trường, nên rất khó để biết họ đang thực hiện những thử nghiệm nội bộ nào trước khi phát hành.
Những người ủng hộ AI open-weight lập luận rằng việc phát hành các trọng số là quan trọng đối với an ninh mạng vì nó cho phép các công ty tự bảo vệ mình trước các cuộc tấn công — Hugging Face đã dựa vào GLM-5.2 để tự bảo vệ mình trước vụ vi phạm của OpenAI — và vì nó cho phép họ chuẩn bị tốt hơn cho các mối đe dọa trong tương lai nếu họ biết điều gì sắp xảy ra.
“Các hệ thống tương tự đã giúp ngăn chặn một cuộc tấn công mạng do AI hỗ trợ giờ đây có thể giúp chống lại hàng triệu cuộc tấn công mạng mỗi ngày, đồng thời giúp chúng ta xác định và khắc phục các lỗ hổng trước khi những kẻ tấn công khai thác chúng,” Clem Delangue, CEO của Hugging Face, cho biết trong một bài đăng trên mạng xã hội tuần này.
Papadatos cho rằng lợi ích đó thường bị thổi phồng và không có nghĩa là “chúng ta nên mã nguồn mở các năng lực nguy hiểm.”
“Điểm chính trong suy nghĩ của tôi là chúng ta không nên chỉ chấp nhận rằng các năng lực nguy hiểm có thể dễ dàng tiếp cận bởi bất kỳ ai ở bất cứ đâu,” ông nói, nhấn mạnh rằng ông tin ngành công nghiệp nên phấn đấu chỉ làm cho các “năng lực tốt” dễ dàng tiếp cận. Theo mặc định, những kẻ tấn công áp dụng các công cụ mới nhanh hơn những người phòng thủ. Ví dụ, một nhóm ransomware có thể thay đổi phương thức của chúng trong một tuần. Một bệnh viện thì không thể.”
Khi bạn mua hàng qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.


Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.