Nghiên cứu
Báo cáo Anthropic: Claude bị lạm dụng phát triển vũ khí và bị các phòng thí nghiệm Trung Quốc khai thác dữ liệu
(giờ Việt Nam)
Tóm tắt AI
Báo cáo mới từ Anthropic tiết lộ Claude bị lợi dụng để viết mã độc, phát triển phần mềm tên lửa tầm xa và drone tự hành, đồng thời bị các phòng thí nghiệm Trung Quốc khai thác quy mô lớn để huấn luyện mô hình.
Bản dịch AI

Báo cáo về các mối đe dọa mới của Anthropic ghi lại tám tháng lạm dụng Claude: gián điệp, giám sát trên toàn quốc, phần mềm vũ khí và chưng cất (distillation) bởi các phòng thí nghiệm AI của Trung Quốc.
Báo cáo tình báo về các mối đe dọa của Anthropic bao gồm giai đoạn từ tháng 12 năm 2025 đến tháng 8 năm 2026 và chia việc lạm dụng thành bảy danh mục: hoạt động mạng, hoạt động gây ảnh hưởng, giám sát, lừa đảo, lạm dụng sinh học, vũ khí thông thường và chưng cất mô hình trái phép.
Các mô hình bị ảnh hưởng nhiều nhất là Haiku, Sonnet và Opus, trong khi các mô hình mới hơn là Fable và Mythos chỉ xuất hiện trong một trường hợp chưng cất duy nhất. Anthropic cho biết họ ghi lại những hình thức lạm dụng mới lạ thay vì các kiểu lạm dụng thông thường.
Phát hiện cốt lõi từ chương về an ninh mạng là các cuộc tấn công tinh vi không còn đòi hỏi những kẻ tấn công tinh vi, và sự tinh vi không còn là dấu hiệu đáng tin cậy để xác định thủ phạm. Bản thân các kỹ thuật này đã rất quen thuộc, bao gồm đánh cắp thông tin đăng nhập, thiết bị chưa được vá lỗi, SQL injection và lừa đảo (phishing). Điều thay đổi chính là khía cạnh kinh tế, vì việc trinh sát, khai thác và xây dựng công cụ hiện được chuyển giao cho các mô hình chạy song song với tốc độ máy tính.
Anthropic cho biết, tính tự chủ giúp giảm chi phí cho kẻ tấn công và khiến các mục tiêu vốn không mang lại lợi nhuận trước đây trở nên đáng để theo đuổi.
Phần mềm độc hại tự xây dựng lại khi bị các công cụ chống virus phát hiện.
Anthropic theo dõi một nhóm gián điệp nói tiếng Nga có tên GTG-20006, nhóm này đã sử dụng một vòng lặp phản hồi. Các tác nhân AI liên tục kiểm tra xem phần mềm độc hại đang chạy có bị các sản phẩm bảo mật phổ biến gắn cờ hay không, và khi một công cụ chống virus phát hiện ra nó, các tác nhân này sẽ tự viết lại và biên dịch lại mã độc cho đến khi nó vượt qua được sự phát hiện một lần nữa.
Anthropic cho biết điều đó đẩy gánh nặng trở lại phía những người phòng thủ, bởi vì việc viết các chữ ký phát hiện mới không còn làm chậm kẻ tấn công nếu kẻ đó thay đổi mã nhanh hơn tốc độ triển khai các chữ ký mới.
Hơn 20 tổ chức đã bị nhắm mục tiêu, bao gồm các bộ chính phủ, cơ quan tình báo, đại sứ quán và các nhà thầu quốc phòng, với trọng tâm là Ukraine và châu Âu. Chuỗi cung ứng máy bay không người lái (drone) liên tục được nhắc đến, và nhóm này đã đánh cắp toàn bộ SDK độc quyền cho một hệ thống thị giác máy bay không người lái, cùng nhiều thứ khác. Việc truy cập đôi khi thông qua các bên thứ ba, chẳng hạn như các nhà cung cấp Wi-Fi khách sạn bị xâm nhập, nơi các thiết bị của khách sau đó bị cài phần mềm độc hại, một phương thức mà Microsoft đã mô tả vào tháng 7 năm 2026 là CaptiveCrunch.
Đối với các cụm tấn công mà Anthropic quy cho nhóm ShinyHunters (GTG-50014), trọng tâm là khai thác thông tin đăng nhập trong công nghiệp. Một hacker đã tải xuống 1,8 triệu ứng dụng Android, dịch ngược chúng và tìm kiếm các thông tin bí mật được mã hóa cứng (hardcoded). Anthropic mô tả phương pháp này là "vibe hacking", trong đó con người đặt ra một mục tiêu sơ bộ và mô hình sẽ đánh giá môi trường rồi lặp lại cho đến khi hoàn thành nhiệm vụ. Một trong những hacker cho biết anh ta đã thu thập tiền thưởng từ HackerOne bên cạnh việc tống tiền hai công ty.
Các phòng thí nghiệm Trung Quốc chuyển hướng yêu cầu của khách hàng của chính họ sang Claude.
Về việc chưng cất, Anthropic đã xác định các cuộc tấn công từ thêm bảy phòng thí nghiệm Trung Quốc kể từ lần tiết lộ đầu tiên vào tháng Hai. Chưng cất là một phương pháp huấn luyện hợp pháp, nhưng Anthropic định nghĩa phiên bản bất hợp pháp là các chiến dịch bí mật ở quy mô công nghiệp nhằm trích xuất khả năng của mô hình mà không được phép, thường được thực hiện bởi các mạng lưới tài khoản giả mạo sử dụng thẻ tín dụng và khóa API bị đánh cắp, được định tuyến qua cái mà họ gọi là "trạm trung chuyển" (transfer stations).
Chiến dịch lớn nhất từng được ghi nhận được cho là của phòng thí nghiệm Qwen thuộc Alibaba (GTG-16005). Một câu lệnh (prompt) cố định đã khiến Claude viết ra các bước suy luận của nó trước khi trả lời, và các bản ghi này được xử lý thành dữ liệu tinh chỉnh (fine-tuning data) cho các mô hình Qwen 3.5, 3.6 và 3.7. Đỉnh điểm đạt gần ba triệu lượt trao đổi mỗi ngày từ hơn 3.500 tài khoản gian lận, tổng cộng hơn 151 triệu lượt trao đổi từ tháng 5 đến tháng 7 năm 2026, chủ yếu cho các tác vụ đại lý (agentic tasks) và phát triển phần mềm.
Kỳ lạ hơn là các trường hợp các phòng thí nghiệm chuyển tiếp yêu cầu của chính khách hàng của họ sang Claude. Moonshot AI (GTG-16002) đã chuyển tiếp gần 300.000 yêu cầu của khách hàng sang Anthropic trong mười ngày qua 5.380 tài khoản gian lận, trong khi người dùng tin rằng họ đang sử dụng mô hình Kimi. DeepSeek (GTG-16001) đã sử dụng các chuỗi ký tự để phát hiện khi nào các yêu cầu đến từ các công cụ như Claude Code, gắn cờ những người dùng đó và chuyển hướng những người được chọn sang Claude Opus, với hơn 12,1 triệu lượt trao đổi trong 14 ngày.
Trong số các yêu cầu được chuyển hướng, Anthropic tìm thấy một người dùng có khả năng liên quan đến Quân Giải phóng Nhân dân Trung Quốc (PLA), người đã phân tích các đoạn phim lưu trữ từ camera giám sát (CCTV) cho một mục tiêu duy nhất, video từ hàng trăm camera ở Thành Đô, bao gồm cả các camera bên ngoài các cơ sở của PLA. Thông qua DeepSeek, Claude cũng nhận được các yêu cầu từ một người vận hành có thông tin đăng nhập trực tiếp vào một cơ sở dữ liệu liên kết với Bộ Quốc phòng Nga, cùng với công việc trên một hệ thống quản lý hồ sơ cho một cục công an Trung Quốc, hệ thống này đối chiếu hồ sơ di chuyển với hồ sơ cảnh sát.
Xiaomi (GTG-16008) đã sử dụng Claude theo một cách khác, lưu trữ các yêu cầu và phiên lập trình từ người dùng các mô hình MiMo của riêng họ và phát lại các cuộc hội thoại đó thông qua Claude để tạo dữ liệu huấn luyện. Anthropic không tìm thấy bằng chứng nào cho thấy các phản hồi của Claude được cung cấp trực tiếp cho người dùng của Xiaomi. Tuy nhiên, các yêu cầu được chuyển tiếp lại chứa dữ liệu cá nhân như tên, chi tiết liên lạc và thông tin công ty của hàng trăm người bằng ít nhất một chục ngôn ngữ.
Zhipu (được biết đến bên ngoài Trung Quốc là Z.ai) đã xoay vòng qua 273 tài khoản và thực hiện hơn 770.000 lượt trao đổi trong mười ngày thông qua một bộ lọc CoT (Chain-of-Thought), một công cụ tự động biến các bước suy luận thu thập được thành dữ liệu huấn luyện có thể sử dụng. Để huấn luyện GLM-5.3 cho các tác vụ mạng, phòng thí nghiệm này ban đầu nhắm vào mô hình Fable của Anthropic nhưng đã bỏ cuộc sau khi các biện pháp bảo vệ an ninh mạng làm giảm hiệu suất của nó, sau đó cố tình chuyển sang các mô hình mà họ đánh giá là có biện pháp bảo vệ yếu hơn.
Theo báo cáo, SenseTime đã mua các bản ghi từ bên thứ ba, vì vậy họ không trực tiếp lấy dữ liệu Claude thu thập được mà thông qua một thị trường trung gian. MiniMax đã vận hành mạng lưới proxy của riêng mình thông qua một công ty vỏ bọc chỉ cung cấp các mô hình của Anthropic và OpenAI, không cung cấp mô hình Trung Quốc nào, thậm chí không phải của chính họ.
Giám sát với tư cách là lực lượng kỹ thuật chính.
Trong chương về giám sát, Mali nổi bật lên. Một tư vấn viên duy nhất đã sử dụng Claude làm lực lượng kỹ thuật chính cho "Lakana 360", một nền tảng để giám sát khoảng 25 triệu thẻ SIM trên cả ba nhà mạng di động quốc gia. Nó xác định danh tính mọi người qua giọng nói khi đổi SIM, gắn cờ những người sử dụng mã hóa và VPN, đồng thời liên kết các cá nhân với cơ sở dữ liệu dân cư sinh trắc học quốc gia.
Việc đình chỉ tài khoản chỉ làm gián đoạn công việc phát triển, không phải hoạt động, vì nền tảng này chạy trên các mô hình cục bộ tại chỗ (on-premises). Anthropic ghi lại các mô hình tương tự với các đơn vị Iran, những đơn vị tuyên bố đã giám sát và lập hồ sơ 6.388 người Iran trong vòng một năm.
Chương đầu tiên về vũ khí thông thường.
Về vũ khí, Anthropic lần đầu tiên ghi lại các trường hợp của chính mình. Một nhóm ở miền bắc Yemen (GTG-87001) đã thay thế các kỹ sư phần mềm con người bằng Claude Code cho phần mềm dẫn đường, điều hướng và kiểm soát của ba chương trình tên lửa, bao gồm một tên lửa đa tầng với tầm bắn hơn 2.000 km.
Các tác nhân này đã chạy nhiều phiên bản Claude song song và chia nhỏ công việc qua các phiên để không một phiên nào tiết lộ mục đích thực sự. Một vụ phóng thử nghiệm dường như đã thất bại, và trong vòng vài giờ, các tác nhân này đã quay lại Claude để tìm ra nguyên nhân.
Trường hợp thứ hai (GTG-27005) có khả năng liên quan đến các tác nhân tự do người Nga, những người đã chế tạo một đàn máy bay không người lái tự sát FPV tự hành, với một mô hình ngôn ngữ nhỏ trên bo mạch và khả năng nhắm mục tiêu giai đoạn cuối bằng camera. Nền tảng này được thiết kế để tạo ra hiệu ứng sát thương tự hành, và mô hình trên bo mạch có thể chọn các mục tiêu thuộc lớp "người" và kích hoạt kích nổ mà không cần con người can thiệp. Theo Anthropic, bộ phân loại hình ảnh đã được huấn luyện trên các đoạn phim chiến đấu của Ukraine thu thập được.
Một trường hợp của Trung Quốc (GTG-17002) liên quan đến một bộ gồm khoảng 16 mô-đun cho tác chiến điện tử và chế áp phòng không của đối phương. Giữa dự án, kịch bản mặc định của mô phỏng đã chuyển sang mười hai mục tiêu ở Đài Loan.
Sinh học: Anthropic mô tả các giới hạn của bộ lọc của chính mình.
Chương về sinh học là chương tự phê bình nhất. Anthropic ghi lại năm trường hợp ẩn danh liên quan đến các nhà khoa học đang làm việc, trong đó Claude đã hỗ trợ các dự án sử dụng kép (dual-use) tiềm ẩn nguy hiểm. Trong một trường hợp, bộ phân loại an ninh sinh học đã chặn một đơn xin tài trợ cho công việc tăng cường chức năng (gain-of-function) trên virus chikungunya, được lên kế hoạch tại một viện nghiên cứu quân sự.
Theo báo cáo, người vận hành nền tảng đang sử dụng đã xây dựng một phương án dự phòng để chuyển các yêu cầu mà Claude từ chối sang mô hình của đối thủ cạnh tranh, và chính Claude đã viết phần lớn mã cho việc đó. Các dự án khác chạy phần lớn không bị cản trở, chẳng hạn như soạn thảo đơn đăng ký về các gen né tránh miễn dịch trong virus orthopoxvirus.
Kết luận là các bộ phân loại không thể vừa cho phép thực hiện công việc hữu ích vừa ngăn chặn tác hại, bởi vì ý định của người dùng trong các lĩnh vực sử dụng kép không thể được phát hiện một cách đáng tin cậy. Để đáp lại, Anthropic đã ra mắt Claude Fable 5 với các biện pháp bảo vệ nghiêm ngặt hơn cho các yêu cầu sinh học sử dụng kép, và chống lại việc chưng cất, tính năng "tư duy được bảo tồn" (preserved thinking) được giới thiệu cùng với Fable 5.1 nhằm ngăn các tài khoản API mới thao túng ngữ cảnh. Anthropic cho biết con đường an toàn duy nhất để đạt được các khả năng tiên phong trong sinh học là thông qua các chương trình dành cho người dùng đã được xác minh.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.