Sản phẩm
WhatsApp ra mắt tính năng cảnh báo lừa đảo bằng AI chạy trực tiếp trên thiết bị
(giờ Việt Nam)
Tóm tắt AI
WhatsApp giới thiệu tính năng Scam Alert sử dụng mô hình AI chạy cục bộ để phát hiện tin nhắn lừa đảo mà không làm lộ dữ liệu người dùng. Mọi quy trình xử lý đều diễn ra trên thiết bị, đảm bảo quyền riêng tư tuyệt đối thông qua mã hóa đầu cuối.
Bản dịch AI

WhatsApp cam kết giúp mọi người giữ an toàn trong khi vẫn bảo vệ quyền riêng tư cho tin nhắn của họ. Khi các thủ đoạn lừa đảo ngày càng tinh vi — từ giả mạo danh tính, kỹ thuật thao túng tâm lý (social engineering) đến các chiêu trò do AI tạo ra — chúng tôi cũng không ngừng cải tiến để các biện pháp bảo vệ luôn đi trước những kẻ lừa đảo, đồng thời bảo vệ tin nhắn cá nhân của người dùng bằng mã hóa đầu cuối (end-to-end encryption).
Hôm nay, chúng tôi giới thiệu sơ lược về Scam Alert, một tính năng tùy chọn mới chạy mô hình học máy ngay trên thiết bị để cảnh báo người dùng về các tin nhắn có khả năng là lừa đảo. Không có nội dung tin nhắn nào rời khỏi thiết bị để phân loại hoặc được tự động báo cáo cho WhatsApp, Meta hay bất kỳ ai khác. Tính năng này bổ trợ cho mã hóa đầu cuối, đồng thời cho phép người dùng tự kiểm soát và nhận cảnh báo lừa đảo tùy chọn khi mô hình nhận diện được dấu hiệu lừa đảo tiềm ẩn.
Trước khi cung cấp tính năng này cho tất cả người dùng WhatsApp, chúng tôi công bố bản tổng quan kỹ thuật sớm này cùng với việc triển khai giới hạn trong bản Beta, đồng thời sẽ tiếp tục làm việc với cộng đồng Bug Bounty để kiểm thử hệ thống này. Để giúp xác thực quá trình triển khai, chúng tôi hoan nghênh phản hồi từ cộng đồng nghiên cứu bảo mật rộng lớn hơn.
Các nguyên tắc thiết kế
Những tiến bộ gần đây trong mô hình học máy trên thiết bị giúp việc phân loại văn bản chính xác hoàn toàn có thể thực hiện trên phần cứng di động mà không gặp phải các đánh đổi về hiệu năng, pin hoặc kích thước mô hình vốn trước đây khiến việc phân loại trên thiết bị trở nên kém khả thi. Scam Alert rất phù hợp với cách tiếp cận này: Mô hình đủ nhỏ để chạy trên thiết bị, đủ đơn giản để công bố cho việc đánh giá độc lập và hiệu quả mà không cần các thành phần phía máy chủ. Kiến trúc mà chúng tôi chọn phản ánh một loạt các lựa chọn có chủ đích về những gì hệ thống này có thể và không thể làm.
Theo đó, chúng tôi thiết kế Scam Alert để đáp ứng các nguyên tắc tuân thủ những cam kết cốt lõi của mã hóa đầu cuối:
Cách thức hoạt động của Scam Alert
Scam Alert là tính năng tùy chọn. Khi người dùng bật tính năng này, Scam Alert sẽ tải một mô hình học máy xuống thiết bị, nơi nó thực hiện suy luận để phân loại xem các tin nhắn đến từ người lạ có khớp với các mô hình lừa đảo đã biết hay không. Mô hình được huấn luyện dựa trên các mẫu quan sát được trong các cuộc hội thoại lừa đảo từ các báo cáo mà người dùng đã gửi cho chúng tôi. Nó thực hiện phân loại xác suất dựa trên cấu trúc hội thoại và các tín hiệu ngôn ngữ. Không có nội dung nào được tự động báo cáo cho WhatsApp, Meta hoặc bất kỳ bên thứ ba nào.
Nếu mô hình xác định một tin nhắn có khả năng là hành vi lừa đảo, người dùng sẽ thấy cảnh báo trong cuộc trò chuyện, cảnh báo này không hiển thị với người kia. Từ đó, người dùng có thể quyết định việc cần làm: chặn, báo cáo hoặc tiếp tục cuộc trò chuyện. Nếu họ cho rằng cảnh báo bị gắn cờ sai, người dùng có thể đánh dấu cuộc trò chuyện là đáng tin cậy; trong trường hợp đó, cảnh báo sẽ bị xóa và Scam Alert sẽ không gắn cờ cuộc trò chuyện đó nữa. Nếu người dùng đánh dấu tin tưởng một cuộc trò chuyện, họ cũng có thể chọn chia sẻ 5 tin nhắn gần nhất đã nhận với WhatsApp để giúp cải thiện độ chính xác của tính năng.
Các biện pháp bảo vệ nền tảng
Để duy trì các nguyên tắc trên, chúng tôi đã thiết kế Scam Alert với các yêu cầu và biện pháp bảo vệ nền tảng sau đây, mỗi yêu cầu đều được thực thi về mặt kiến trúc và có thể được các nhà nghiên cứu bảo mật xác minh độc lập thông qua chương trình bug bounty mở rộng, cũng như chính người dùng thông qua nhật ký trong ứng dụng.
Phần còn lại của bài viết này trình bày chi tiết về việc triển khai kỹ thuật cho từng yêu cầu.
Xử lý trên thiết bị và phân tích bảo mật quyền riêng tư
Như đã đề cập ở trên, mọi quá trình suy luận đều diễn ra trên thiết bị. Tuy nhiên, chúng tôi cần biết rằng bản thân tính năng này đang hoạt động hiệu quả — nghĩa là nó thực sự phát hiện được các vụ lừa đảo thực tế — và biết liệu chúng tôi có cần cập nhật nó để đi trước các hình thức lừa đảo không ngừng phát triển và cải thiện mô hình theo thời gian hay không.
Theo đó, cách tiếp cận của chúng tôi tuân theo một bộ nguyên tắc tối thiểu hóa dữ liệu. Nội dung tin nhắn không rời khỏi thiết bị và việc ghi nhật ký được thiết kế giới hạn chỉ ở các tín hiệu cần thiết để đo lường xem tính năng có đang hoạt động như dự định hay không. Ngay cả những tín hiệu đó cũng được xử lý trong môi trường điện toán bảo mật (confidential computing) xây dựng trên các TEE (Trusted Execution Environments), đảm bảo rằng quá trình xử lý diễn ra trong một môi trường an toàn mà không ai, kể cả Meta và WhatsApp, có thể truy cập. Kinh nghiệm xây dựng và bảo mật các hệ thống như Private Processing đã định hình thiết kế của hệ thống này. Chỉ các dữ liệu tổng hợp ẩn danh, có bảo mật vi sai (differentially private) mới được cung cấp cho Meta và WhatsApp. Bảo mật vi sai hoạt động bằng cách thêm nhiễu được hiệu chỉnh cẩn thận để đảm bảo về mặt toán học rằng việc thêm hoặc bớt dữ liệu của bất kỳ cá nhân nào cũng có tác động không đáng kể đến các con số tổng hợp ẩn danh. Do đó, các dữ liệu tổng hợp này cho thấy tính năng hoạt động như thế nào trên toàn bộ người dùng mà không tiết lộ bất cứ điều gì về bất kỳ cá nhân nào.
Đối với Scam Alert, dữ liệu đó được giới hạn trong hai danh mục số lượng tổng hợp, xấp xỉ:
Phân tích liên kết bảo mật (Confidential Federated Analytics)
Để ẩn danh các số liệu cảnh báo và hành động của người dùng này, chúng tôi đã xây dựng một quy trình phân tích liên kết bảo mật được thiết kế dựa trên các đảm bảo về quyền riêng tư và bảo mật sau đây, mỗi đảm bảo đều được thực thi về mặt kiến trúc và có thể xác minh từ bên ngoài:
Nền tảng của quy trình này được thiết lập dựa trên công trình nghiên cứu về phân tích liên kết (federated analytics) đã qua bình duyệt của Meta, được nêu công khai trong “PAPAYA Federated Analytics Stack: Engineering Privacy, Scalability and Practicality” (USENIX NSDI 2025). Tại đây, chúng tôi mô tả cách Scam Alert áp dụng và mở rộng nền tảng đó.
Cách thức hoạt động của Phân tích liên kết bảo mật
Quy trình hoạt động như sau:
Quy trình phân tích liên kết bảo mật được xây dựng sao cho khi bất kỳ tổng số nào đến được WhatsApp, các con số đã được tổng hợp từ nhiều người dùng và đã được thêm nhiễu bảo mật vi sai — vì vậy chúng tôi chỉ thấy các con số xấp xỉ về số lượng cảnh báo đã hiển thị và số lượng hành động được thực hiện. Chúng tôi sẽ không biết nội dung tin nhắn là gì, ai đã gửi hoặc nhận chúng, hoặc cuộc trò chuyện nào đã kích hoạt cảnh báo.

Mô hình đe dọa và Phòng thủ theo chiều sâu (Defense-in-Depth)
Quy trình phân tích liên kết bảo mật này hoạt động trong một môi trường có tính đối kháng cao. Mô hình đe dọa của chúng tôi tính đến ba nhóm kẻ tấn công: nhà cung cấp bên thứ ba hoặc chuỗi cung ứng có quyền truy cập vào các thành phần hệ thống, những người trong cuộc có ý đồ xấu hoặc bị xâm nhập có quyền truy cập vào cơ sở hạ tầng, và các tác nhân bên ngoài cố gắng khai thác bề mặt tấn công của quy trình.
Các tác nhân bên ngoài cố gắng chặn hoặc trích xuất dữ liệu chưa tổng hợp trong quá trình truyền tải hoặc xử lý.
Dữ liệu trong quá trình truyền tải được mã hóa giữa thiết bị và TEE, đồng thời được định tuyến qua một OHTTP relay của bên thứ ba. Vai trò của relay này chỉ giới hạn ở việc loại bỏ địa chỉ IP của máy khách — nó không thể giải mã, kiểm tra hoặc sửa đổi chính dữ liệu đó. Vì dữ liệu này vốn dĩ không hiển thị với bên thứ ba, nên một relay bị xâm nhập cũng không thể truy cập dữ liệu hoặc liên kết các tập dữ liệu với một người dùng cụ thể. Trong quá trình xử lý, dữ liệu được bảo vệ bởi sự cô lập mã TEE, với các điểm truy cập giới hạn trong một nhóm nhỏ các thành phần đã được kiểm duyệt.
Những người trong cuộc có quyền truy cập cơ sở hạ tầng cố gắng truy cập dữ liệu chưa tổng hợp bên trong TEE.
TEE cấm truy cập shell từ xa, bao gồm cả từ máy chủ. Cả kỹ sư Meta lẫn các hệ thống mạng đều không thể truy cập vào shell CVM trong thời gian chạy. Phần mềm được xây dựng độc quyền từ mã nguồn đã được kiểm duyệt, trong đó mọi thay đổi đều yêu cầu nhiều kỹ sư sửa đổi các cấu phần xây dựng hoặc quy trình xây dựng. Tất cả các thay đổi mã đều có thể kiểm toán, cho phép cả việc kiểm toán nội bộ liên tục và các nhà nghiên cứu bảo mật bên ngoài kiểm tra các tệp nhị phân của chúng tôi. Dữ liệu chưa tổng hợp không bao giờ có thể đọc được bên ngoài TEE; khi được lưu trữ, nó được mã hóa bằng các khóa chỉ được giải phóng cho TEE chạy cùng một tệp nhị phân đã được chứng thực, và chỉ được lưu giữ trong một khoảng thời gian giới hạn trước khi được hợp nhất vào các tổng hợp đang chạy và bị loại bỏ.
Những kẻ tấn công có quyền truy cập vật lý hoặc từ xa can thiệp vào TEE để vượt qua các đảm bảo xử lý bảo mật.
Vì các đảm bảo của TEE không phải là tuyệt đối, chúng tôi áp dụng phòng thủ theo chiều sâu: DRAM được mã hóa, tăng cường bảo mật CVM, giám sát máy chủ nâng cao và định tuyến qua OHTTP relay giúp ngăn chặn việc điều hướng dữ liệu của một người dùng cụ thể đến một máy cụ thể. Một cuộc tấn công có mục tiêu sẽ đòi hỏi phải xâm nhập toàn bộ hệ thống theo cách có thể phát hiện công khai thông qua tính minh bạch có thể xác minh.
Không phân phối mô hình có mục tiêu
Mô hình được tải xuống từ CDN, không được mã hóa cứng vào ứng dụng, để các cải tiến về độ chính xác và phạm vi bao phủ đối với các thủ đoạn lừa đảo mới nổi có thể đến được với người dùng mà không cần bắt buộc nâng cấp ứng dụng. Theo đó, chúng tôi cũng đảm bảo rằng không có con đường nào để phân phối một mô hình khác cho một người dùng cụ thể.
Mọi phiên bản mô hình — bao gồm cả mã băm SHA-256 của nó — đều được công bố trên một sổ cái minh bạch chỉ cho phép thêm (append-only) của bên thứ ba trước khi được cung cấp cho bất kỳ ai. Sổ cái chỉ cho phép thêm là một nhật ký công khai nơi các mục có thể được thêm vào nhưng không bao giờ có thể sửa đổi hoặc xóa, đảm bảo một lịch sử chống giả mạo mà các nhà nghiên cứu có thể kiểm tra.
Chúng tôi thiết kế hệ thống tải xuống mô hình dựa trên ba đảm bảo:
Cách thức hoạt động của việc tải xuống và xác minh mô hình
Thử nghiệm riêng tư
Trước khi triển khai một phiên bản mô hình mới trên toàn cầu, chúng tôi phải đánh giá độ chính xác và hiệu quả của nó bằng cách thử nghiệm các biến thể mô hình với các nhóm người dùng nhỏ. Quá trình thử nghiệm này không được tạo ra con đường để nhắm mục tiêu (tức là phân phối một mô hình cụ thể cho một người dùng cụ thể). Luồng tải xuống mô hình được thiết kế để ngăn chặn điều này:
Vì toàn bộ luồng xác minh và thử nghiệm chạy trên máy khách, các nhà nghiên cứu bảo mật có thể kiểm tra tệp nhị phân của ứng dụng để xác nhận rằng các kiểm tra này được thực hiện.
Bài viết được AI dịch và tổng hợp tự động từ Meta Engineering Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.