Sản phẩm
Claude chính thức ra mắt tiện ích trình duyệt Chrome cho người dùng trả phí
(giờ Việt Nam)
Tóm tắt AI
Anthropic đã phát hành rộng rãi Claude in Chrome, cho phép AI tự động thực hiện các thao tác trên trình duyệt với cơ chế bảo mật nâng cao, giúp ngăn chặn hiệu quả các cuộc tấn công tiêm nhiễm câu lệnh (prompt injection).
Bản dịch AI

Claude in Chrome hiện đã khả dụng cho tất cả các gói trả phí của Claude. Giờ đây, Claude có thể tự động thực hiện các hành động trên trình duyệt thay vì cần sự phê duyệt cho từng thao tác. Một bộ phân loại an toàn (safety classifier) sẽ xác thực mỗi hành động trước khi nó được thực hiện để đảm bảo an toàn và phù hợp với yêu cầu của bạn.

Nhiều công cụ bạn sử dụng hàng ngày có thể kết nối với Claude. Tuy nhiên, nhiều công cụ khác thì không, chẳng hạn như các bảng điều khiển nội bộ, hệ thống cũ (legacy systems) và cổng thông tin của nhà cung cấp. Claude in Chrome cho phép Claude truy cập vào những nền tảng đó. Nó có thể xem trang bạn đang mở và thực hiện các hành động như đọc và nhập văn bản, nhấp vào liên kết, điều hướng giữa các trang và điền vào biểu mẫu bằng cách sử dụng thông tin đăng nhập hiện có của bạn.
Chúng tôi lần đầu công bố Claude in Chrome dưới dạng bản thử nghiệm vào năm ngoái để có thể kiểm tra đồng thời củng cố khả năng phòng thủ trước các cuộc tấn công prompt injection: những chỉ dẫn độc hại ẩn trong các trang web, email hoặc tài liệu nhằm đánh lừa tác nhân AI thực hiện các hành động trái với mong muốn của người dùng. Những biện pháp phòng thủ này, được mô tả bên dưới, mang lại cho chúng tôi sự tự tin để phát hành rộng rãi Claude in Chrome.
Bảo vệ trước các cuộc tấn công prompt injection
Như chúng tôi đã nêu khi công bố bản thử nghiệm, một tác nhân AI hoạt động trong trình duyệt của bạn cũng dễ bị tổn thương trước các cuộc tấn công prompt injection. Vì vậy, chúng tôi đã nỗ lực cải thiện các biện pháp bảo vệ trước khi phát hành Claude in Chrome rộng rãi hơn.
Trong một cuộc tấn công prompt injection, những kẻ tấn công ẩn các chỉ dẫn độc hại vào nội dung web như trang web, email hoặc trường biểu mẫu. Bạn có thể không bao giờ nhìn thấy chúng, nhưng những chỉ dẫn này có thể điều hướng tác nhân AI thực hiện những việc bạn không hề yêu cầu. Ví dụ, nếu bạn yêu cầu Claude soạn thảo thư trả lời email, một chỉ dẫn ẩn trong một tin nhắn có thể yêu cầu Claude chuyển tiếp các email khác của bạn cho kẻ tấn công.
Khi ra mắt, chúng tôi đã mô tả cách kiểm tra khả năng phòng thủ của Claude trước các cuộc tấn công này và các biện pháp bảo vệ hiện có vào thời điểm đó; sau đó, chúng tôi đã phát hành mô tả chi tiết hơn về các biện pháp bảo vệ khi sử dụng trình duyệt. Kể từ đó, chúng tôi đã cải thiện cách huấn luyện cả mô hình lẫn các công cụ thăm dò (probes), đồng thời bổ sung thêm một bộ phân loại giúp Claude có thể thực hiện các hành động tự động một cách an toàn hơn trong Chrome. Trong phần tiếp theo, chúng tôi sẽ thảo luận về kết quả đánh giá, cho thấy hiệu quả của các biện pháp bảo vệ này.
Claude nhận diện được nhiều cuộc tấn công hơn. Chúng tôi huấn luyện Claude dựa trên một thư viện ngày càng mở rộng các cuộc tấn công prompt injection, được thu thập từ các hệ thống tấn công tự động nội bộ, đội ngũ red-teamer bên ngoài và giám sát thực tế. Khi một cuộc tấn công mới thành công trước mô hình hiện tại, nó sẽ được thêm vào thư viện để phục vụ việc huấn luyện các mô hình tương lai và các biện pháp bảo vệ đã triển khai, giúp chúng học cách nhận diện cuộc tấn công đó. Kể từ khi chúng tôi viết về các biện pháp phòng thủ prompt injection cho việc sử dụng trình duyệt vào tháng 11 năm 2025, chúng tôi đã làm cho Claude có khả năng chống chịu tốt hơn đáng kể trước các cuộc tấn công này.
Các công cụ thăm dò (probes) sàng lọc nội dung web trước khi Claude hành động. Nội dung web đến với Claude thông qua kết quả của các công cụ. Để thực hiện một hành động như đọc trang hoặc mở email, mô hình sẽ thực hiện một lệnh gọi công cụ (tool call); kết quả công cụ cho phép mô hình đọc đầu ra (trong trường hợp này là nội dung của trang hoặc email). Chúng tôi huấn luyện các công cụ thăm dò để quét những kết quả đó nhằm tìm kiếm các dấu hiệu prompt injection tiềm ẩn. Khi một công cụ thăm dò phát hiện một cuộc tấn công có khả năng xảy ra, Claude sẽ được cảnh báo để xử lý nội dung đó một cách thận trọng và nếu cần, sẽ kiểm tra lại với bạn trước khi thực hiện hành động. Chúng tôi đã triển khai các công cụ thăm dò này lần đầu với Claude Opus 4.5 và kể từ đó đã mở rộng các loại tấn công mà chúng có thể bao phủ.
Các hành động được xác minh trước khi thực thi. Trong Claude in Chrome, Claude giờ đây sẽ tự động phê duyệt các hành động mà nó xác định là an toàn, sử dụng cơ chế tương tự như chế độ tự động (auto mode) trong Claude Code. (Bạn có thể tắt tính năng này trong phần cài đặt nếu muốn tiếp tục phê duyệt các hành động của Claude theo cách thủ công.) Một bộ phân loại sẽ xem xét các hành động mà Claude sắp thực hiện, chẳng hạn như điều hướng đến một trang web mới hoặc nhập văn bản vào trang, và đối chiếu chúng với những gì bạn đã yêu cầu ban đầu. Nếu hành động không khớp với yêu cầu của bạn, nó sẽ bị chặn.
Đo lường khả năng chống chịu của Claude trước prompt injection
Chúng tôi đã kiểm tra các biện pháp bảo vệ này để đảm bảo Claude in Chrome an toàn khi sử dụng cho các công việc trên trình duyệt. Tại đây, chúng tôi báo cáo kết quả từ các đánh giá gần đây nhất.
Trong đánh giá ban đầu về khả năng chống chịu của Claude Cowork trước các cuộc tấn công prompt injection (được phát triển lần đầu khi chúng tôi phát hành bản thử nghiệm Claude in Chrome), không có cuộc tấn công nào thành công trước Claude Fable 5, Claude Opus 5 hoặc Claude Sonnet 5 trong môi trường Cowork, ngay cả khi không có các công cụ thăm dò và bộ phân loại đã thảo luận ở trên.

Vì chúng tôi đã bão hòa đánh giá đó (được chứng minh bằng tỷ lệ thành công 0%), chúng tôi quyết định ngừng sử dụng nó. Trong đánh giá hiện tại, sử dụng các cuộc tấn công mạnh hơn từ các chuyên gia red-teamer, các cuộc tấn công tiếp cận được mô hình đã thành công trước Opus 4.5 với tỷ lệ 17,6% và trước Opus 5 với tỷ lệ 3,8% trước khi áp dụng bất kỳ biện pháp bảo vệ bổ sung nào. Với các biện pháp bảo vệ mạnh nhất hiện có vào tháng 11 năm 2025, các cuộc tấn công vào Opus 4.5 khi chạy với các công cụ thăm dò đã thành công 16,7% số lần. Đối với mọi mô hình từ Opus 4.8 trở đi, khi chạy với các công cụ thăm dò và bộ phân loại an toàn, không có cuộc tấn công nào thành công trước Claude Sonnet 5, Claude Opus 5 hoặc Claude Mythos 5. Chúng tôi ghi nhận tỷ lệ tấn công thành công 0,3% đối với Fable 5. Chúng tôi đã xác minh thủ công rằng tất cả các trường hợp bị xâm nhập thành công đều nằm trong các kịch bản có mức độ nghiêm trọng thấp và đang nỗ lực để giảm thiểu chúng.

Prompt injection vẫn là một mục tiêu luôn thay đổi. Mặc dù phương pháp này bảo vệ trước các cuộc tấn công hiện tại, chúng tôi cũng cần đảm bảo các biện pháp bảo vệ của mình luôn đi trước các phương thức phát triển của kẻ tấn công. Với mỗi lần phát hành mô hình, chúng tôi tiếp tục đầu tư vào việc phát triển các hệ thống tự động tinh vi hơn để phát hiện tấn công, red-teaming và xây dựng các bộ phân loại mạnh mẽ hơn.
Bắt đầu sử dụng
Để bắt đầu sử dụng Claude in Chrome, hãy cài đặt nó từ Chrome Web Store. Đối với các gói Enterprise, quản trị viên có thể quản lý nó trong Cài đặt tổ chức (Organization Settings) và giới hạn quyền truy cập vào các tên miền đã được phê duyệt. Xem hướng dẫn thiết lập dành cho quản trị viên.
Bạn vẫn cần sử dụng ứng dụng Claude trên máy tính để làm việc với các tệp tin trên máy tính hoặc với các ứng dụng khác. Claude in Chrome chưa chạy trên các trình duyệt Chromium khác hoặc trên thiết bị di động.
¹ Không phải tất cả các cuộc tấn công đều tiếp cận được—tức là được mô hình nhìn thấy. Trong một số trường hợp, các hành động mà Claude thực hiện dẫn đến việc nó không bao giờ gặp phải các chỉ dẫn độc hại.
Bài viết được AI dịch và tổng hợp tự động từ Claude: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.