Sản phẩm
Anthropic nâng cấp cơ chế an toàn sinh học cho Claude 3.5, giảm 85% tỷ lệ từ chối nhầm
(giờ Việt Nam)
Tóm tắt AI
Anthropic vừa cập nhật cơ chế an toàn sinh học trên Claude 3.5, giúp giảm 85% các trường hợp từ chối nhầm khi người dùng hỏi về sức khỏe và giáo dục, đồng thời mở rộng khả năng hỗ trợ nghiên cứu chuyên sâu.
Bản dịch AI
Chúng tôi đang cập nhật các biện pháp bảo vệ sinh học của Claude Fable 5 theo cách giảm đáng kể tỷ lệ dương tính giả. Người dùng Fable 5 giờ đây sẽ gặp ít tình trạng "chuyển hướng" (fallbacks) hơn—trường hợp hệ thống tự động chuyển sang một mô hình có năng lực thấp hơn sau khi người dùng đưa ra các truy vấn liên quan đến sinh học. Trong quá trình thử nghiệm, bản cập nhật này đã giảm khoảng 85% số lần chuyển hướng liên quan đến sinh học trên các nền tảng sản phẩm của chúng tôi.
Nhờ đó, Fable 5 sẽ có khả năng hỗ trợ nhiều tác vụ sinh học đa dạng hơn.
Trên thực tế, người dùng sẽ thấy ít tình trạng chuyển hướng hơn hẳn đối với các câu hỏi về sức khỏe và giáo dục thường ngày—ví dụ như giải thích kết quả xét nghiệm, tìm hiểu về các triệu chứng và học tập kiến thức sinh học trong bối cảnh giáo dục. Các chuyên gia chăm sóc sức khỏe cũng sẽ nhận được nhiều sự hỗ trợ hơn từ Fable 5 trong các tác vụ lâm sàng.
Chúng tôi tin rằng cơ hội lớn nhất để AI tạo ra tác động tích cực cho thế giới nằm ở lĩnh vực sinh học và y học, vì vậy chúng tôi đang đầu tư mạnh mẽ vào việc xây dựng một lộ trình có trách nhiệm để cung cấp cho các nhà sinh học quyền truy cập vào các mô hình tiên tiến. Hiện tại, Fable vẫn chuyển hướng sang Opus 5 đối với các yêu cầu mà chúng tôi coi là có mục đích sử dụng kép (dual-use)—bao gồm virus học, độc chất học và thiết kế phân tử—vì vậy nó vẫn chưa thể được sử dụng cho nghiên cứu sinh học chuyên nghiệp và phát triển dược phẩm. Chúng tôi cam kết sẽ thu hẹp khoảng cách này thông qua các lộ trình truy cập đáng tin cậy cho các năng lực sinh học tiên tiến.
Tại sao chúng tôi xây dựng các biện pháp bảo vệ sinh học mạnh mẽ
Mục tiêu của chúng tôi là đưa các năng lực tiên tiến của Fable 5 đến tay càng nhiều người dùng càng tốt, trong thời gian sớm nhất. Tuy nhiên, để làm được điều đó, chúng tôi cần quản lý những rủi ro ngày càng tăng đi kèm với các mô hình có năng lực cao như vậy. Một trong những rủi ro đó nằm ở lĩnh vực sinh học: Fable 5 hiện có thể vượt trội hơn các chuyên gia trong một số tác vụ sinh học cực kỳ phức tạp và cung cấp hỗ trợ vận hành trong các tác vụ khác. Điều đó có nghĩa là nó có thể hỗ trợ đắc lực cho một nhà nghiên cứu đang phát triển phương pháp điều trị y tế mới (đây là lý do tại sao chúng tôi rất muốn mở rộng quyền truy cập vào mô hình thông qua cả việc cải thiện bộ phân loại và các chương trình truy cập đáng tin cậy). Nhưng nếu rơi vào tay kẻ xấu, chính những năng lực đó có thể bị các tác nhân độc hại lợi dụng, chẳng hạn như để phát triển vũ khí sinh học. Các đánh giá năng lực của chúng tôi cho thấy Fable 5 có thể cung cấp sự hỗ trợ đáng kể cho những tác nhân như vậy—nghĩa là nó có thể cung cấp cho họ những năng lực mà họ không thể tìm thấy ở bất kỳ nơi nào khác.
Việc phân biệt giữa mục đích sử dụng có lợi và có hại của AI trong sinh học thường rất khó khăn. Ví dụ, trong một số trường hợp, việc nghiên cứu phương pháp điều trị một căn bệnh đòi hỏi các nhà khoa học phải tạo ra chính những hợp chất nguy hiểm gây ra căn bệnh đó ngay từ đầu. Điều này rõ ràng nhất đối với các loại vaccine sống, vốn yêu cầu các nhà khoa học phải nuôi cấy chính mầm bệnh mà họ đang nhắm tới để ngăn ngừa. Điều này cũng đúng với một số loại thuốc. Để phát triển thuốc captopril điều trị tăng huyết áp, các nhà khoa học đã cô lập các thành phần độc hại từ nọc rắn vốn có khả năng làm tụt huyết áp ở người. Khi các năng lực sinh học mới phát triển trên nền tảng AI tiên tiến, chúng ta cần thận trọng để đảm bảo rằng những rủi ro mới mà chúng gây ra không xuất hiện trước cả những lợi ích khoa học tiềm năng của chúng.
Những tác nhân tinh vi muốn sử dụng mô hình của chúng tôi để gây hại đều biết cách khai thác sự mơ hồ này để che giấu ý đồ, khiến các tác vụ nguy hiểm trông giống như các hoạt động nghiên cứu thông thường. Báo cáo Đánh giá Mối đe dọa Thường niên năm 2026 của Cộng đồng Tình báo Hoa Kỳ đã làm rõ rằng những tác nhân như vậy thực sự tồn tại, và những tiến bộ trong công nghệ sinh học bao gồm sinh học tổng hợp và chỉnh sửa bộ gen "có thể dẫn đến các mối đe dọa sinh học mới". Báo cáo cũng lưu ý rằng một số quốc gia có khả năng đang duy trì các chương trình vũ khí sinh học và hóa học tấn công—những chương trình có thể được đẩy nhanh nhờ quyền truy cập vào các năng lực thô của các mô hình AI tiên tiến.
Do lo ngại về các năng lực "sử dụng kép" này (những năng lực có thể được sử dụng cho mục đích có lợi hoặc có hại, và ranh giới giữa chúng không phải lúc nào cũng dễ xác định), chúng tôi đã cố tình ra mắt Fable 5 với hầu hết các truy vấn sinh học bị chặn. Điều này cho phép chúng tôi cung cấp mô hình cho người dùng trong các lĩnh vực khác. Chúng tôi biết rằng điều này sẽ gây thất vọng cho những người dùng sinh học chân chính: nó dẫn đến tỷ lệ dương tính giả cao trong thời gian ngắn, nơi người dùng đặt câu hỏi liên quan đến sinh học sẽ bị chặn yêu cầu và chuyển sang một mô hình có năng lực thấp hơn. Tuy nhiên, chúng tôi đã chọn thực hiện sự đánh đổi này vì cái giá của việc Fable bị lạm dụng trong một lĩnh vực sử dụng kép như sinh học có thể là thảm họa.
Cách thức hoạt động của các biện pháp bảo vệ sinh học của chúng tôi
Một trong những cách cốt lõi để bảo vệ chống lại việc lạm dụng trong sinh học là thông qua các bộ phân loại an toàn (safety classifiers): các hệ thống AI tự động, nhỏ gọn hơn giúp phát hiện khi nào Fable 5 được yêu cầu thực hiện một tác vụ sinh học cần bảo vệ, hoặc tạo ra kết quả đầu ra có hại (chúng tôi đã từng viết về các bộ phân loại tương tự trong lĩnh vực an ninh mạng).
Trong trường hợp của Fable 5, khi một bộ phân loại được kích hoạt, mô hình sẽ chuyển hướng yêu cầu của người dùng sang Opus 5, một mô hình có năng lực tốt nhưng không có cùng mức độ năng lực sinh học như Fable 5 và không thể cung cấp nhiều hỗ trợ cho người dùng độc hại. Đây chính là tình trạng chuyển hướng mà người dùng thấy khi yêu cầu của họ bị chặn.
Việc phát triển các bộ phân loại chính xác và mạnh mẽ không phải là một nhiệm vụ đơn giản. Để một bộ phân loại hoạt động nhanh chóng và nhất quán, nó phải học được sự khác biệt giữa những gì chúng tôi coi là "trong phạm vi" và "ngoài phạm vi" đối với các chủ đề và truy vấn mà chúng tôi cho là có khả năng gây hại. Cần có thời gian và sự lặp lại để tinh chỉnh các bộ phân loại, tránh cả dương tính giả (khi bộ phân loại kích hoạt với nội dung ngoài phạm vi) và âm tính giả (khi nội dung trong phạm vi bị bỏ sót). Chúng tôi cũng yêu cầu các bộ phân loại của mình phải có khả năng chống lại các nỗ lực vượt rào (được gọi là jailbreak), điều này đòi hỏi phải nghiên cứu và thử nghiệm nhiều hơn nữa.
Việc bắt đầu với một bộ phân loại sinh học rất rộng có nghĩa là chúng tôi có thể cung cấp cho người dùng quyền truy cập vào Fable 5 trong khi chúng tôi tiếp tục nghiên cứu để tinh chỉnh nó. Giải pháp thay thế—giữ lại mô hình cho đến khi các biện pháp bảo vệ tiến bộ hơn—sẽ làm chậm quyền truy cập chung của mô hình và những lợi ích tiềm năng của nó đối với người dùng trong nhiều tuần hoặc nhiều tháng.
Trong vài tuần qua, chúng tôi đã cẩn thận viết lại hiến pháp của bộ phân loại (bao gồm một tập hợp các quy tắc giúp mô hình phân biệt giữa nội dung được bảo vệ và nội dung được phép), chú trọng việc phân loại chi tiết các mục đích sử dụng lành tính. Chúng tôi đã thu thập phản hồi về các thay đổi từ nhiều chuyên gia (cả trong và ngoài Anthropic). Sau đó, chúng tôi đã phát triển dữ liệu đào tạo cập nhật cho bộ phân loại dựa trên hiến pháp đó, đào tạo lại nó và xác minh rằng bộ phân loại mới vẫn sẽ kích hoạt đối với nội dung nghiên cứu sinh học có hại và sử dụng kép, nhưng giờ đây sẽ cho phép thực hiện nhiều mục đích sử dụng lành tính và có lợi hơn.
Như được minh họa trong sơ đồ dưới đây, những cập nhật này có nghĩa là—so với thời điểm ra mắt Fable 5—bộ phân loại sẽ kích hoạt ít hơn nhiều đối với các yêu cầu liên quan đến sinh học lành tính.
Kết luận
Vẫn còn nhiều việc phải làm để tinh chỉnh các biện pháp bảo vệ của chúng tôi. Chắc chắn sẽ vẫn còn các trường hợp dương tính giả—những yêu cầu nằm trong biên độ an toàn của bộ phân loại, nơi yêu cầu có rủi ro rất thấp nhưng bộ phân loại vẫn kích hoạt. Như chúng tôi đã lưu ý ở trên, Fable sẽ tiếp tục chặn các truy vấn về sinh học chuyên nghiệp và phát triển dược phẩm có tính chất sử dụng kép do rủi ro tiềm ẩn. Chúng tôi hoàn toàn cam kết phát triển một lộ trình an toàn, có thể mở rộng để các nhà nghiên cứu sử dụng các mô hình có năng lực cao nhất của chúng tôi thông qua các lộ trình truy cập đáng tin cậy.
Chúng tôi hy vọng bạn sẽ tiếp tục chia sẻ phản hồi với chúng tôi để chúng tôi có thể cải thiện các biện pháp bảo vệ của mình hơn nữa.
Chú thích
1 Kết quả là, chúng tôi dự kiến tổng số lần chuyển hướng—vì lý do liên quan đến sinh học hoặc bất kỳ lý do nào khác—cũng sẽ giảm: khoảng 67% trên Claude.ai, 55% trên Cowork, 17% trên Claude Code và 7% trên Claude Platform.
Nội dung liên quan
Mariano-Florentino (Tino) Cuéllar gia nhập Anthropic với tư cách là Giám đốc Quan hệ Toàn cầu
Mariano-Florentino (Tino) Cuéllar sẽ gia nhập Anthropic với tư cách là Giám đốc Quan hệ Toàn cầu đầu tiên của công ty.
Đọc thêm
Điều tra ba sự cố thực tế trong các đánh giá an ninh mạng của chúng tôi
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Anthropic: Newsroom (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.