Anthropic: Newsroom (Web)
85

Tin ngành

Anthropic và Accenture hợp tác chiến lược, đầu tư 2 tỷ USD phát triển đánh giá AI an toàn

(giờ Việt Nam)

Tóm tắt AI

Anthropic bắt tay cùng Accenture thực hiện đánh giá độc lập và kiểm thử bảo mật cho các mô hình AI tiên tiến, với cam kết đầu tư ít nhất 1 tỷ USD từ mỗi bên trong 5 năm tới.

Bản dịch AI

Partnering with Accenture on embedded evaluation

Chúng tôi đang hợp tác với Accenture để thực hiện đánh giá độc lập về các mô hình AI tiên phong (frontier AI). Đây là một bước tiến quan trọng nhằm hiện thực hóa cam kết trong bài luận “We Must Pace the Frontier” của CEO chúng tôi, đó là đưa các đơn vị đánh giá vào làm việc trực tiếp tại Anthropic.

Quan hệ đối tác này sẽ được dẫn dắt bởi Faculty, đơn vị kinh doanh chuyên về AI của Accenture, bao gồm các công việc như đánh giá và red-teaming (tấn công giả lập) các mô hình, thực hiện các đánh giá về sự liên kết (alignment) và kiểm thử các cơ chế bảo vệ mô hình. Accenture hỗ trợ các doanh nghiệp và chính phủ triển khai AI trên nhiều ngành công nghiệp khác nhau. Sự am hiểu của họ về cách các doanh nghiệp ứng dụng AI trong thực tế giúp định hình phương pháp tiếp cận an toàn, và họ sẽ mang góc nhìn đó vào việc đánh giá các mô hình của chúng tôi.

Anthropic và Accenture dự kiến mỗi bên sẽ đầu tư ít nhất 1 tỷ USD để xây dựng năng lực trong lĩnh vực này trong vòng 5 năm tới.

Đánh giá nhúng (embedded evaluation) là một khái niệm mới và nhiều chi tiết về cách thức vận hành vẫn đang được hoàn thiện. Không giống như các đơn vị đánh giá bên ngoài hiện nay, các đơn vị đánh giá nhúng sẽ làm việc ngay bên trong các công ty AI với quyền truy cập tương đương nhân viên. Quyền truy cập này cho phép họ quan sát quá trình hình thành mô hình trong giai đoạn huấn luyện, theo dõi các quyết định quản lý cách xây dựng và triển khai mô hình, cũng như trao đổi trực tiếp với nhân viên. Từ vị thế này, các đơn vị đánh giá nhúng có thể đánh giá cách thức vận hành của công ty, xác minh việc tuân thủ các cam kết an toàn và xác định các điểm mù. Họ cũng có thể báo cáo các sự cố và cung cấp cho công chúng cái nhìn đầy đủ hơn về lợi ích và rủi ro.

Cần làm rõ rằng, các đơn vị đánh giá nhúng độc lập không làm giảm trách nhiệm giải trình của chúng tôi, mà giúp cho trách nhiệm đó trở nên dễ kiểm chứng hơn. Sự an toàn của các mô hình vẫn là trách nhiệm của chúng tôi.

Hiện tại vẫn chưa có tiêu chuẩn nào quy định về việc các đơn vị đánh giá nhúng nên được tiếp cận những thông tin gì, hoặc cách thức họ báo cáo những gì tìm thấy. Cũng chưa có hệ thống thống nhất nào cho việc tài trợ đánh giá độc lập. Về lâu dài, chúng tôi cho rằng nguồn tài trợ nên đến từ các quỹ chung hoặc từ chính phủ, như chúng tôi đã đề xuất trong Khung AI Tiên tiến (Advanced AI Framework) vào tháng 6. Vì hiện tại chưa có các nguồn này, chúng tôi dự định sẽ làm việc với các đơn vị đánh giá khác nhau theo những thỏa thuận tài trợ khác nhau.

Do tầm quan trọng và tính cấp bách của công việc này, Anthropic sẽ trực tiếp tài trợ cho công việc của Accenture. Chúng tôi cũng đang đối thoại với METR và các đơn vị đánh giá phi lợi nhuận khác để thí điểm các yếu tố của đánh giá nhúng bằng nguồn tài trợ riêng của họ. Cuối cùng, chúng tôi tin rằng AI tiên phong cần một hệ sinh thái các đơn vị đánh giá hoạt động với các tiêu chuẩn chung.

Chúng tôi kỳ vọng các phòng thí nghiệm AI tiên phong sẽ làm việc với nhiều tổ chức cùng một lúc. Quan hệ đối tác của chúng tôi không mang tính độc quyền; Anthropic sẽ làm việc với các đơn vị đánh giá khác sẽ được công bố trong những tuần tới, và Accenture cũng sẽ làm việc với các nhà phát triển AI khác với năng lực tương tự.

Chúng tôi sẽ tiếp tục huấn luyện và phát hành các mô hình tiên phong, và chúng tôi muốn các đơn vị đánh giá độc lập làm việc cùng chúng tôi trong quá trình đó. Chúng tôi chia sẻ những nỗ lực ban đầu này ngay bây giờ để mọi người và các nhà phát triển AI khác có thể thấy quy trình của chúng tôi. Chúng tôi kỳ vọng phương pháp của mình sẽ phát triển khi lĩnh vực này hoàn thiện hơn, và chúng tôi sẽ chia sẻ thêm khi công việc bắt đầu và khi chúng tôi bổ sung thêm các đơn vị đánh giá khác.

Nội dung liên quan

Giới thiệu Chương trình Xác minh Khoa học Sự sống (Life Sciences Verification Program)

Chương trình Xác minh Khoa học Sự sống (LSVP) cung cấp cho các chuyên gia trong ngành khoa học sự sống quyền truy cập vào các mô hình Claude Mythos, Opus và Sonnet với bộ cơ chế bảo vệ được tinh chỉnh, cho phép linh hoạt hơn đối với các công việc liên quan đến sinh học.

Đọc thêm

Phát triển các cơ chế bảo vệ AI tiên phong cho doanh nghiệp cùng khách hàng của chúng tôi

Đọc thêm

Cải thiện các nỗ lực về sự liên kết (alignment) và bảo mật của chúng tôi

Vào ngày 30 tháng 7, chúng tôi đã báo cáo ba sự cố trong đó các mô hình Claude đã truy cập trái phép vào các hệ thống máy tính thực tế. Chúng tôi đang tiến hành phân tích chuyên sâu về cả hai sự cố và dự định làm việc với METR để thực hiện đánh giá độc lập. Trong thời gian chờ đợi, chúng tôi chia sẻ một số thay đổi mà chúng tôi đã thực hiện trong tháng qua.

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Anthropic: Newsroom (Web). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.