Nghiên cứu
Anthropic chia sẻ dữ liệu thực tế của Claude cho các tổ chức nghiên cứu độc lập
(giờ Việt Nam)
Tóm tắt AI
Anthropic đã cung cấp 250.000 đoạn hội thoại từ Claude cho các viện nghiên cứu tại Stanford, Oxford và METR thông qua công cụ bảo mật Anthropic Insights để phục vụ các nghiên cứu độc lập.
Bản dịch AI
Đầu năm nay, chúng tôi đã triển khai một chương trình thí điểm cho phép các nhà nghiên cứu bên ngoài tiếp cận dữ liệu sử dụng Claude thực tế ở dạng tổng hợp. Ba nhóm nghiên cứu đã tự thiết kế các nghiên cứu riêng cho Anthropic Insights, công cụ phân tích bảo mật quyền riêng tư của chúng tôi; chúng tôi thực hiện thu thập dữ liệu thay mặt cho họ, và họ tiến hành phân tích độc lập. Trong bài viết này, chúng tôi chia sẻ các kết quả cấp cao từ những nghiên cứu đó và những gì chúng tôi học được khi vận hành chương trình thí điểm này. Chúng tôi cũng cung cấp một biểu mẫu bày tỏ sự quan tâm dành cho các nhà nghiên cứu muốn hợp tác với chúng tôi trong tương lai.
Để đảm bảo quá trình chuyển đổi sang AI mang tính đột phá diễn ra suôn sẻ, chúng ta cần hiểu rõ tác động của nó đối với con người và xã hội. Hiện tại, dữ liệu về các tương tác thực tế với AI đang tập trung tại một số ít các phòng thí nghiệm. Chúng tôi cho rằng sẽ rất tốt nếu nhiều dữ liệu hơn được công khai rộng rãi—cho các nhà nghiên cứu, các nhà hoạch định chính sách và công chúng.
Các nhà nghiên cứu bên ngoài các phòng thí nghiệm có hai lựa chọn. Họ có thể dựa vào các phân tích do các phòng thí nghiệm công bố, vốn phản ánh cách sử dụng thực tế nhưng thường trả lời các câu hỏi của chính phòng thí nghiệm đó thay vì câu hỏi của họ. Hoặc họ có thể sử dụng các tập dữ liệu công khai, nơi họ có thể nghiên cứu theo bất kỳ cách nào họ muốn, nhưng dữ liệu này thường nghiêng về cách sử dụng thông thường và có thể không phản ánh cách hầu hết mọi người thực sự sử dụng AI. Cả hai lựa chọn này đều không đủ cho việc nghiên cứu độc lập về cách AI đang thực sự được sử dụng.
Mùa xuân này, chúng tôi đã thí điểm một chương trình trong đó ba tổ chức nghiên cứu bên ngoài đã thiết kế và thực hiện các nghiên cứu riêng của họ về dữ liệu sử dụng Claude thông qua Anthropic Insights (trước đây gọi là ‘Clio’), công cụ bảo mật quyền riêng tư mà các nhóm của chúng tôi sử dụng để phân tích các mô hình sử dụng trên hàng triệu cuộc hội thoại với Claude. Chúng tôi hy vọng sẽ mở rộng chương trình này trong tương lai, vì vậy chúng tôi cũng đã thực hiện một cuộc kiểm toán quyền riêng tư bổ sung đối với tất cả dữ liệu được chia sẻ với các nhà nghiên cứu bên thứ ba để xác minh rằng các biện pháp bảo vệ quyền riêng tư của chúng tôi vẫn hiệu quả (xem Phụ lục).
Chúng tôi tin rằng đây là lần đầu tiên các nhà nghiên cứu bên ngoài thực hiện các nghiên cứu độc lập công khai trên chính dữ liệu sử dụng của một công ty AI. Dưới đây, chúng tôi thảo luận về những gì các nhóm bên ngoài đã tìm thấy, những gì chúng tôi học được khi vận hành chương trình thí điểm và những gì chúng tôi đang cân nhắc khi quyết định cách mở rộng chương trình này rộng rãi hơn. Chúng tôi cũng đang công khai dữ liệu tổng hợp từ mỗi dự án.
Những gì các nhà nghiên cứu đã tìm hiểu được
Chúng tôi đã hợp tác với ba nhóm nghiên cứu: Phòng thí nghiệm Công nghệ Xã hội và Ngôn ngữ (SALT) tại Đại học Stanford, Phòng thí nghiệm Xử lý Thông tin Con người tại Đại học Oxford và METR, một tổ chức phi lợi nhuận chuyên đánh giá các mô hình AI tiên tiến. Mỗi nhóm đã phát triển các câu hỏi nghiên cứu riêng và sử dụng Anthropic Insights để thực hiện phân tích bảo mật quyền riêng tư trên khoảng 250.000 cuộc hội thoại Claude.ai hoặc Claude Code từ tháng 4 đến tháng 5 năm 2026.
Chúng tôi muốn các đối tác bên ngoài có sự độc lập tối đa, vì vậy quyền xem xét theo hợp đồng của chúng tôi chỉ giới hạn ở quyền riêng tư của người dùng, thông tin có thể giúp mọi người vi phạm chính sách sử dụng của chúng tôi, thông tin bảo mật của Anthropic và tính chính xác của nghiên cứu. Ngoài ra, Anthropic không can thiệp vào nội dung các kết quả nghiên cứu và các nhà nghiên cứu được tự do công bố kết quả của họ ngay cả khi chúng gây bất lợi cho Anthropic. Dưới đây là một số kết quả ban đầu. Chúng tôi rất hào hứng với các hướng đi này và những gì người khác sẽ tìm ra khi dữ liệu đã được công khai.
Phòng thí nghiệm Công nghệ Xã hội và Ngôn ngữ đã nghiên cứu cách con người cộng tác với AI. Họ xem xét các loại công việc mà mọi người giao cho AI, vai trò mà con người giữ lại khi hoàn thành công việc đó và nơi mà sự cộng tác giữa người và AI bị đứt gãy. Họ nhận thấy:
Đọc toàn bộ báo cáo của họ tại đây.
Phòng thí nghiệm Xử lý Thông tin Con người đang nghiên cứu cảm xúc của mọi người khi sử dụng Claude và mối liên hệ của nó với hành vi của Claude. Kết quả ban đầu của họ cho thấy:
Họ vẫn đang hoàn thiện báo cáo của mình. Khi báo cáo được công khai, chúng tôi sẽ thêm liên kết vào đây.
METR đang ước tính mức tăng năng suất thực tế từ các tác nhân lập trình (coding agents) và cách mức tăng năng suất này thay đổi qua các thế hệ mô hình. Phân tích của họ về các cuộc hội thoại Claude Code vẫn đang được tiến hành, nhưng kết quả ban đầu cho thấy:
Họ vẫn đang hoàn thiện báo cáo của mình. Khi báo cáo được công khai, chúng tôi sẽ thêm liên kết vào đây.
Những gì nhóm của chúng tôi học được
Việc chia sẻ dữ liệu sử dụng là điều chưa từng có trong lĩnh vực AI, vì vậy chương trình thí điểm này vừa là một thử nghiệm trong việc vận hành một chương trình như vậy, vừa là cách để tạo điều kiện cho nghiên cứu của bên thứ ba theo cách bảo mật quyền riêng tư. Việc bảo vệ quyền riêng tư của người dùng và sự độc lập của các nhà nghiên cứu đều là ưu tiên hàng đầu, và chúng tôi đã đạt được cả hai. Anthropic Insights được thiết kế cho mục đích này—các nhà nghiên cứu không bao giờ truy cập vào các cuộc hội thoại thô, mà chỉ xem các kết quả đầu ra đã được tổng hợp sau khi trải qua cùng quy trình đánh giá pháp lý và quyền riêng tư như công việc nội bộ của chúng tôi. Tuy nhiên, tất cả những điều này khiến chương trình thí điểm diễn ra chậm so với tốc độ nghiên cứu thông thường của một phòng thí nghiệm AI và tốn kém tài nguyên để vận hành. Cả hai yếu tố này đều đặt ra thách thức cho việc mở rộng quy mô hiệu quả. Để biết thêm chi tiết về cách chúng tôi vận hành chương trình thí điểm này, hãy xem Phụ lục. Dưới đây, chúng tôi thảo luận về những gì chúng tôi đã học được và cách chúng tôi giải quyết các thách thức nảy sinh.
Việc theo đuổi cùng một vấn đề từ các góc độ khác nhau là rất có giá trị. Một số câu hỏi nghiên cứu của các đối tác của chúng tôi trùng lặp với công việc đang được thực hiện nội bộ. Ví dụ, đề xuất của METR tương tự như nghiên cứu kinh tế của chúng tôi về “Lập trình bằng tác nhân và lợi nhuận bền vững từ chuyên môn”. Chúng tôi thấy sự trùng lặp này rất có giá trị: nó mang lại cho các nhà nghiên cứu bên ngoài cơ hội kiểm tra dữ liệu tương tự và rút ra kết luận của riêng họ. Liệu những kết luận đó có phù hợp với chúng tôi hay không là điều chúng tôi sẽ theo dõi khi nghiên cứu của họ tiếp tục. Chúng tôi cũng đã kết nối METR với nhóm Kinh tế của mình và nhận thấy rằng sự kết nối này đã cải thiện công việc của cả hai nhóm nghiên cứu.
Các phương pháp nghiên cứu hiệu quả nội bộ cần phải thích ứng với các đối tác bên ngoài. Khi sử dụng Anthropic Insights, một nhà nghiên cứu viết một câu hỏi như, “Người này đang yêu cầu loại hướng dẫn nào?” và Claude sẽ trả lời câu hỏi đó cho mọi cuộc hội thoại trong nghiên cứu. Các câu trả lời sau đó được tổng hợp thành các danh mục; các nhà nghiên cứu chỉ thấy các danh mục cuối cùng và tỷ lệ phần trăm các cuộc hội thoại thuộc về mỗi danh mục. Vì chúng tôi dựa vào các đánh giá của Claude, công cụ này rất nhạy cảm với cách đặt câu hỏi; một câu hỏi được diễn đạt kém có thể đưa các cuộc hội thoại vào các danh mục gây hiểu lầm. Vì không ai có thể đọc các cuộc hội thoại gốc, những lỗi này rất khó phát hiện.
Nội bộ, chúng tôi quản lý điều này bằng cách lặp lại các câu hỏi nhiều lần trong nhiều tuần. Các đối tác bên ngoài không thể làm điều đó, vì việc đánh giá quyền riêng tư lặp đi lặp lại trước khi chia sẻ mỗi tập dữ liệu sẽ khiến nghiên cứu không khả thi. Thay vào đó, chúng tôi yêu cầu họ kiểm tra câu hỏi của mình trên WildChat, một tập dữ liệu công khai về các cuộc hội thoại giữa người và AI, nơi họ có thể tự kiểm tra câu trả lời so với các cuộc hội thoại gốc. Nhưng WildChat nghiêng về cách sử dụng thông thường và sáng tạo, không giống như lưu lượng truy cập của Claude, vì vậy một số câu hỏi hoạt động tốt trên WildChat lại tạo ra các danh mục gây hiểu lầm khi áp dụng vào các cuộc hội thoại thực tế của Claude. Chúng tôi đã giải quyết vấn đề này bằng cách cung cấp hướng dẫn về cách diễn giải kết quả đầu ra của Anthropic Insights (xem Phụ lục). Trong tương lai, chúng tôi đang khám phá cách các nhà nghiên cứu bên ngoài có thể phát triển câu hỏi và danh mục của họ hiệu quả hơn ngay từ đầu.
Duy trì sự minh bạch về việc lạm dụng mà không tạo điều kiện cho nó. Một số danh mục trong kết quả đầu ra Anthropic Insights của các đối tác đã làm lộ ra các vi phạm Chính sách Sử dụng Chấp nhận được hoặc Điều khoản Dịch vụ của chúng tôi—ví dụ như một danh mục những người tìm kiếm hướng dẫn về một hoạt động bị cấm. Chúng tôi nghĩ rằng công chúng nên biết về việc lạm dụng nền tảng của chúng tôi, vì vậy chúng tôi đã chia sẻ hầu hết các vi phạm này. Các ngoại lệ là những danh mục mô tả cách người dùng vượt qua các biện pháp bảo vệ của chúng tôi thay vì những gì họ đã cố gắng thực hiện. Ít hơn 5% danh mục và cuộc hội thoại bị ảnh hưởng trong mỗi nghiên cứu, và trong mỗi trường hợp, chúng tôi đều thông báo cho các nhà nghiên cứu về những cụm dữ liệu mà chúng tôi đã thay đổi hoặc xóa bỏ và lý do tại sao. Theo thông lệ, khi Anthropic Insights phát hiện các vi phạm như vậy, chúng tôi chia sẻ dữ liệu tổng hợp với nhóm Bảo vệ (Safeguards) của chúng tôi để họ xem xét. Đây cũng là một quy trình quan trọng cho công việc của chúng tôi với các nhà nghiên cứu bên ngoài trong tương lai.
Hướng tới tương lai
Hiểu được tác động của AI đối với xã hội là một công việc quá lớn đối với riêng các công ty AI. Sự giám sát thực sự cần các nhà nghiên cứu bên ngoài đặt ra các câu hỏi của riêng họ về dữ liệu sử dụng thực tế và công bố độc lập những gì họ tìm thấy.
Chương trình thí điểm này là một thử nghiệm: liệu các nhà nghiên cứu bên ngoài có thể thực hiện các nghiên cứu độc lập trên nền tảng của chúng tôi mà không làm tổn hại đến quyền riêng tư của người dùng hay không? Nỗ lực này khó khăn hơn chúng tôi mong đợi và chúng tôi đã rút ra nhiều bài học, nhưng cho đến nay câu trả lời dường như là có. Các đối tác của chúng tôi đã theo đuổi các nghiên cứu mà chúng tôi không nghĩ đến việc tự thiết kế, và mỗi người đều cho chúng tôi biết điều gì đó mới mẻ về tác động thực tế của AI. Đây là một bước khởi đầu đầy hứa hẹn, nhưng vẫn còn rất nhiều việc phải làm.
Bước tiếp theo là xác định xem chúng tôi có thể mở rộng quy mô chương trình này hay không, cả về loại nghiên cứu mà chúng tôi có thể hỗ trợ dựa trên các hạn chế đã mô tả ở trên, và số lượng nghiên cứu chúng tôi có thể thực hiện cùng lúc. Chúng tôi đang bắt đầu chậm rãi để đảm bảo quyền riêng tư, an toàn và chất lượng nghiên cứu. Chúng tôi muốn đánh giá mức độ quan tâm và hiểu những gì các nhà nghiên cứu muốn nghiên cứu. Nếu bạn là một nhà nghiên cứu và việc truy cập vào Anthropic Insights sẽ cho phép bạn theo đuổi công việc mà hiện tại bạn chưa thể thực hiện, vui lòng điền vào biểu mẫu này.
Phụ lục
Phụ lục đầy đủ có sẵn tại đây. Nó mô tả cách chúng tôi vận hành chương trình, bao gồm cách chúng tôi chọn ba đối tác, tài liệu nghiên cứu cơ bản mà chúng tôi đã viết để giải thích mục tiêu của chương trình và những gì Anthropic Insights có thể làm, cũng như cách mỗi dự án chuyển từ đề xuất sang thiết kế nghiên cứu và phân tích. Nó cũng bao gồm chi tiết về các thỏa thuận hợp tác của chúng tôi, trong đó nêu rõ rằng các đối tác của chúng tôi được tự do công bố kết quả ngay cả khi chúng gây bất lợi cho Anthropic. Hơn nữa, chúng tôi đề cập đến cuộc kiểm toán quyền riêng tư của bên thứ ba đối với dữ liệu này, do Imperial College London thực hiện, và mô hình đe dọa quyền riêng tư mà chúng tôi áp dụng cho tất cả dữ liệu được công bố. Chúng tôi cũng bao gồm hướng dẫn về cách diễn giải dữ liệu mà chúng tôi đang công bố từ các nghiên cứu Anthropic Insights của các đối tác.
Đóng góp và ghi nhận
Kunal Handa dẫn dắt dự án, hợp tác với các đối tác về đề xuất nghiên cứu của họ, soạn thảo hướng dẫn nghiên cứu và hợp đồng, vận hành các nghiên cứu Anthropic Insights của đối tác, giúp xây dựng cơ sở hạ tầng kỹ thuật hỗ trợ nghiên cứu của đối tác, đóng góp vào việc đánh giá nội bộ các kết quả đầu ra của Anthropic Insights và viết bài blog. Miranda Zhang điều phối các quan hệ đối tác và truyền thông, đồng thời đóng góp vào tất cả các phần của công việc. Gabriel Nicholas điều phối cuộc kiểm toán quyền riêng tư của bên thứ ba, đánh giá nội bộ các kết quả đầu ra của Anthropic Insights và đóng góp vào tất cả các phần của công việc. Miles McCain viết hướng dẫn diễn giải kết quả đầu ra của Anthropic Insights, phát triển cơ sở hạ tầng kỹ thuật hỗ trợ nghiên cứu của đối tác, đóng góp vào việc đánh giá nội bộ các kết quả đầu ra của Anthropic Insights và cung cấp phản hồi về bài blog và mô hình đe dọa quyền riêng tư. Ryan Heller đóng góp cơ sở hạ tầng kỹ thuật để hỗ trợ nghiên cứu của đối tác. Saffron Huang đóng góp vào việc đánh giá nội bộ các kết quả đầu ra của Anthropic Insights và cung cấp phản hồi cũng như thảo luận quan trọng. Thomas Millar và Suzanne Wang đóng góp cơ sở hạ tầng kỹ thuật để hỗ trợ nghiên cứu của đối tác và đánh giá nội bộ các kết quả đầu ra của Anthropic Insights. Shan Carter, Mo Julapalli, Matt Kearney, Sarah Pollack và Judy Shen đóng góp vào việc đánh giá nội bộ các kết quả đầu ra của Anthropic Insights. Matthew Jagielski đóng góp vào mô hình đe dọa quyền riêng tư. Shaoyi Zhang đóng góp cơ sở hạ tầng kỹ thuật để hỗ trợ nghiên cứu của đối tác. Heather Whitney, Ankur Rathi, Aisling Keenan và David Saunders cung cấp hướng dẫn pháp lý và quyền riêng tư trong suốt dự án. Jake Eaton và Sylvie Carr đóng góp vào việc xây dựng khung và viết bài blog. Jack Clark và Michael Stern cung cấp hướng dẫn, hỗ trợ và thảo luận có giá trị trong suốt quá trình. Deep Ganguli cung cấp hướng dẫn chi tiết, hỗ trợ tổ chức và phản hồi trong tất cả các giai đoạn của dự án.
Ngoài ra, chúng tôi cảm ơn Miriam Chaum, Ishita Dasgupta, Esin Durmus, Adam Farina, Zoe Hitzig, Jerry Hong, Devin Kuokka, Hendson Lin, Maxim Massenkoff, Peter McCrory, Maryam Quasto, Nitarshan Rajkumar, Amie Rotherham, Divya Siddarth, Taylor Sorensen, Jerome Swannack, Alex Tamkin, Molly Villagra, Scott White và Charles Yang vì những ý tưởng, thảo luận, phản hồi và hỗ trợ hữu ích của họ.
Vì sự hợp tác trong chương trình này, chúng tôi cảm ơn Vishakh Padmakumar, Yijia Shao, Jennifer Wang, Diyi Yang và Dora Zhao từ Phòng thí nghiệm Công nghệ Xã hội và Ngôn ngữ tại Stanford, Tsvetomira Dumbalska, Hannah Rose Kirk và Christopher Summerfield từ Phòng thí nghiệm Xử lý Thông tin Con người tại Oxford, và Joel Becker (hiện đang làm việc tại Anthropic), Daniel Paleka và Parker Whitfill từ METR.
Để thực hiện cuộc kiểm toán quyền riêng tư của bên thứ ba, chúng tôi cảm ơn Zexi Yao, Bozhidar Stevanoski, Peter Romov, Euodia Dodd, Xiaoxue Yang và Nataša Krčo.
Trích dẫn
Nội dung liên quan
Cách Claude đang thúc đẩy thiết kế protein và hóa học phân tích
Trong bài viết này, chúng tôi chia sẻ hai kết quả cho thấy cách Claude có thể giúp các nhà khoa học sự sống tăng tốc độ nghiên cứu của họ.
Đọc thêm
Các mô hình và vấn đề trong các hệ thống đa tác nhân mới nổi
Tại đây, chúng tôi xác định một vài ví dụ về các xu hướng hành vi trong các mô hình tiên tiến hiện nay và chỉ ra cách chúng có thể tạo ra những thất bại hệ thống bất ngờ, với hy vọng bắt đầu một cuộc thảo luận về việc giảm thiểu những rủi ro này.
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Anthropic: Research ( - Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.