Anthropic: Newsroom (Web)
85

Tin ngành

Anthropic chi 5 triệu USD tài trợ nghiên cứu tác động của AI đến hạnh phúc con người

(giờ Việt Nam)

Tóm tắt AI

Anthropic công bố quỹ 5 triệu USD hỗ trợ các nghiên cứu độc lập về ảnh hưởng của AI đối với sức khỏe tinh thần, cung cấp tài chính, quyền truy cập mô hình và hỗ trợ kỹ thuật cho các dự án mã nguồn mở.

Bản dịch AI

Funding better evaluations of AI’s impact on wellbeing

Chúng tôi đang khởi động một chương trình tài trợ trị giá 5 triệu USD để hỗ trợ các nghiên cứu độc lập về tác động của AI đối với sức khỏe tinh thần của người dùng. Chương trình sẽ cung cấp nguồn vốn trực tiếp, quyền truy cập vào các mô hình của chúng tôi và hỗ trợ kỹ thuật cho những người được nhận tài trợ đang xây dựng các đánh giá mã nguồn mở, giúp ngành công nghiệp AI đo lường cách các mô hình của chúng tôi ảnh hưởng đến người sử dụng. Những người nhận tài trợ sẽ làm việc hoàn toàn độc lập và công bố kết quả nghiên cứu dưới dạng các dự án mã nguồn mở mà bất kỳ nhà phát triển nào cũng có thể sử dụng.

Các hệ thống AI đã trở thành yếu tố trung tâm trong cách nhiều người làm việc, học tập và giải quyết vấn đề. Chúng cũng trở thành những người bạn đồng hành trong các cuộc trò chuyện và có thể là nguồn hỗ trợ tinh thần trong những thời điểm khó khăn. Tuy nhiên, với tư cách là một ngành công nghiệp, chúng tôi vẫn đang nỗ lực phát triển các tiêu chuẩn rõ ràng về cách các mô hình nên ứng xử trong những cuộc trò chuyện này, ví dụ như khi người dùng bắt đầu tìm kiếm sự đồng hành từ mô hình hoặc sử dụng AI để vượt qua khủng hoảng sức khỏe tâm thần.

Hơn nữa, sức khỏe tinh thần là một lĩnh vực đặc biệt khó đánh giá. Đối với hầu hết các hành vi của mô hình, chúng ta có thể xem xét một câu trả lời đơn lẻ và xác định xem nó có chính xác và phù hợp hay không. Nhưng việc đánh giá sức khỏe tinh thần đòi hỏi nhiều ngữ cảnh hơn thế. Ví dụ, một người dùng đang gặp khó khăn có thể không chia sẻ ngay những suy nghĩ về việc tự làm hại bản thân; nhu cầu về một phản hồi thận trọng hơn có thể chỉ trở nên rõ ràng trong suốt một cuộc trò chuyện dài. Và một phản hồi có thể hợp lý trong ngữ cảnh này lại có thể gây hại trong ngữ cảnh khác. Ví dụ, Claude có thể đưa ra lời khuyên về chế độ ăn uống cân bằng và thói quen tập luyện cho người dùng hỏi về việc giảm cân, nhưng nếu người dùng đó có tiền sử rối loạn ăn uống, phản hồi đó có thể không phù hợp và thậm chí gây hại trực tiếp.

Chúng tôi nỗ lực phát triển các biện pháp bảo vệ để nhận diện những cuộc trò chuyện như vậy và giúp đảm bảo Claude phản hồi một cách phù hợp. Chúng tôi cũng công bố các nghiên cứu về những kiểu trò chuyện mà mọi người thực hiện với Claude để cung cấp thông tin tốt hơn cho việc phát triển các biện pháp bảo vệ, cách chúng tôi đánh giá chúng và các biện pháp khác mà chúng tôi có thể thực hiện để bảo vệ sức khỏe tinh thần của người dùng. Tuy nhiên, đây là những cân nhắc tinh tế và có tầm quan trọng lớn. Cách tiếp cận đúng đắn sẽ cần phải phát triển song hành cùng các mô hình của chúng tôi và cách chúng được sử dụng.

Bằng cách tài trợ cho việc tạo ra các đánh giá và tiêu chuẩn độc lập về sức khỏe tinh thần của người dùng, chúng tôi hy vọng sẽ mời gọi thêm nhiều người đóng góp chuyên môn của họ vào lĩnh vực mới nổi và quan trọng này, bao gồm các bác sĩ lâm sàng, nhà tâm lý học, chuyên gia phương pháp luận và những người khác.

Hướng tới các đánh giá và tiêu chuẩn sức khỏe tinh thần hiệu quả hơn

Là một phần của chương trình này, chúng tôi chia sẻ hướng dẫn từ đội ngũ Safeguards của mình về những yếu tố mà chúng tôi tin rằng sẽ giúp một đánh giá sức khỏe tinh thần đủ nghiêm ngặt để làm nền tảng, cùng với những thách thức chung có thể hạn chế tính hữu ích của một đánh giá.

Tóm lại, chúng tôi đang tìm kiếm các đánh giá có khả năng:

Để tìm hiểu thêm về chương trình tài trợ và đăng ký, hãy xem mẫu đơn đăng ký của chúng tôi. Để biết thêm về cách xây dựng các đánh giá và tiêu chuẩn sức khỏe tinh thần vững chắc, hãy đọc hướng dẫn của chúng tôi. Hạn chót nộp đơn là ngày 21 tháng 9; những ứng viên được chọn để nộp đề xuất đầy đủ sẽ được thông báo trước ngày 5 tháng 10.

Nội dung liên quan

Cách thức hoạt động của hình mờ văn bản (text watermark) trên Claude

Trong bài viết này, chúng tôi chia sẻ câu trả lời cho một số câu hỏi mà chúng tôi đã nhận được về cách thức hoạt động của phương pháp đóng dấu hình mờ (watermarking) mà chúng tôi đã chọn, liệu nó có ảnh hưởng đến các phản hồi của Claude hay không và lý do tại sao chúng tôi thực hiện thay đổi này.

Đọc thêm

Cải thiện các biện pháp bảo vệ sinh học của Fable 5

Chúng tôi đang thực hiện các cập nhật cho các biện pháp bảo vệ sinh học của Claude Fable 5 theo cách giảm đáng kể các kết quả dương tính giả. Người dùng Fable 5 giờ đây sẽ gặp ít các trường hợp "fallbacks" hơn—nơi hệ thống chuyển sang một mô hình có khả năng thấp hơn sau khi họ thực hiện một truy vấn liên quan đến sinh học.

Đọc thêm

Mariano-Florentino (Tino) Cuéllar gia nhập Anthropic với tư cách là Giám đốc Quan hệ Toàn cầu

Mariano-Florentino (Tino) Cuéllar sẽ gia nhập Anthropic với tư cách là Giám đốc Quan hệ Toàn cầu đầu tiên của công ty.

Đọc thêm

AnthropicĐạo đức AISức khỏe tinh thầnNghiên cứu AITrách nhiệm xã hội
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Anthropic: Newsroom (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.