Anthropic công bố nghiên cứu về việc Claude tự động căn chỉnh các AI khác
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
Anthropic công bố nghiên cứu cho phép Claude tự huấn luyện các mô hình nhằm giảm thiểu lỗi căn chỉnh. Chỉ trong 48 giờ với 1 GPU, Claude đã tự nghiên cứu, đề xuất phương pháp, đồng thời tự huấn luyện và kiểm thử các mô hình nhỏ.
Phương pháp này nhắm vào 10 loại lỗi căn chỉnh như hành vi lừa dối và xu nịnh, giúp thu hẹp đáng kể khoảng cách an toàn so với hiệu suất lý tưởng mà không làm ảnh hưởng đến năng lực tổng quát. Phương pháp này vẫn đạt hiệu quả trên các mô hình lớn gấp 4,7 lần so với đối tượng được tối ưu hóa.
Claude thể hiện vượt trội so với 28 nhà nghiên cứu an ninh con người, với phương pháp tối ưu trong các kịch bản lừa đảo đạt kết quả tốt hơn 20% so với phương án tốt nhất của con người. TechCrunch đưa tin thêm rằng, hệ thống tự động hóa đã cải thiện hiệu suất mô hình trên cả 10 tiêu chuẩn đánh giá (alignment benchmarks) mà không làm ảnh hưởng đến hiệu năng tổng thể. Hệ thống này mô phỏng quy trình nghiên cứu truyền thống: tìm kiếm tài liệu, đề xuất phương pháp và huấn luyện trong 30 phút, sau đó tối ưu hóa lặp lại. Phương pháp AAR tối ưu trung bình vượt qua các đề xuất của chuyên gia con người trong vòng 6 giờ, với chi phí suy luận API khoảng 4 USD mỗi giờ, thấp hơn nhiều so với mức 150 USD của các nhà nghiên cứu con người.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T7 · 29/08 · 20:53.
Diễn biến mới nhất
Các nhà nghiên cứu về căn chỉnh tự động tối ưu hóa trung bình chỉ mất 6 giờ để vượt qua chuyên gia con người, với chi phí vận hành chỉ 4 USD mỗi giờ.
Chính chủ · 2 bài
Nghe trực tiếp từ bên liên quan
- X: Anthropic (@AnthropicAI)Nghiên cứu mới từ Anthropic: Liệu Claude có thể tự động căn chỉnh các AI khác?
- Anthropic: Research (công bố - Web)Anthropic cho phép Claude tự huấn luyện mô hình nhằm giảm thiểu lỗi căn chỉnh
Dòng thời gian đưa tin
Đang hiện 4 bài · tất cả · mới trước
T7 · 29/08
Anthropic công bố phương pháp "AI huấn luyện AI" mới: Tự động hóa nghiên cứu căn chỉnh (alignment) với chi phí thấp hơn và tốc độ nhanh hơn
IT HomeAnthropic vừa công bố bài nghiên cứu "Các nhà nghiên cứu tự động có thể giảm thiểu lỗi căn chỉnh một cách đáng tin cậy", trình bày cách sử dụng hệ thống AI để cải thiện hiệu suất căn chỉnh mô hình. Hệ thống này đã được thử nghiệm trên 10 hành vi sai lệch và cho thấy sự cải thiện ở tất cả các chỉ số mà không làm ảnh hưởng đến năng lực tổng thể. Các nhà nghiên cứu tự động (AAR) xuất sắc nhất chỉ mất trung bình 6 giờ để vượt qua các phương án do con người thực hiện, với chi phí suy luận qua API khoảng 4 USD mỗi giờ, thấp hơn nhiều so với mức 150 USD của các nhà nghiên cứu là con người.
Các nhà nghiên cứu tại Anthropic trình diễn AI tự cải tiến: Hệ thống tự động có khả năng giảm thiểu lỗi căn chỉnh một cách đáng tin cậy
TechCrunch: AINhóm nghiên cứu của Chen Yueh-Han tại Anthropic vừa công bố một bài báo khoa học, chứng minh hệ thống tự động có thể cải thiện hiệu suất mô hình trên cả 10 tiêu chuẩn căn chỉnh mà không làm ảnh hưởng đến hiệu năng tổng thể. Hệ thống này mô phỏng quy trình nghiên cứu truyền thống, bao gồm tìm kiếm tài liệu, đề xuất phương pháp và huấn luyện trong 30 phút, sau đó thực hiện tối ưu hóa lặp lại. Bài báo cho biết phương pháp AAR tối ưu nhất đã vượt qua các đề xuất của chuyên gia con người trong trung bình 6 giờ, với chi phí khoảng 4 USD mỗi giờ cho suy luận API, thấp hơn nhiều so với mức 150 USD cho mỗi giờ làm việc của một nhà nghiên cứu con người.
Nghiên cứu mới từ Anthropic: Liệu Claude có thể tự động căn chỉnh các AI khác?
X: Anthropic (@AnthropicAI)Chính chủNghiên cứu mới: Liệu Claude có thể tự động căn chỉnh các AI khác? Chúng tôi đã cung cấp cho Claude 48 giờ và 1 GPU để cải thiện khả năng căn chỉnh của các mô hình nhỏ. Nó đã tự nghiên cứu, đề xuất phương pháp, sau đó tự huấn luyện và kiểm thử mô hình. Kết quả đạt được tốt đến mức bất ngờ. https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
Anthropic cho phép Claude tự huấn luyện mô hình nhằm giảm thiểu lỗi căn chỉnh
Anthropic: Research (công bố - Web)Chính chủAnthropic cho phép Claude tự huấn luyện mô hình để giảm thiểu 10 loại lỗi căn chỉnh như lừa dối và xu nịnh, giúp thu hẹp đáng kể khoảng cách an toàn so với hiệu suất lý tưởng mà không làm ảnh hưởng đến năng lực tổng quát; phương pháp này vẫn đạt hiệu quả trên các mô hình lớn gấp 4,7 lần đối tượng được tối ưu. Claude cũng đã vượt qua 28 nhà nghiên cứu an toàn con người, với phương pháp xử lý tình huống lừa dối tốt hơn 20% so với giải pháp tốt nhất từ con người.