Nghiên cứu
Anthropic trình làng hệ thống AI tự cải thiện: Tự động hóa quy trình nghiên cứu an toàn
(giờ Việt Nam)
Tóm tắt AI
Nhóm nghiên cứu tại Anthropic đã phát triển hệ thống tự động hóa quy trình nghiên cứu, giúp tối ưu hóa hiệu suất mô hình trên các tiêu chuẩn an toàn với chi phí thấp hơn gấp nhiều lần so với chuyên gia con người.
Bản dịch AI

Huấn luyện các mô hình AI bằng các mô hình AI khác đã trở thành một mục tiêu rất phổ biến đối với các phòng thí nghiệm mới — và giờ đây, một nhà nghiên cứu trong chương trình nghiên cứu sinh của Anthropic đã mang đến cho chúng ta cái nhìn sơ lược về việc điều này có thể diễn ra như thế nào trong thực tế.
Vào thứ Sáu, Anthropic đã công bố một bài báo mới có tiêu đề “Automated Researchers Can Reliably Mitigate Alignment Failures” (tạm dịch: Các nhà nghiên cứu tự động có thể giảm thiểu lỗi căn chỉnh một cách đáng tin cậy), trình bày chi tiết cách các hệ thống AI có thể cải thiện hiệu suất của một mô hình một cách đáng tin cậy trên một tập hợp các tiêu chuẩn căn chỉnh (alignment benchmarks). Khi được cung cấp 10 tiêu chuẩn cho các hành vi sai lệch cụ thể, các hệ thống tự động đã có thể cải thiện hiệu suất trên từng tiêu chuẩn mà không làm giảm hiệu suất tổng thể.
Dưới sự dẫn dắt của nghiên cứu sinh Anthropic Chen Yueh-Han, hệ thống này tái lập phần lớn phương pháp nghiên cứu truyền thống. Mỗi hệ thống tự động sẽ tìm kiếm các tài liệu hiện có, đề xuất một phương pháp và huấn luyện mô hình bằng phương pháp đó trong 30 phút, dần dần nâng cao tiêu chuẩn qua nhiều lần lặp lại. Các phương pháp hiệu quả được giữ lại trong khi những phương pháp không hiệu quả bị loại bỏ, cho phép hệ thống vận hành nhanh chóng và trên quy mô lớn.
“Nhìn chung, những kết quả này cung cấp bằng chứng ban đầu cho thấy việc căn chỉnh tự động sau huấn luyện có thể trở nên khả thi trong tương lai gần,” bài báo viết.
Bài báo này là một bước tiến tới khả năng tự cải thiện đệ quy (recursive self-improvement), điều mà nhiều người coi là bước tiến quan trọng tiếp theo trong sự phát triển của AI. Nếu các mô hình có thể tự cải thiện quá trình huấn luyện căn chỉnh của chính mình, thì rất có khả năng chúng cũng có thể cải thiện các phương pháp huấn luyện trên phạm vi rộng hơn — và đến lúc đó, các nhà nghiên cứu AI là con người có thể sớm trở nên lỗi thời.
Bài báo không ngần ngại đề cập đến ý tưởng này khi so sánh trực tiếp Automated Alignment Researcher (AAR) với phiên bản con người tương đương. “Phương pháp AAR tốt nhất vượt qua những gì con người có kinh nghiệm đề xuất, trung bình trong vòng sáu giờ,” bài báo viết. “Các hướng nghiên cứu do con người dẫn dắt không mang lại hiệu suất mạnh mẽ hơn.”
Thậm chí còn có một sự so sánh về chi phí, phòng trường hợp ai đó vẫn chưa bị thuyết phục. “Một AAR tiêu tốn khoảng 4 đô la mỗi giờ cho việc suy luận API, so với 150 đô la mỗi giờ mà chúng tôi trả cho các nhà nghiên cứu là con người.”
Công bằng mà nói, bài báo cũng chỉ ra một vài hạn chế của phương pháp này. Hệ thống tự động chỉ hoạt động hiệu quả khi các tiêu chuẩn phản ánh đúng các mục tiêu căn chỉnh thực tế, và ngay cả khi đó, vẫn còn rất nhiều việc phải làm trong việc thiết lập và duy trì các tiêu chuẩn này — chưa kể đến việc duy trì và mở rộng các tài liệu mà các nhà nghiên cứu tự động dựa vào.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.
Russell Brandom đã đưa tin về ngành công nghệ từ năm 2012, tập trung vào chính sách nền tảng và các công nghệ mới nổi. Trước đây, ông từng làm việc tại The Verge và Rest of World, đồng thời đã viết bài cho Wired, The Awl và MIT’s Technology Review. Bạn có thể liên hệ với ông qua email [email protected] hoặc qua Signal theo số 412-401-5489.
Xem tiểu sử

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.