IT Home
92

Nghiên cứu

Anthropic đột phá với phương pháp 'AI tự huấn luyện AI': Tối ưu hóa an toàn với chi phí cực thấp

(giờ Việt Nam)

Tóm tắt AI

Anthropic giới thiệu hệ thống AAR giúp tự động hóa quá trình căn chỉnh AI, đạt hiệu suất vượt trội so với con người chỉ trong 6 giờ với chi phí rẻ hơn gấp 37 lần.

Bản dịch AI

Theo tin từ IT ngày 29/8, việc sử dụng các mô hình AI để huấn luyện các mô hình AI khác đang trở thành hướng đi trọng tâm mà thế hệ các phòng thí nghiệm AI mới đang khám phá. Vào ngày 28 (giờ địa phương), một nhà nghiên cứu thuộc chương trình Anthropic Researcher đã trình diễn viễn cảnh thực tế khi phương pháp này được triển khai.

Anthropic đã công bố bài báo mới nhất với tiêu đề "Automated researchers can reliably mitigate alignment failures" (tạm dịch: Các nhà nghiên cứu tự động có thể giảm thiểu lỗi căn chỉnh một cách đáng tin cậy), giới thiệu cách tận dụng các hệ thống AI để cải thiện hiệu suất của mô hình trong một loạt các bài kiểm tra đánh giá căn chỉnh (alignment benchmarks). Nhóm nghiên cứu đã thiết lập các bài kiểm tra nhắm vào 10 hành vi lệch lạc cụ thể, và hệ thống tự động cuối cùng đã giúp cải thiện tất cả 10 chỉ số mà không làm ảnh hưởng đến khả năng tổng thể của mô hình.

Hệ thống này được phát triển dưới sự dẫn dắt của Chen Yuehan, thành viên chương trình Anthropic Researcher, với quy trình làm việc tương tự như nghiên cứu khoa học truyền thống. Hệ thống tự động trước tiên sẽ tham khảo các tài liệu hiện có, đề xuất phương pháp huấn luyện, sau đó huấn luyện mô hình theo phương án đó trong 30 phút và dần dần cải thiện kết quả kiểm tra thông qua nhiều vòng thử nghiệm. Các phương án hiệu quả sẽ được giữ lại, trong khi các phương án không hiệu quả sẽ bị loại bỏ, giúp toàn bộ quá trình nghiên cứu có thể mở rộng quy mô một cách nhanh chóng.

Bài báo chỉ ra rằng, nhìn chung, những kết quả này bước đầu chứng minh rằng việc hậu huấn luyện căn chỉnh tự động có tiềm năng trở thành một phương pháp thực sự khả thi trong tương lai gần.

Nghiên cứu này cũng tiến thêm một bước tới khả năng tự cải thiện đệ quy (recursive self-improvement), điều mà nhiều người coi là giai đoạn quan trọng tiếp theo trong sự phát triển của AI. Nếu các mô hình AI có thể tự cải thiện phương pháp huấn luyện căn chỉnh của chính mình, thì việc cải thiện rộng rãi hơn các quy trình huấn luyện khác cũng không phải là điều bất khả thi. Đến giai đoạn đó, các nhà nghiên cứu AI là con người thậm chí có thể dần trở nên không còn cần thiết nữa.

Bài báo cũng so sánh trực tiếp hiệu suất giữa nhà nghiên cứu căn chỉnh tự động (AAR) và các nhà nghiên cứu con người: "Phương pháp AAR tốt nhất trung bình chỉ mất 6 giờ để vượt qua các phương án do các nhà nghiên cứu con người giàu kinh nghiệm đề xuất. Các hướng nghiên cứu do con người dẫn dắt không mang lại hiệu suất cao hơn."

Sự chênh lệch về chi phí cũng rất rõ rệt. "AAR chỉ tốn khoảng 4 USD chi phí suy luận API mỗi giờ (IT lưu ý: tỷ giá hiện tại tương đương khoảng 27 Nhân dân tệ), trong khi chúng tôi phải trả cho các nhà nghiên cứu con người 150 USD mỗi giờ (tỷ giá hiện tại tương đương khoảng 1.011 Nhân dân tệ)."

Tuy nhiên, phương pháp này vẫn có những hạn chế rõ rệt. Hiệu quả của hệ thống tự động trước hết phụ thuộc vào việc liệu các bài kiểm tra đánh giá có phản ánh chính xác mục tiêu căn chỉnh thực tế hay không; ngay cả khi bản thân các bài kiểm tra là đáng tin cậy, việc xây dựng và duy trì lâu dài các tiêu chuẩn này vẫn đòi hỏi sự đầu tư lớn. Các tài liệu nghiên cứu mà nhà nghiên cứu tự động dựa vào cũng cần được duy trì và mở rộng liên tục.

Tham khảo

Automated researchers can reliably mitigate alignment failures

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian lựa chọn, kết quả chỉ mang tính chất tham khảo, các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.