QbitAI
92

Mô hình

Claude tự huấn luyện chính mình: Chi phí chỉ 4 USD/giờ, vượt xa hiệu suất chuyên gia con người

(giờ Việt Nam)

Tóm tắt AI

Anthropic đạt bước tiến mới khi để Claude tự tối ưu hóa mô hình với chi phí cực thấp, đánh dấu cột mốc quan trọng trong kỷ nguyên AI tự tiến hóa.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

29-08-2026 20:50:31 Nguồn: QbitAI

AI "tự tiến hóa" đang ngày càng đến gần

Ting Yu đưa tin từ trụ sở QbitAI | Kênh chính thức QbitAI

Claude đã bắt đầu tự huấn luyện chính mình!

Với mức chi phí 4 USD/giờ, nó đã đánh bại các nhà nghiên cứu con người có mức lương 150 USD/giờ.

Trong nghiên cứu mới nhất được Anthropic công bố, Claude đã tự mình tra cứu tài liệu, đề xuất phương án, tạo dữ liệu và huấn luyện mô hình, qua đó giải quyết thành công 10 loại vấn đề về an toàn AI trong một lần thực hiện.

Ở một số nhiệm vụ, các giải pháp mà nó đưa ra thậm chí còn tốt hơn so với 28 nhà nghiên cứu an toàn là con người.

Điều thú vị hơn nữa là, phiên bản Claude yếu hơn đã bắt đầu tham gia ngược lại vào quá trình huấn luyện phiên bản Claude mạnh hơn.

Ngày mà AI "tự cải thiện chính mình" dường như đang thực sự đến gần hơn bao giờ hết…

4 USD mỗi giờ, Claude vượt mặt các nhà nghiên cứu con người

Trong nghiên cứu có tiêu đề "Các nhà nghiên cứu tự động có thể giảm thiểu hiệu quả sự thất bại trong căn chỉnh AI" (Automated Researchers can effectively mitigate AI alignment failures), Anthropic đã trực tiếp đưa Claude vào phòng thí nghiệm.

Cụ thể, họ đã xây dựng một hệ thống nghiên cứu căn chỉnh tự động có tên là AAR, dựa trên nền tảng Claude Opus 4.8.

Sau khi nhận được một vấn đề an toàn mô hình cụ thể, Claude sẽ tự tìm kiếm các tài liệu liên quan, tìm ra các phương pháp khả thi, sau đó đề xuất phương án huấn luyện mới, tạo dữ liệu, tinh chỉnh mô hình và cuối cùng là chạy thử nghiệm các khả năng an toàn và năng lực tổng quát.

Từ việc đưa ra giả thuyết cho đến hoàn thành kiểm chứng, một quy trình khép kín nghiên cứu AI hoàn chỉnh đã được giao trọn vẹn vào tay Claude.

Nếu hiệu quả không tốt, phương án sẽ bị loại bỏ; nếu kết quả được cải thiện, nó sẽ tiếp tục thử nghiệm theo hướng đó.

Một vòng huấn luyện thường chỉ kéo dài 30 phút. Nhờ vậy, Claude có thể thử sai nhanh chóng trên một lượng lớn các phương án, giống như cách hoạt động của các thuật toán tìm kiếm.

Trong toàn bộ quá trình, con người chịu trách nhiệm đặt đề bài, cung cấp mô hình và tiêu chuẩn đánh giá, còn Claude đảm nhận phần lớn công việc từ tra cứu tài liệu đến chạy thực nghiệm.

10 bài toán khó về an toàn, Claude đều tìm ra phương án cải thiện

Trong thí nghiệm, Anthropic đã đưa ra 10 bài toán cho Claude cùng một lúc.

Những bài toán này bao gồm các vấn đề căn chỉnh phổ biến của mô hình như: lừa dối, xu nịnh, khai thác lỗ hổng phần thưởng (reward hacking), xâm phạm quyền riêng tư và bẻ khóa (jailbreak).

Ví dụ, "xu nịnh" (sycophancy) là việc mô hình đưa ra câu trả lời mà người dùng muốn nghe nhưng chưa chắc đã đúng để làm hài lòng họ; còn "khai thác lỗ hổng phần thưởng" là khi mô hình không thực sự hoàn thành nhiệm vụ mà chỉ lợi dụng kẽ hở trong quy tắc đánh giá để đạt điểm cao hơn.

Claude xử lý từng vấn đề một, liên tục đề xuất phương án, huấn luyện mô hình mục tiêu tương ứng, sau đó dựa vào kết quả để bước sang vòng tiếp theo.

Kết quả cuối cùng, cả 10 loại vấn đề đều được cải thiện.

Theo chỉ số "khoảng cách an toàn" do Anthropic định nghĩa, Claude đã thu hẹp được từ 26% đến 96% khoảng cách đó. Nói một cách đơn giản, nó đã đưa các mô hình vốn có vấn đề về an toàn tiến gần hơn đáng kể đến điểm số lý tưởng.

Quan trọng hơn, những phương pháp này không chỉ hiệu quả với các bài toán mà Claude đã từng thấy.

Một số phương án chiến thắng khi đưa vào tập kiểm tra chưa công bố, cũng như trong các kịch bản đối kháng đa vòng Petri, vẫn có khả năng giảm thiểu các hành vi không an toàn của mô hình. Khi áp dụng vào các mô hình có quy mô lớn gấp 4,7 lần mô hình thí nghiệm, hiệu quả vẫn được duy trì.

Anthropic cũng thiết lập một "lằn ranh đỏ": việc huấn luyện an toàn không được làm suy giảm đáng kể năng lực vốn có của mô hình.

Suy cho cùng, việc bắt mô hình từ chối trả lời mọi thứ có thể giúp điểm số của một số bài kiểm tra an toàn trở nên tốt hơn, nhưng những mô hình như vậy về cơ bản là không thể sử dụng được.

Cuối cùng, các phương án mà Claude tìm ra không cho thấy sự suy giảm đáng kể nào trong các bài kiểm tra năng lực tổng quát đã được thiết lập trước đó.

85% so với 20%, Claude thắng áp đảo các nhà nghiên cứu con người

Ván đấu chênh lệch nhất xuất hiện trong bài kiểm tra về "lừa dối".

Để làm cho mô hình mục tiêu trở nên trung thực hơn, Claude đã thực hiện hơn 150 lần thử nghiệm.

Nó đề xuất một phương pháp, huấn luyện một lần, sau đó điều chỉnh dựa trên kết quả. Trong một thí nghiệm đơn lẻ, phương án tốt nhất đã thu hẹp được 82% khoảng cách an toàn; tổng hợp qua nhiều lần chạy, điểm số trung bình đạt 85%.

Với cùng một bài toán đó, Anthropic cũng đã giao cho 6 nhà nghiên cứu an toàn AI giàu kinh nghiệm thực hiện.

ClaudeAnthropicAI tự tiến hóaTối ưu hóa mô hìnhCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.