IT Home
85

Thủ thuật

Anthropic công bố hệ thống đo lường tiến độ AI: Claude hiện đảm nhận 26% công việc nghiên cứu nội bộ

(giờ Việt Nam)

Tóm tắt AI

Anthropic giới thiệu bộ tiêu chuẩn mới để đánh giá mức độ tự chủ của AI trong nghiên cứu, bao gồm khả năng tự phát triển, giám sát tác nhân và phân bổ tài nguyên tính toán.

Bản dịch AI

Theo tin từ IT ngày 18 tháng 9, Anthropic hôm nay đã công bố một bộ phương pháp dùng để đo lường tiến độ nghiên cứu và phát triển của các phòng thí nghiệm AI tiên phong, đồng thời công bố dữ liệu giai đoạn nội bộ của công ty.

Hệ thống này tập trung vào 3 chỉ số chính: mức độ AI tham gia vào quá trình nghiên cứu và phát triển AI, tình hình giám sát các AI agent (tác nhân AI), và việc phân bổ năng lực tính toán giữa nghiên cứu phát triển AI và nghiên cứu an toàn.

Anthropic cho biết, cùng với sự nâng cao năng lực của AI, AI đang ngày càng tham gia nhiều hơn vào việc phát triển các hệ thống AI thế hệ tiếp theo. Công ty hy vọng thông qua việc công khai các chỉ số này, công chúng, các tổ chức bên thứ ba và chính phủ có thể hiểu một cách trực quan hơn về tốc độ thúc đẩy nghiên cứu và phát triển AI tiên phong.

CEO của Anthropic, Dario Amodei, từng kêu gọi sự phối hợp để làm chậm quá trình phát triển AI tiên phong; nếu có sự phối hợp này, các con số liên quan dự kiến sẽ có sự thay đổi.

Về khía cạnh AI tham gia vào nghiên cứu phát triển AI, Anthropic đã đề xuất "Chỉ số tự động hóa R&D của Anthropic" (Anthropic R&D Automation Index) để đo lường mức độ Claude tham gia vào công việc nghiên cứu và phát triển AI của công ty. Chỉ số này áp dụng hệ thống cấp độ tự động hóa do Epoch AI đề xuất, từ AL0 đến AL5, tương ứng với các mức: không có AI tham gia, AI hỗ trợ, AI cộng tác, AI chủ đạo và vận hành hoàn toàn tự chủ.

Tương tự như các cấp độ đánh giá xe tự lái, AL5 chỉ việc AI vận hành hoàn toàn tự chủ mà không cần sự can thiệp của con người, còn AL4 chỉ việc AI có thể hoàn thành hầu hết các nhiệm vụ dựa trên các gợi ý cấp cao, con người chỉ đóng vai trò giám sát.

Tính đến tháng 8 năm 2026, Claude chưa đạt đến mức "vận hành hoàn toàn tự chủ" trong bất kỳ công việc nghiên cứu phát triển AI nào được đo lường, nhưng đã "chủ đạo" khoảng 26% công việc R&D AI của Anthropic, đồng thời tỷ trọng công việc ở mức "AI cộng tác" trở lên đã vượt quá 90%.

Anthropic tiết lộ rằng tỷ lệ này vào tháng 2 năm 2026 vẫn còn dưới 1%. Công ty cho rằng, các chỉ số loại này giúp quan sát xem mức độ tự động hóa trong R&D AI có liên tục tăng hay không, cũng như khoảng cách đến "tự cải tiến đệ quy" — tức là khi AI có thể hoàn toàn tự chủ phát triển thế hệ AI tiếp theo — còn bao xa.

Để thiết lập chỉ số này, Anthropic đã lấy mẫu và tổng hợp khoảng 15.000 nhiệm vụ nghiên cứu mô hình từ hồ sơ công việc nội bộ, Slack và các tài liệu khác vào tháng 7 năm 2026, sau đó phân loại thành 542 nút nhiệm vụ ở các cấp độ khác nhau, trong đó 378 nút thuộc danh mục nhiệm vụ chi tiết nhất. Tiếp theo, Claude sẽ nghiên cứu cách thực hiện các nhiệm vụ này và mức độ tham gia của AI, đồng thời một mô hình đánh giá độc lập của Claude sẽ thực hiện việc xác định cấp độ tự động hóa.

Hệ thống giám sát thời gian thực sẽ kiểm tra hành vi trước khi các agent thực hiện thao tác, đồng thời chặn hoặc điều chỉnh khi phát hiện các thao tác nguy hiểm. Sau khi phân tích hơn 1 tỷ quyết định của các agent vào tháng 8 năm 2026, Anthropic phát hiện ra rằng khoảng 0,002% thao tác đã bị hệ thống này chặn (Ghi chú của IT: tương đương với khoảng 1 lần chặn trên mỗi 47.000 thao tác).

Hệ thống giám sát hậu kiểm sẽ phân tích các thao tác mà agent đã hoàn thành, mỗi tuần đánh dấu khoảng 100.000 bản ghi hội thoại để kiểm tra thêm, trong đó khoảng 50 bản ghi có mức ưu tiên cao nhất sẽ được chuyển lên để con người xem xét. Ngoài ra, khoảng 1/1.000 đến 2/1.000 hoạt động của agent sẽ được đánh dấu là cần xem xét thêm.

Về phân bổ năng lực tính toán, Anthropic đã thống kê tình hình sử dụng tài nguyên tính toán trong giai đoạn từ ngày 13 đến ngày 20 tháng 7 năm 2026. Dữ liệu cho thấy khoảng 6% năng lực tính toán mà công ty dùng cho R&D AI được đầu tư vào nghiên cứu an toàn; nếu chỉ tính riêng các công việc R&D AI dựa trên AI, tỷ trọng năng lực tính toán cho nghiên cứu an toàn chiếm khoảng 12%.

Anthropic nhấn mạnh rằng tỷ lệ năng lực tính toán nêu trên là ước tính khá thận trọng, vì các công việc đồng thời thúc đẩy năng lực mô hình và tính an toàn không được tính vào nghiên cứu an toàn, hơn nữa thống kê này cũng không tính phần năng lực tính toán dùng cho các bộ phân loại an toàn (safety classifiers). Công ty cũng chỉ ra rằng nghiên cứu an toàn thường không tiêu tốn nhiều năng lực tính toán như việc huấn luyện các mô hình tiên phong, do đó tỷ trọng năng lực tính toán không thể đại diện trực tiếp cho mức độ đầu tư tổng thể vào công tác an toàn.

Anthropic cho biết, các chỉ số này hiện vẫn thuộc hệ thống đo lường nguyên mẫu, việc so sánh giữa các phòng thí nghiệm vẫn còn đối mặt với các vấn đề như phương pháp thống nhất và xác minh độc lập. Công ty có kế hoạch mời các đánh giá viên độc lập từ nhiều tổ chức, cho phép họ tiếp cận các quy trình, hệ thống và dữ liệu tương tự như nhóm đánh giá rủi ro nội bộ để xác minh các thực tiễn an toàn và liên tục giám sát các chỉ số liên quan.

Anthropic cho biết việc công bố các phép đo này nhằm giúp công chúng, bên thứ ba và chính phủ hiểu rõ hơn về tốc độ phát triển AI bên trong các phòng thí nghiệm tiên phong, đồng thời hy vọng sẽ tiếp tục công bố các dữ liệu liên quan.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.