The Decoder: AI News
85

Thủ thuật

Anthropic công bố Claude đóng góp 26% vào nghiên cứu AI, nhưng khái niệm 'dẫn dắt' cần được hiểu đúng

(giờ Việt Nam)

Tóm tắt AI

Anthropic báo cáo Claude hiện đóng vai trò chủ đạo trong 26% công việc phát triển mô hình theo thang đo AL4, tăng mạnh so với mức dưới 1% hồi tháng 2, dù định nghĩa về sự 'dẫn dắt' của AI vẫn còn gây tranh cãi.

Bản dịch AI

Anthropic wants you to know Claude leads a quarter of its research, but "lead" doesn't mean what you think

Bối cảnh ở đây là lời kêu gọi của CEO Anthropic, Dario Amodei, về việc phối hợp làm chậm quá trình phát triển AI ở giai đoạn tiên phong. Anthropic cho biết, để làm được điều đó, công chúng cần có cái nhìn sâu sắc hơn. Các chỉ số này nhằm mục đích cho thấy cách các mô hình được xây dựng, đồng thời bổ sung cho các bài kiểm tra năng lực vốn dùng để đo lường khả năng của mô hình.

Ý nghĩa của từ "dẫn dắt" (leads) trong ngữ cảnh này là gì và không phải là gì

Trọng tâm nằm ở một chỉ số phân loại tất cả các công việc phát triển tại Anthropic theo thang đo từ Epoch AI, chạy từ AL0 (không có AI) đến AL5 (tự chủ hoàn toàn). Tính đến tháng 8 năm 2026, 26% công việc nằm ở mức AL4, tăng từ dưới 1% vào tháng 2. Hơn 90% đạt ít nhất mức AL3. Claude chưa đạt mức AL5 ở bất kỳ đâu.

Epoch AI gọi AL4 là "AI dẫn dắt" (AI leads) và Anthropic đã đưa cụm từ này vào tiêu đề của mình. Tuy nhiên, bất kỳ ai đánh đồng "dẫn dắt" với sự tự chủ hoàn toàn đều đã hiểu sai. Đó là mục đích của mức AL5.

Một ví dụ từ Anthropic cho thấy vị trí của AL4: Một kỹ sư đưa cho Claude một báo cáo lỗi, và Claude phân tích, sửa lỗi rồi kiểm tra mà không cần đặt câu hỏi, nhưng nó không được phép triển khai (ship). Con người sẽ đọc báo cáo và đưa ra quyết định. Nhiệm vụ và định hướng vẫn đến từ con người. Sự khác biệt so với AL3 ("cộng tác") chủ yếu là Claude không còn bị khựng lại khi gặp khó khăn.

Chính Claude đã thực hiện việc chấm điểm này. Các tác nhân (agents) thu thập bằng chứng từ Slack và các tài liệu nội bộ, sau đó một mô hình Claude khác sẽ gán các cấp độ. Anthropic thừa nhận "giám khảo" này có thể mắc những sai lầm tương tự như hệ thống mà nó đang kiểm tra.

Ngay cả với Anthropic, ranh giới giữa "cộng tác" và "dẫn dắt" cũng không rõ ràng. Một cuộc kiểm tra chéo của công ty cho thấy điều này: Nhân viên được yêu cầu đánh giá mức độ tự động hóa trong lĩnh vực công việc của chính họ. Khi hai người cùng đánh giá một lĩnh vực, họ chỉ đưa ra cùng một cấp độ trong khoảng một phần ba số trường hợp. Mô hình Claude gán điểm chính thức khớp với đánh giá của con người 59% thời gian. Hầu như luôn luôn, trong 97% các trường hợp, con người và mô hình chỉ chênh lệch tối đa một cấp độ. Nhưng một cấp độ chính là bước nhảy từ "cộng tác" sang "dẫn dắt". Có vẻ như việc một nhiệm vụ có được tính vào con số 26% hay không thường là vấn đề của sự diễn giải.

Ngoài ra còn có câu hỏi về việc con số 26% đó thực sự đo lường điều gì. Anthropic đã liệt kê cách nhân viên dành thời gian làm việc trong tháng 7 và chấm điểm từng hoạt động, trong đó các nhiệm vụ tiêu tốn nhiều thời gian sẽ có trọng số cao hơn. Vì vậy, Claude "dẫn dắt" một phần tư khối lượng công việc tính theo số giờ làm việc của con người. Điều này không nói lên được Claude đưa ra bao nhiêu quyết định hay liệu nó có tiếng nói trong định hướng nghiên cứu hay không.

Tất nhiên, con số này giúp ích cho công ty theo hai cách: Là một tuyên bố về hiệu suất của sản phẩm và là lập luận cho lời kêu gọi làm chậm lại của Amodei. Bất kỳ ai cáo buộc các công ty AI sử dụng các cảnh báo an toàn để định hình quy định theo hướng có lợi cho họ sẽ tìm thấy bằng chứng mới trong cách định nghĩa từ "dẫn dắt".

Sự giám sát non trẻ đối với 30.000 tác nhân

Theo báo cáo, trên nền tảng nội bộ được sử dụng nhiều nhất của Anthropic, khoảng 30.000 tác nhân đang chạy cùng lúc. Một hệ thống giám sát thời gian thực kiểm tra mọi hành động và nhằm mục đích ngăn chặn các hành vi như sao chép trọng số mô hình. Trong số hơn một tỷ quyết định vào tháng 8, hệ thống đã ngăn chặn được 0,002%. Một hệ thống giám sát thứ hai gắn cờ khoảng 100.000 bản ghi mỗi tuần sau khi sự việc đã xảy ra, và khoảng 50 trong số đó được con người xem xét. Anthropic thừa nhận họ chỉ mới chạy hệ thống giám sát này được vài tháng và không chắc chắn rằng nó phát hiện được mọi mô hình hành vi.

Trong một tuần lấy mẫu vào tháng 7, khoảng 6% năng lực tính toán (compute) cho nghiên cứu AI đã được dành cho công việc an toàn. Anthropic quan tâm đến chỉ số này chủ yếu vì năng lực tính toán là yếu tố đầu vào mà người ngoài có thể kiểm tra dễ dàng nhất. Nếu ngành công nghiệp đồng ý làm chậm lại, đây sẽ là một đòn bẩy khả thi, ví dụ thông qua các cam kết tự nguyện về tỷ lệ dành cho nghiên cứu an toàn.

Anthropic cho biết con số thấp không nhất thiết có nghĩa là công việc an toàn ít. Công việc an toàn chủ yếu là thiết kế các thí nghiệm, tiêu tốn thời gian của nhà nghiên cứu nhưng ít chip, trong khi một đợt huấn luyện cho mô hình mới lại tiêu tốn năng lực khổng lồ. Anthropic cũng không tính các công việc thúc đẩy cả an toàn và năng lực vào mục an toàn.

Công ty cảnh báo rằng ranh giới với nghiên cứu năng lực rất mờ nhạt, và mọi nhà cung cấp đều bị cám dỗ để vẽ ra ranh giới đó một cách rộng rãi. Họ cho rằng gánh nặng chứng minh nên thuộc về phía nhà phát triển.

AnthropicClaudePhát triển AIMinh bạch AICông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.