Anthropic công bố công cụ đo lường nhịp độ phát triển AI tiên tiến cùng các chỉ số nội bộ
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
Anthropic vừa công bố bộ chỉ số dùng để đo lường tiến độ R&D tại các phòng thí nghiệm AI tiên phong, bao gồm ba nội dung: mức độ AI tham gia vào quá trình phát triển AI, tình trạng giám sát các tác nhân AI, và việc phân bổ tài nguyên tính toán giữa nghiên cứu phát triển AI với nghiên cứu an toàn. Công ty cũng chia sẻ dữ liệu thực tế từ nội bộ Anthropic và khẳng định bất kỳ nhà phát triển AI tiên phong nào cũng có thể công bố các chỉ số tương tự để bên thứ ba kiểm chứng.
Về mức độ AI tham gia R&D, Anthropic đề xuất "Chỉ số tự động hóa R&D của Anthropic", áp dụng hệ thống phân cấp tự động hóa của Epoch AI (từ AL0 - không có AI tham gia, đến AL5 - hoàn toàn tự chủ). Công ty cho biết tính đến tháng 8 năm 2026, Claude chưa đạt mức tự chủ hoàn toàn trong bất kỳ công việc R&D nào được đo lường, nhưng đã "dẫn dắt" khoảng 26% khối lượng công việc R&D, với hơn 90% công việc đạt mức "AI cộng tác" trở lên. Anthropic cho biết chỉ số này được tổng hợp bằng cách rà soát các loại hình công việc R&D nội bộ và đánh giá từng nhiệm vụ. Theo IT, dữ liệu được trích xuất từ hồ sơ công việc nội bộ tháng 7 năm 2026, Slack và các tài liệu khác, với khoảng 15 nghìn nhiệm vụ phát triển mô hình được quy đổi thành 542 nút nhiệm vụ. Ars Technica dẫn nguồn từ The Wall Street Journal cho biết con số 26% này đã tăng đáng kể so với mức 1% hồi tháng 3.
Về giám sát tác nhân AI, Anthropic cho biết tính đến tháng 8 năm 2026, nền tảng nội bộ phổ biến nhất của hãng vận hành khoảng 30 nghìn tác nhân thực hiện các công việc nghiên cứu và kỹ thuật tại bất kỳ thời điểm nào. 100% hành động của các tác nhân này đều được giám sát trực tuyến trước khi thực thi và giám sát ngoại tuyến sau khi thực thi. Phân tích hơn 1 tỷ quyết định của tác nhân trong tháng 8 năm 2026 cho thấy khoảng 0,002% (tương đương 1 trên mỗi 47 nghìn quyết định) đã bị chặn; mỗi tuần có khoảng 100 nghìn bản ghi hội thoại được gắn cờ để kiểm tra thêm, trong đó khoảng 50 bản ghi có mức ưu tiên cao nhất được chuyển lên cho con người thẩm định.
Về phân bổ tài nguyên tính toán, Anthropic đã thống kê dữ liệu sử dụng trong tuần từ ngày 13 đến 20 tháng 7 năm 2026: khoảng 6% tài nguyên tính toán cho R&D AI được dành cho nghiên cứu an toàn, và khoảng 12% tài nguyên tính toán dùng cho AI phát triển AI được dành cho an toàn. Công ty nhấn mạnh đây là ước tính thận trọng – các công việc vừa thúc đẩy năng lực vừa đảm bảo an toàn không được tính vào, đồng thời chưa bao gồm phần tài nguyên dành cho các bộ phân loại an toàn. Công ty cũng lưu ý rằng nghiên cứu an toàn thường không tiêu tốn nhiều tài nguyên như huấn luyện các mô hình tiên phong, do đó tỷ trọng tính toán không phản ánh trực tiếp mức độ đầu tư tổng thể cho an toàn. Anthropic cho biết các chỉ số này hiện vẫn là hệ thống đo lường nguyên mẫu, việc so sánh giữa các phòng thí nghiệm vẫn đối mặt với các vấn đề về phương pháp thống nhất và xác thực độc lập; hãng dự kiến sẽ mời các tổ chức đánh giá độc lập từ bên thứ ba tham gia.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T7 · 19/09 · 07:09.
Diễn biến mới nhất
Anthropic công bố ba nhóm chỉ số đo lường tiến độ nghiên cứu phát triển (R&D) bền vững, bao gồm: mức độ AI tham gia vào R&D, giám sát hành động của các tác nhân thông minh (AI agents) và phân bổ tài nguyên tính toán. Đồng thời, hãng cũng thừa nhận khả năng so sánh giữa các phòng thí nghiệm hiện vẫn bị hạn chế bởi phương pháp luận và tính tự đánh giá.
Chính chủ · 3 bài
Nghe trực tiếp từ bên liên quan
- X: Anthropic (@AnthropicAI)Anthropic công bố ba chỉ số đo lường tốc độ phát triển AI
- Anthropic: The Institute (nghiên cứu chuyên sâu - Web)Anthropic công bố công cụ đo lường nhịp độ phát triển AI tiên tiến cùng các chỉ số nội bộ
Dòng thời gian đưa tin
Đang hiện 10 bài · tất cả · mới trước
T7 · 19/09
Anthropic công bố các chỉ số tự động hóa R&D nội bộ: Claude đảm nhận 26% khối lượng công việc nghiên cứu được kiểm nghiệm
X: Hongming (@hongming731)Anthropic lần đầu công bố các chỉ số tự động hóa R&D nội bộ: Tính đến tháng 8/2026, Claude đảm nhận 26% khối lượng công việc nghiên cứu được kiểm nghiệm, trong khi tỷ lệ cộng tác với AI đạt trên 90%. Tại nền tảng nội bộ phổ biến nhất, có khoảng 30 nghìn Agent kỹ thuật và R&D hoạt động tại bất kỳ thời điểm nào, với khoảng 6% tài nguyên tính toán AI được dành cho bảo mật. Tại Cainiao, tỷ lệ đóng góp của AI Coding đã tăng từ khoảng 10% lên hơn 90%, nhưng chu kỳ thay đổi yêu cầu chỉ chênh lệch khoảng 10%.
Bản tin sáng BestBlogs: Các chỉ số R&D của Anthropic và công thức RL cho Agent 397B
X: Hongming (@hongming731)Bản tin sáng ngày 19/09 của BestBlogs tổng hợp 10 nội dung, tiêu điểm bao gồm công thức huấn luyện RL đầu tiên cho Agent tri thức 397B do tác giả chính của LoRA và các thành viên nòng cốt của OpenAI o1 đồng công bố, giúp cải thiện chỉ số Pass@1 lên 70%.
T6 · 18/09
Các nhà nghiên cứu dùng Claude để xâm nhập tài khoản nhân viên OpenAI, Anthropic đồng thời công bố dữ liệu tỷ trọng chi phí R&D AI
Ars Technica: AICác nhà nghiên cứu đã lợi dụng lỗ hổng cấu hình trên diễn đàn cộng đồng OpenAI (do bên thứ ba là Discourse lưu trữ) để truy cập vào cổng đăng nhập nội bộ, từ đó xâm nhập thành công tài khoản ChatGPT của một nhân viên OpenAI, vốn có quyền truy cập vào mã nguồn nội bộ thông qua GitHub.
Anthropic công bố tiến độ nghiên cứu AI: AI đã đảm nhận 26% khối lượng công việc phát triển mô hình
X: AI Safety Memes (@AISafetyMemes)Anthropic công bố ba chỉ số nội bộ nhằm theo dõi sự phát triển của AI, bao gồm tỷ lệ AI tham gia vào quá trình nghiên cứu AI, mức độ giám sát các AI agent và phân bổ tài nguyên tính toán. Các nguồn tin cho biết tỷ lệ công việc nghiên cứu do AI chủ trì đã tăng từ 0% lên 26% chỉ trong 6 tháng. Hiện tại, Anthropic luôn duy trì khoảng 30.000 AI agent thực hiện các công việc nghiên cứu và kỹ thuật, với khoảng 6% tài nguyên tính toán dành cho nghiên cứu AI được đầu tư vào lĩnh vực an toàn.
Anthropic công bố hệ thống đo lường tiến độ nghiên cứu AI tiên tiến: Claude đã chủ trì 26% khối lượng công việc nghiên cứu AI nội bộ
IT HomeAnthropic công bố phương pháp đo lường tiến độ nghiên cứu tại các phòng thí nghiệm AI tiên tiến, bao gồm ba chỉ số: mức độ AI tham gia vào nghiên cứu AI, mức độ giám sát AI agent và phân bổ tài nguyên tính toán.
Anthropic công bố các chỉ số nội bộ: Claude chủ trì 26% khối lượng công việc nghiên cứu AI, hơn 90% công việc đã có sự tham gia sâu rộng của AI
X: Rohan Paul (@rohanpaul_ai)Anthropic công bố ba chỉ số đo lường tốc độ phát triển AI cùng dữ liệu thực tế nội bộ. Tính đến tháng 8 năm 2026, 26% công việc nghiên cứu AI đã đạt đến mức Claude có thể hoàn thành phần lớn nhiệm vụ từ khâu nhận chỉ thị cấp cao đến khi kết thúc, con người chủ yếu đóng vai trò giám sát; hơn 90% các công việc nghiên cứu được đo lường đã có AI thực hiện phần lớn các giai đoạn.
Dữ liệu từ Anthropic cho thấy tỷ lệ các nhiệm vụ nghiên cứu mô hình do Claude chủ trì đã tăng từ 1% lên 26% trong vòng nửa năm
X: Kim (@kimmonismus)Anthropic công bố ba chỉ số đo lường nhịp độ phát triển AI: khối lượng nghiên cứu AI do AI đảm nhận, mức độ giám sát AI agent và phân bổ tài nguyên tính toán, đồng thời cung cấp dữ liệu nội bộ. Theo đó, trong khoảng sáu tháng, tỷ lệ các nhiệm vụ nghiên cứu mô hình tại Anthropic do Claude chủ trì đã tăng từ 1% lên 26%. Claude hiện tham gia hoặc chủ trì hơn 90% công việc nghiên cứu mô hình, với nền tảng AI agent nội bộ luôn duy trì khoảng 30.000 agent thực hiện các công việc nghiên cứu và kỹ thuật tại bất kỳ thời điểm nào.
Anthropic công bố ba chỉ số đo lường tốc độ phát triển AI
X: Anthropic (@AnthropicAI)Chính chủAnthropic đề xuất ba chỉ số để đo lường tốc độ phát triển AI, bao gồm: mức độ AI tham gia vào nghiên cứu, chất lượng giám sát các tác nhân AI (AI agents), và tình hình phân bổ năng lực tính toán, đồng thời công bố các dữ liệu đo lường từ nội bộ công ty.
Anthropic công bố công cụ đo lường nhịp độ phát triển AI tiên tiến cùng các chỉ số nội bộ
Anthropic: The Institute (nghiên cứu chuyên sâu - Web)Chính chủAnthropic phát hành bộ chỉ số đo lường nhịp độ phát triển AI tiên tiến, bao gồm ba khía cạnh: nghiên cứu do AI dẫn dắt, giám sát tác nhân AI và phân bổ năng lực tính toán.
Anthropic công bố ba chỉ số đo lường, công khai dữ liệu tiến độ phát triển AI do AI thực hiện
Anthropic: Newsroom (Web)Chính chủAnthropic ra mắt khung đo lường, công khai ba chỉ số nội bộ nhằm giúp bên ngoài hiểu rõ nhịp độ phát triển AI tại các phòng thí nghiệm tiên phong. Tính đến tháng 8 năm 2026, Claude đóng vai trò chủ đạo trong 26% công việc nghiên cứu và phát triển AI của Anthropic, hơn 90% công việc đạt mức độ cộng tác; nền tảng nội bộ hiện có khoảng 30 nghìn Agent, trong hơn 1 tỷ quyết định được đưa ra, chỉ 0,002% bị chặn bởi hệ thống giám sát trực tuyến; trong một tuần của tháng 7, khoảng 6% năng lực tính toán dành cho phát triển AI đã được sử dụng cho công tác an toàn.