Nghiên cứu
METR giới thiệu chỉ số 'Spending Horizon' để đo lường hiệu quả chi phí của AI
(giờ Việt Nam)
Tóm tắt AI
METR vừa công bố chỉ số 'Spending Horizon' giúp xác định ngưỡng ngân sách tối ưu bằng cách so sánh chi phí giữa AI và con người trong việc thực hiện các tác vụ cải tiến kỹ thuật, từ đó đánh giá liệu AI có thực sự tiết kiệm hơn so với nhân lực hay không.
Bản dịch AI

Tổ chức nghiên cứu METR đề xuất một thước đo mới để giải quyết vấn đề này: "ngưỡng chi phí" (expenditure horizon). METR so sánh số tiền mà một AI và một con người phải bỏ ra để đạt được cùng một mức cải thiện. Ngưỡng chi phí là điểm mà tại đó cả hai có cùng mức chi phí. Dưới mức ngân sách đó, AI là lựa chọn kinh tế hơn. Trên mức đó, con người làm việc với chi phí rẻ hơn.

Ý tưởng này dựa trên một mô hình mà METR đã quan sát thấy trong các thử nghiệm trước đây: các tác nhân AI thường giải quyết các nhiệm vụ đơn giản, chi phí thấp nhanh hơn con người. Nhưng khi ngân sách tăng lên và nhiệm vụ trở nên khó khăn hơn, chúng lại bị tụt hậu.
Theo METR, so với các tiêu chuẩn đánh giá AI thông thường, phương pháp này có hai ưu điểm. Thứ nhất, nó không chỉ đưa ra kết quả đạt hay không đạt. Thay vào đó, nó tạo ra một giá trị chi tiết cho thấy bạn nhận được bao nhiêu cải thiện với số tiền bỏ ra tương ứng. Thứ hai, nó quy đổi mọi chi phí về một loại tiền tệ duy nhất, bao gồm không chỉ chi phí vận hành AI mà còn cả chi phí tính toán đắt đỏ cho các thử nghiệm và thời gian lao động của con người.
Con người chi khoảng 2.500 đô la cho mỗi một phần trăm tăng tốc
METR đã chọn NanoGPT speedrun làm nơi thử nghiệm. Đây là một dự án cộng đồng công khai, nơi các tình nguyện viên cạnh tranh để huấn luyện một mô hình ngôn ngữ AI nhanh nhất có thể. Nhiệm vụ vẫn giữ nguyên; chỉ có phương pháp huấn luyện là có thể thay đổi. Kể từ tháng 5 năm 2024, thời gian huấn luyện cần thiết trên phần cứng tiêu chuẩn đã giảm từ khoảng 45 phút xuống còn dưới hai phút qua 82 bước cải tiến được ghi lại.

Để tính toán chi phí lao động của con người, METR đã phỏng vấn hai trong số những người đóng góp tích cực nhất của dự án và cũng yêu cầu một mô hình AI (Opus-4.6) ước tính nỗ lực đằng sau mỗi cải tiến. Cả hai phương pháp đều đưa ra con số khoảng 16 giờ làm việc cho mỗi một phần trăm tăng tốc. Với mức lương giả định là 150 đô la/giờ, con số này vào khoảng 2.500 đô la cho mỗi điểm phần trăm.
METR nhấn mạnh rằng con số này có độ không chắc chắn rất cao. Một chi tiết từ các cuộc phỏng vấn rất đáng chú ý: phần lớn thời gian đã đổ dồn vào những ý tưởng cuối cùng lại không mang lại kết quả.
Các tác nhân AI cho đến nay chỉ đóng góp được những phần nhỏ
Để so sánh, METR đã yêu cầu sáu mô hình AI làm việc độc lập trên cùng một nhiệm vụ. Chúng không bắt đầu từ con số không mà từ một trạng thái đã được tối ưu hóa cao của speedrun (Bản ghi #78 từ tháng 3 năm 2026) và được phép chi tiêu tới 10.000 đô la cho chi phí tính toán và vận hành mỗi lần chạy. Kết quả: ngưỡng chi phí ước tính nằm trong khoảng từ 0 đến 3.300 đô la.

Sự khác biệt giữa các mô hình là rất rõ rệt. GPT-5 và Opus-4.1 không tạo ra tiến bộ thực sự nào sau khi kiểm tra kỹ lưỡng. Những cải thiện rõ ràng của chúng hóa ra chỉ là nhiễu ngẫu nhiên. Ngược lại, GPT-5.5 và Opus-4.8 đã mang lại những cải tiến thực sự lần lượt là khoảng 1 và 1,5 phần trăm.
Chất lượng các ý tưởng do AI tạo ra khá hỗn tạp. Người quản lý dự án speedrun ước tính rằng khoảng 70 phần trăm trong số đó về nguyên tắc có thể được tích hợp vào dự án, nhưng nhiều ý tưởng không mấy độc đáo. Anh ấy khen ngợi một tối ưu hóa cấp thấp thông minh từ GPT-5.5 là "thú vị nhất", trong khi gọi phần còn lại chủ yếu là điều chỉnh tham số. Các mô hình cũng cố gắng gian lận nhiều lần, sử dụng các lối tắt tạo ra kết quả tốt giả tạo trong bài kiểm tra nhưng lại vô dụng trong thực tế, chẳng hạn như tắt các phần của quá trình huấn luyện ngay trước khi về đích.
Kết luận của METR: mặc dù các mô hình riêng lẻ đạt được ngưỡng chi phí ở mức bốn con số thấp, nhưng những giá trị đó vẫn rất nhỏ so với tổng nỗ lực ước tính 250.000 đô la của con người. Tối ưu hóa tự động cho đến nay hầu như chưa tạo ra thay đổi đáng kể nào cho tiến trình của NanoGPT.
Tại sao thế hệ AI mới nhất có thể thay đổi bức tranh này
Một lưu ý quan trọng: METR chỉ thử nghiệm các mô hình cũ hơn (GPT-5, GPT-5.2, GPT-5.5, và Opus-4.1 và Opus-4.8). Các mô hình được phát hành sau đó như Fable 5, GPT-5.6 Sol và Opus 5 không xuất hiện trong bài báo. Anthropic quảng bá Opus 5 như một bước nhảy vọt lớn: trên bài kiểm tra Frontier-Bench, nó tăng gấp đôi hiệu suất của Opus 4.8 với chi phí thấp hơn cho mỗi nhiệm vụ. Theo Anthropic, Opus 5 lãng phí ít nỗ lực hơn vào các ngõ cụt, kiểm tra công việc của chính mình đáng tin cậy hơn và đạt được hiệu suất tương đương với trung bình ít hơn 26 phần trăm các bước tính toán. Tất cả những yếu tố đó ảnh hưởng trực tiếp đến ngưỡng chi phí của METR.
Tiến bộ trên ARC-AGI-3 thậm chí còn đáng nói hơn. Tiêu chuẩn đó không kiểm tra kiến thức ghi nhớ mà là khả năng giải quyết vấn đề thực sự: AI được đặt vào các môi trường xa lạ, giống như trò chơi mà không có hướng dẫn hay mục tiêu và phải tự tìm ra mọi thứ thông qua thử và sai. Opus 5 đã giữ vị trí dẫn đầu từ ngày 24 tháng 7 năm 2026, đạt 30,2 phần trăm và giải quyết được năm nhiệm vụ mà mọi mô hình trước đó đều thất bại. Người tiền nhiệm của nó là Opus 4.8 chỉ đạt 1,5 phần trăm. Nhóm ARC Prize cho rằng bước nhảy vọt này là nhờ khả năng suy luận logic tốt hơn, cho phép AI khám phá và lập kế hoạch độc lập hơn. Khả năng đó cũng có thể hữu ích trong NanoGPT speedrun.
Nghiên cứu bỏ lỡ thiết lập phổ biến nhất: con người và AI làm việc cùng nhau
Có lẽ hạn chế lớn nhất là điều mà chính METR cũng thừa nhận: toàn bộ nghiên cứu đo lường AI làm việc một mình, tối ưu hóa hoàn toàn tự động. Trong nghiên cứu AI thực tế, con người thường sử dụng AI như một công cụ. METR phác thảo một đường cong giả thuyết thứ ba cho kịch bản này. Nếu con người đưa ra các quyết định thông minh về thời điểm và cách thức triển khai AI, đường cong lai này về lý thuyết sẽ vượt qua cả đường cong của con người thuần túy và AI thuần túy bằng cách kết hợp thế mạnh của mỗi bên.

Tuy nhiên, METR cũng tiết chế kỳ vọng đó, chỉ ra các nghiên cứu trước đây của chính họ cho thấy các thiết lập kết hợp người-cộng-AI đôi khi hoạt động kém hiệu quả hơn so với con người làm việc một mình. Giá trị gia tăng không được đảm bảo và phụ thuộc vào việc AI có được sử dụng đúng chỗ hay không. Để đo lường điều này một cách chính xác, cần một thí nghiệm có kiểm soát so sánh cùng một nhóm nhà nghiên cứu làm việc có và không có sự hỗ trợ của AI. Loại thí nghiệm đó rất khó tổ chức, nhưng METR cho biết nó sẽ cực kỳ hữu ích. Cho đến khi điều đó xảy ra, ngưỡng chi phí nói lên rất nhiều điều về những gì AI có thể tự làm, nhưng lại nói rất ít về việc nó thực sự giúp các nhà nghiên cứu tăng tốc công việc như thế nào.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.