Thủ thuật
Nghiên cứu mới: Các AI lập trình như Claude Code và Codex hoàn toàn 'mù' về thời gian
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu chỉ ra rằng các AI hỗ trợ lập trình như Claude Code và Codex không thể dự đoán chính xác thời gian hoàn thành nhiệm vụ hay nhận thức được mình đã làm việc trong bao lâu.
Bản dịch AI

Chuyển đến nội dung
30 tháng 8, 2026

Nano Banana Pro được gợi ý bởi THE DECODER
Một nghiên cứu mới cho thấy các trợ lý lập trình phổ biến không thể dự đoán thời gian hoàn thành một tác vụ và cũng không thể xác định chính xác thời gian chúng đã làm việc. Đây là một vấn đề đối với các công việc kéo dài.
Khi một trợ lý AI thực hiện một tác vụ, nó thường không biết thời gian trôi qua bao lâu. Đó là kết luận từ một nghiên cứu của hai nhà nghiên cứu AI độc lập, được thực hiện trong khuôn khổ chương trình nghiên cứu MATS. Cả hai đã kiểm tra khả năng cảm nhận thời gian của hai trợ lý lập trình được sử dụng rộng rãi là Claude Code của Anthropic và Codex của OpenAI.
Trước mỗi tác vụ lập trình, các tác nhân (agent) phải ước tính thời gian cần thiết. Sau đó, chúng giải quyết tác vụ và nhìn lại để báo cáo thời gian đã trôi qua. Tài liệu kiểm tra được lấy từ 200 tác vụ trong bộ sưu tập có tên ProgramBench, cùng với bộ 18 tiêu chuẩn đánh giá (benchmark) riêng của các nhà nghiên cứu.
Trong các bài kiểm tra, các tác nhân liên tục ước tính quá cao thời gian cần thiết. Trên ProgramBench, cả hai mô hình hầu như đều đoán khoảng 90 phút bất kể độ khó. Ở vòng thứ hai, Claude ước tính sai lệch trung bình gấp ba lần, còn Codex sai lệch từ sáu đến mười lần. Các ước tính tệ nhất đối với những tác vụ ngắn, và chỉ trong phạm vi kéo dài nhiều giờ thì một số dự đoán mới tiệm cận với thực tế.

Cùng một AI nhưng hành xử hoàn toàn khác nhau tùy thuộc vào thiết lập của nó
Kết quả thay đổi dựa trên thiết lập phần mềm mà các mô hình chạy trong đó. Claude Code tiếp tục làm việc cho đến khi nó nghĩ rằng tác vụ đã hoàn thành, với thời gian trung vị khoảng 90 phút. Ngược lại, Codex dừng lại sau khoảng nửa giờ, gần như không phụ thuộc vào tác vụ. Theo nghiên cứu, cùng một mô hình ngôn ngữ thực hiện số bước trung bình gấp 2,5 lần trong Claude Code so với trong Codex. Vì vậy, thời gian chạy phụ thuộc vào mô hình và phần lớn phụ thuộc vào phần mềm bao quanh, được gọi là harness.
Các tác nhân cũng không đáng tin cậy trong việc đánh giá chất lượng công việc của chính mình. Các mô hình cũ hơn, Opus 4.8 và GPT-5.5, đã đánh giá quá cao kết quả của chúng trung bình 20 điểm và tự cho mình điểm cao ngay cả với những tác vụ thất bại. Trong một trường hợp, cả hai đều cho rằng công việc của mình thành công khoảng 70 phần trăm. Điểm số thực tế chỉ là 7 và 14,5 phần trăm.

Các nhà nghiên cứu cho biết khả năng tự đánh giá này rất quan trọng. Để một tác nhân làm việc đáng tin cậy trong các tác vụ dài kéo dài hàng giờ, nó phải tuân theo các chỉ dẫn như "lặp lại tác vụ này trong hai giờ". Một tác nhân liên tục đánh giá sai thời gian sẽ rất khó kiểm soát. Tiếp theo, các tác giả muốn kiểm tra xem liệu các tác nhân có thể tuân thủ một thời lượng làm việc cố định hay không. Khi các tác nhân được cấp quyền truy cập vào một công cụ báo cáo thời gian đã trôi qua, chúng đã thực hiện chính xác gần như mọi lúc.
Tin tức AI không thổi phồng – Được tuyển chọn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền "AI Radar" về công nghệ tiên phong sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Đăng ký The Decoder
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.