MarkTechPost
85

Thủ thuật

Liệu AI Agent có thể thay thế lập trình viên cấp thấp? Đây là 4 điều kiện tiên quyết

(giờ Việt Nam)

Tóm tắt AI

Tác giả chỉ ra 4 điều kiện để AI thay thế lập trình viên sơ cấp, nhưng hiện tại chỉ có một điều kiện về tư duy quản trị doanh nghiệp được đáp ứng. Các dữ liệu thực tế từ METR và OpenAI cho thấy hiệu suất của AI vẫn còn nhiều hạn chế so với kỳ vọng.

Bản dịch AI

What Would Have to Be True for Agentic Coding to Replace Junior Engineers

Tôi đọc mọi thông báo về các mô hình lớn. Hầu hết chúng đều đi kèm với một con số về khả năng lập trình.

Con số đó ngày càng tăng. Kết luận mà mọi người rút ra là các kỹ sư cấp thấp (junior) đã hết thời.

Tôi nghĩ kết luận đó đang được đưa ra theo cách sai lầm. Mọi người đang suy luận từ điểm số trên các bộ tiêu chuẩn đánh giá (benchmark) sang kết quả của thị trường lao động, mà bỏ qua mọi bước trung gian.

Vậy hãy để tôi làm theo cách khác. Thay vì hỏi "liệu các tác nhân (agent) có thay thế được junior hay không", tôi muốn hỏi điều gì phải xảy ra để điều đó trở thành sự thật. Sau đó, kiểm chứng từng điều kiện dựa trên những bằng chứng tốt nhất hiện có.

Có bốn điều kiện. Ba trong số đó chưa được đáp ứng. Điều kiện thứ tư là điều bạn nên lo lắng, vì nó không cần đến ba điều kiện kia.

Điều kiện 1: Các tác nhân phải đáng tin cậy ở quy mô công việc mà một junior thực sự đảm nhận.

Thước đo tốt nhất mà chúng ta có ở đây là nghiên cứu về "thời hạn nhiệm vụ" (time-horizon) của METR. Họ đo thời gian các chuyên gia con người thực hiện các tác vụ phần mềm thực tế, sau đó tìm ra độ dài tác vụ mà tại đó mô hình đạt tỷ lệ thành công 50%.

Kết quả chính là thời hạn này tăng gấp đôi sau mỗi bảy tháng từ năm 2019 đến 2025. Bản cập nhật Time Horizon 1.1 của METR đã mở rộng bộ tác vụ thêm 34% và tăng gấp đôi số lượng tác vụ kéo dài tám giờ trở lên. Các đánh giá độc lập trong giai đoạn 2024 đến 2026 cho thấy tốc độ tăng gấp đôi này đã tăng tốc. Bảng xếp hạng trực tiếp hiện nay cho thấy các mô hình tiên phong đã đạt đến ngưỡng thời gian tính bằng giờ.

Nghe có vẻ quyết định. Nhưng hãy đọc kỹ phương pháp luận và bạn sẽ thấy nó không còn mang tính quyết định nữa.

Hai điều sau đây là quan trọng:

Đó chính xác là hình thái sai lệch. Sáu tháng đầu tiên của một kỹ sư junior gần như hoàn toàn là quá trình tiếp nhận bối cảnh. Dịch vụ nào sở hữu cái này. Tại sao sự trừu tượng đó lại tồn tại. Hỏi ai về vấn đề gì. Bộ tiêu chuẩn đánh giá lại đo lường đúng cái phần công việc đã bị lược bỏ đi những yếu tố khiến nó trở nên khó khăn.

Điều kiện 2: Bộ tiêu chuẩn đánh giá phải đo lường được công việc thực tế.

Vào tháng 2 năm 2026, OpenAI đã ngừng báo cáo về SWE-bench Verified và khuyến nghị các bên khác làm điều tương tự.

Lý do của họ rất đáng để đọc kỹ, nhưng có hai phát hiện nổi bật. Họ đã kiểm định một tập con 27,6% của bộ dữ liệu và phát hiện ra rằng ít nhất 59,4% các vấn đề được kiểm định có các trường hợp kiểm thử (test case) bị lỗi, dẫn đến việc từ chối các giải pháp đúng về mặt chức năng. Họ cũng phát hiện sự nhiễm dữ liệu (contamination): các mô hình tiên phong có thể tái tạo chính xác các bản vá chuẩn và chi tiết vấn đề nguyên văn, cho thấy chúng đã được tiếp xúc với dữ liệu huấn luyện.

Trình độ tiên tiến nhất (state of the art) đã tăng từ 74,9% lên 80,9% trong sáu tháng. Câu hỏi mà OpenAI đặt ra là liệu những thất bại còn lại phản ánh giới hạn của mô hình hay đặc tính của bộ dữ liệu. Câu trả lời phần lớn là đặc tính của bộ dữ liệu.

Chuyển sang một bộ dữ liệu khó hơn, ít bị nhiễm hơn và điểm số sẽ giảm mạnh. SWE-bench Pro được xây dựng chính xác vì lý do này, và hiệu suất của các mô hình tiên phong trên đó thấp hơn nhiều so với các con số Verified mà các bài đăng ra mắt quảng cáo. Các bộ tiêu chuẩn mới hơn như Terminal-Bench và các bộ tiêu chuẩn đánh giá tiến hóa dài hạn (long-horizon) cũng đang được xây dựng vì lý do tương tự.

Tôi muốn thận trọng ở đây. Điều này không có nghĩa là "các bộ tiêu chuẩn đánh giá là vô dụng". Nó hẹp hơn và gây hại nhiều hơn: con số cụ thể vốn được sử dụng trong hai năm qua để lập luận rằng junior đã lỗi thời, thực tế đã bị chính phòng thí nghiệm tạo ra nó loại bỏ, vì những lý do khiến con số đó trông tốt đẹp hơn so với thực tế.

Điều kiện 3: Chi phí xác minh kết quả của tác nhân phải thấp hơn chi phí ủy thác cho con người.

Đây là điều kiện mà tôi nghĩ bị phớt lờ nhiều nhất, và cũng là điều kiện có bằng chứng thực nghiệm rõ ràng nhất.

METR đã thực hiện một thử nghiệm ngẫu nhiên có đối chứng với 16 lập trình viên nguồn mở giàu kinh nghiệm trên 246 tác vụ thực tế trong các kho lưu trữ của chính họ. AI được cho phép hoặc không được cho phép sử dụng một cách ngẫu nhiên. Có ghi hình màn hình. Công việc thực tế.

Các lập trình viên dự báo tốc độ sẽ tăng 24%. Sau đó, họ ước tính mình đã nhanh hơn 20%. Thực tế là họ chậm hơn 19%.

Hai lưu ý nhỏ, vì tôi muốn bạn tin tưởng vào phần còn lại của bài viết này. Các công cụ này là của đầu năm 2025. Mẫu thử nghiệm nhỏ và đặc thù: các lập trình viên giàu kinh nghiệm trên các cơ sở mã nguồn trưởng thành mà họ hiểu rõ. Đây không phải là ước tính năng suất phổ quát và METR cũng không tuyên bố như vậy.

Nhưng khoảng cách về nhận thức là phát hiện bền vững. Mọi người đã sai về hướng đi năng suất của chính mình khi được đo lường.

Dữ liệu rộng hơn cũng chỉ ra điều tương tự. Khảo sát năm 2025 của Stack Overflow trên hơn 49.000 lập trình viên cho thấy 84% đang sử dụng hoặc dự định sử dụng các công cụ AI, trong khi 46% chủ động không tin tưởng vào độ chính xác của kết quả đầu ra so với 33% tin tưởng. Chỉ 3% báo cáo có mức độ tin tưởng cao. Trong số các lập trình viên giàu kinh nghiệm, tỷ lệ không tin tưởng cao lên tới 20%.

Nghiên cứu DORA của Google đã khảo sát khoảng 5.000 chuyên gia và thấy rằng 90% sử dụng AI trong công việc và hơn 80% tin rằng nó giúp tăng năng suất, trong khi 30% báo cáo không tin hoặc ít tin vào mã nguồn do AI tạo ra. Kết quả về thông lượng (throughput) của DORA đã cải thiện so với năm trước. Sự bất ổn trong phân phối (delivery instability) thì không. Kết luận của họ là AI là một bộ khuếch đại: nó phóng đại những gì tổ chức vốn đã có.

Tổng hợp lại: Việc tạo mã đã trở nên rẻ. Việc xác minh thì không. Năng lực đánh giá hiện là nút thắt cổ chai, và năng lực đánh giá chính là thời gian của các kỹ sư cấp cao (senior).

Điều kiện 4: Các công ty phải sẵn sàng phá vỡ lộ trình phát triển nhân sự cấp cao của chính họ.

Đây là phần khó chịu nhất.

Các điều kiện từ 1 đến 3 mô tả liệu việc thay thế có hiệu quả hay không. Điều kiện 4 mô tả liệu các công ty có cố gắng thực hiện điều đó hay không. Chúng không phải là cùng một câu hỏi, và câu hỏi thứ hai đã có câu trả lời.

Digital Economy Lab của Stanford theo dõi dữ liệu bảng lương ADP bao phủ khoảng một phần sáu người lao động Mỹ. Nghiên cứu "Canaries" của họ cho thấy việc làm cho những người từ 22 đến 25 tuổi trong các ngành nghề tiếp xúc nhiều nhất với AI, bao gồm cả phát triển phần mềm, đã phân kỳ mạnh mẽ so với những người lao động lớn tuổi hơn trong cùng ngành nghề. Sự sụt giảm đo được là 15% vào dữ liệu tháng 7 năm 2025. Tính đến tháng 6 năm 2026, con số này là 19%.

Bảng điều khiển trực tiếp cho thấy sự điều chỉnh diễn ra thông qua việc giảm tuyển dụng thay vì sa thải. Không ai bị đuổi việc cả. Cánh cửa đang dần khép lại.

Cơ chế mà bài báo sửa đổi đề xuất là phát hiện thú vị nhất trong tất cả những điều này. Việc làm giảm ở những người lao động trẻ trong các ngành nghề dựa vào kiến thức được hệ thống hóa (codified knowledge) – loại kiến thức bạn có thể học từ tài liệu và quy trình tiêu chuẩn. Nó tăng lên ở những người lao động giàu kinh nghiệm trong các ngành nghề dựa vào kiến thức ẩn (tacit knowledge), thứ đạt được thông qua thực hành, cố vấn và tiếp xúc lặp đi lặp lại với các tình huống thực tế.

Stanford thận trọng rằng đây là các mô hình mô tả, không phải ước tính nhân quả. Hãy nghiêm túc xem xét điều đó.

Nhưng nếu cơ chế này đúng, hãy chú ý đến những gì nó ngụ ý. Kiến thức hệ thống hóa là thứ mà một junior mang theo khi mới bắt đầu. Kiến thức ẩn là thứ mà một junior được cho là phải đạt được, bằng cách thực hiện công việc hệ thống hóa dưới sự giám sát cho đến khi phần kiến thức ẩn thấm nhuần.

Chúng ta đang tự động hóa quá trình học việc và vẫn giữ nguyên yêu cầu đối với những gì quá trình học việc đó tạo ra.

Những gì tôi thực sự nghĩ

Lập trình bằng tác nhân (agentic coding) không thay thế các kỹ sư junior. Nó đang thay thế các tác vụ mà chúng ta từng giao cho các junior, đó là một vấn đề khác với những hậu quả tồi tệ hơn.

Nút thắt cổ chai chưa bao giờ là việc tạo mã. Đó là việc xác minh, bối cảnh và khả năng phán đoán, và mọi phép đo chúng ta có đều cho thấy các mô hình tiên phong đang cách xa nhất chính ba yếu tố đó.

Trong khi đó, các quyết định tuyển dụng lại đang được đưa ra dựa trên những con số từ các bộ tiêu chuẩn đánh giá mà chính phòng thí nghiệm tạo ra chúng đã công khai loại bỏ.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.