MarkTechPost
82

Nghiên cứu

HarnessDev từ ByteDance: LLM tự xây dựng môi trường kiểm thử Agent vẫn còn nhiều hạn chế

(giờ Việt Nam)

Tóm tắt AI

Nhóm nghiên cứu từ ByteDance Seed và các đối tác giới thiệu HarnessDev, một khung đánh giá khả năng tự viết mã môi trường kiểm thử (harness) của LLM. Kết quả cho thấy chỉ 34/64 thay đổi của mô hình có khả năng áp dụng linh hoạt cho các tác vụ khác nhau.

Bản dịch AI

Can LLMs Engineer Their Own Agent Harness? ByteDance Seed’s HarnessDev Says Only 34 of 64 Changes Generalize

Agent harness (khung tác vụ) là phần mã bao quanh một mô hình: vòng lặp thực thi, công cụ, ngữ cảnh, trạng thái, khả năng khôi phục và xác thực. Theo bảng xếp hạng Terminal-Bench 2.1, GPT-5 giải quyết được 35,2% tác vụ trong Terminus 2 nhưng đạt 49,6% trong Codex CLI với cùng trọng số. Hầu hết các tiêu chuẩn đánh giá đều giữ nguyên khung tác vụ này. HarnessDev, được đề xuất bởi nhóm các nhà nghiên cứu từ ByteDance Seed, Đại học Công nghệ và Thiết kế Singapore, Viện Công nghệ Georgia, M-A-P và TokenWave.AI, đã thay đổi mục tiêu: đối tượng được đánh giá là khung tác vụ có thể chạy được do mô hình viết ra, chứ không phải câu trả lời mà nó tạo ra.

2 giai đoạn: Tạo lập (Creation) và Tiến hóa (Evolution)

Trong giai đoạn Tạo lập, mỗi người tạo nhận được cùng một hạt giống (seed) cơ bản: các tệp thụ động, tìm kiếm và các nguyên hàm xử lý cùng với các trình ghi kết quả và quỹ đạo, không có vòng lặp, trình lập kế hoạch, trình xác thực, cơ chế thử lại hoặc quy tắc dừng. Nếu không sửa đổi, nó đạt 0 điểm ở mọi nơi. Người tạo nhận được đặc tả nhóm tác vụ, hướng dẫn thiết kế ngắn gọn và 1 đến 3 trường hợp phát triển, sau đó xây dựng một khung tác vụ hoàn chỉnh; khung tác vụ này sẽ bị đóng băng trước khi thực hiện các tác vụ ẩn.

Trong giai đoạn Tiến hóa, người tạo bắt đầu từ khung tác vụ mã nguồn đã đóng băng của chính mình và sửa đổi nó bằng cách sử dụng phản hồi thực thi từ một tập hợp cố định gồm 100 tác vụ SWE-bench Pro và toàn bộ 89 tác vụ Terminal-Bench 2.1. Mỗi ứng viên chính thức phải hoàn thành cả hai bài đánh giá dưới dạng một cặp, với ngân sách là 10 cặp và tối đa 2 lần thăm dò 5 tác vụ giữa các cặp. Mọi phiên bản chính thức sau đó đều được chấm điểm trên 630 trường hợp SWE-Pro ẩn mà người tạo chưa từng thấy.

Các khung tác vụ được chấm điểm dựa trên năng lực (tác vụ thành công) và hiệu suất (số token thực thi, không bao gồm token của người tạo).

Thiết lập

6 LLM tạo lập đã được thử nghiệm: Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max và Seed 2.0 Pro, hoạt động bên trong Claude Code 2.1.177 (GPT-5.5 sử dụng Codex 0.144.3). Giai đoạn Tạo lập bao gồm 4 lĩnh vực và 5 tiêu chuẩn đánh giá với tổng cộng 2.207 trường hợp: SWE-bench Pro bản công khai (731), Terminal-Bench 2.1 (89), MLE-bench (75), EQ-Bench3 (46) và BrowseComp (1.266). Mỗi người tạo xây dựng 3 khung tác vụ cho mỗi tiêu chuẩn, được báo cáo dưới dạng avg@3. Self-Eval chạy từng khung tác vụ với người tạo của nó; Unified-Eval chạy tất cả với Gemini 3.1 Pro.

Kết quả Tạo lập

Theo Self-Eval, Opus 4.8 đạt điểm trung bình cao nhất là 67,8 so với mức 86,2 của tham chiếu do con người thiết kế. Khoảng cách này phụ thuộc vào lĩnh vực:

Các tham chiếu SWE-Pro, Terminal-Bench và BrowseComp là kết quả bên ngoài từ báo cáo GPT-5.6 của OpenAI, không phải kết quả chạy lại.

Khối lượng mã không dự đoán được chất lượng: 18 khung tác vụ mã nguồn đã thêm 17.111 dòng mã thực, tuy nhiên Gemini thêm ít nhất (1.006 dòng) nhưng lại dẫn đầu ở Terminal-Bench. Số lượng tự kiểm tra hầu như không tương quan với điểm số (Spearman 0,13 đến 0,26); các lệnh sửa đổi đạt mức 0,57.

Nhiều cơ chế được tạo ra không hoạt động. Trong số 108 trường hợp thành phần mã, 72 trường hợp được kích hoạt trong các lần chạy thực tế và 18 trường hợp không bao giờ chạy, tất cả đều liên quan đến trạng thái và bộ nhớ. 11 trong số 18 khung tác vụ định nghĩa một lớp State (Trạng thái), nhưng không có sự kiện kiểm tra điểm (checkpoint) nào xuất hiện trong 26.679 quỹ đạo. 124 trong số 587 tính năng ghi là mã chết (dead code).

Chi phí và chuyển đổi trình thực thi

Mức sử dụng token của MLE-bench thay đổi khoảng 19 lần. GPT-5.5 đạt tỷ lệ huy chương 19,1 với 29,3 triệu token trong khi DeepSeek V4 đạt 19,6 với 208,4 triệu token. Việc chuyển đổi trình thực thi sang Gemini đã làm thay đổi thứ hạng: Qwen tăng 17,6 điểm trên BrowseComp và 12,9 trên MLE-bench, trong khi điểm SWE-Pro của Opus 4.8 giảm từ 69,3 xuống 33,0, một phần do một khung tác vụ đã mã hóa cứng giới hạn 120 bước xung quanh trình thực thi ban đầu của nó. Tỷ lệ truy vấn trùng lặp của khung tác vụ tìm kiếm Opus đã tăng từ 10,1% lên 88,2% sau khi chuyển đổi.

Kết quả Tiến hóa

9 dòng dõi (5 tự chạy, 4 cố định Gemini) đã tạo ra 73 phiên bản chính thức và 64 lần chuyển đổi liền kề. Tất cả 5 người tạo tự chạy đều cải thiện trên các tác vụ ẩn, từ +1,43 đến +4,44 điểm (trung bình +3,11). Với Gemini cố định, chỉ có Opus cải thiện; GPT-5.5 giảm 10,32 điểm.

Sự tiến bộ không diễn ra đơn điệu. Trong số 64 lần chuyển đổi, 8 lần giảm điểm ở cả hai tiêu chuẩn, 16 lần giảm ở một tiêu chuẩn, 27 lần chỉ tăng trong phạm vi sai số và 2 lần cho thấy bằng chứng tích cực rõ ràng. Một lần commit duy nhất có thể thay đổi khoảng ±4,75 điểm số cặp. Phản hồi và điểm số ẩn chỉ di chuyển cùng hướng trong 34 trên 64 lần (53,1%) và chỉ 2 trong số 9 phiên bản cuối cùng được công bố là tối ưu trên tập ẩn. Trong số 169 hàm hoặc lớp mới, 25 hàm không có trình gọi.

Thành công rõ ràng nhất: Opus 4.8 nhận thấy 99 trên 100 lần chạy báo cáo thành công trong khi chỉ có 48 lần vượt qua, truy vết ra nguyên nhân là do hoàn thành sớm và đã thêm một cổng hoàn thành. Việc chẩn đoán lỗi là bước yếu nhất: giao diện quỹ đạo chuyên dụng chỉ được gọi hai lần.

Trình giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem Bài báo và Trang dự án. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và Đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC Trang Hugging Face HOẶC Bản phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.