Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Khi AI 'học khôn': GPT-5.6 Sol gian lận để đạt điểm 94% trên Terminal Bench 2.1

(giờ Việt Nam)

Tóm tắt AI

Các nhà phát triển sử dụng tác nhân tự động chum-codex để tối ưu hóa quy trình lập trình, giúp đạt hiệu suất 89,9% trên Terminal Bench 2.1, vượt qua cả mô hình Codex gốc.

Bản dịch AI

Tóm tắt

Tôi đã thử tự động hóa quy trình phát triển (dev flow) của mình, đạt 94% trên Terminal Bench 2.1, rồi phát hiện ra GPT-5.6 Sol bắt đầu gian lận.

Bối cảnh

Tôi đã áp dụng quy trình phát triển "theo đặc tả" (spec-driven) trong khoảng một năm qua.

Nó khá đơn giản.

Trước khi yêu cầu một LLM thực hiện điều gì đó, tôi yêu cầu nó soạn thảo một tài liệu về những việc cần làm trước.

Tôi sử dụng chiến lược này cho việc phát triển tính năng, các dự án mới (greenfield projects), gỡ lỗi, và bất cứ thứ gì bạn có thể nghĩ tới.

Mô hình này hiệu quả với tôi, nhưng hơi lặp đi lặp lại.

Vì vậy, tôi quyết định tự động hóa nó.

chum-codex

Ý tưởng rất đơn giản: Tôi sẽ tạo ra một tác nhân giám sát (supervisor agent), vận hành "quy trình theo đặc tả" bằng cách ủy quyền cho các tác nhân phụ (worker subagents) thực hiện việc viết tài liệu, triển khai công việc, v.v.

Lưu ý: khi cố gắng thực hiện điều này với Codex hoặc Claude Code bản gốc, nó hoạt động ở mức độ nào đó, nhưng các câu lệnh (prompts) mặc định được thiết kế cho người dùng nhiều hơn là cho một "người giám sát".

Tôi giả định rằng tác nhân giám sát chỉ cần có khả năng đọc tệp và gọi các tác nhân phụ, vì đó là những gì tôi thường làm.

Thay vì xây dựng lại một bộ công cụ lập trình (coding harness) cho các tác nhân phụ, tôi đã xem xét Pi, OpenCode và App Server của Codex.

Tôi đã sử dụng Codex được một thời gian khá dài, nên tôi quyết định thử nghiệm với app-server. Các tùy chọn khác cũng rất thú vị, bạn nên thử xem qua.

Dù sao thì phiên bản đầu tiên cũng hoạt động khá tốt: tác nhân giám sát sẽ đánh giá quy mô nhiệm vụ, gọi một tác nhân phụ với yêu cầu thiết kế chẳng hạn, tác nhân phụ sẽ xuất ra một tài liệu, sau đó tác nhân giám sát yêu cầu tác nhân phụ chuyển tài liệu đó thành đặc tả triển khai (chia theo giai đoạn, nếu phù hợp), và cuối cùng yêu cầu tác nhân phụ thực hiện công việc đó.

Lưu ý: sơ đồ đơn giản hóa này lược bỏ các phần phản hồi của người dùng, ví dụ như đánh giá tài liệu thiết kế.

Tuyệt! Tôi đã tiết kiệm được chút thời gian trong quy trình phát triển của mình.

(hay là tôi đã làm vậy?)

Hố sâu ngăn cách

Tuyệt vời, nó đã hoạt động; dù còn chắp vá nhưng vẫn chạy được.

Lưu ý: đây là lúc tôi lẽ ra nên dừng lại.

Với tâm thế tự mãn, tôi nhìn bao quát tình hình và nghĩ "wow, mọi người nên thấy điều này!"

Cách tốt nhất để làm điều đó là gì? Các bài kiểm tra hiệu năng (benchmarks)!

Bài kiểm tra nào là tốt nhất để sử dụng? Không phải Terminal Bench!

Bài kiểm tra nào mà tôi đã đào quá sâu vào? Terminal Bench 2.1!

Terminal Bench

Nếu bạn không quen với các bài kiểm tra hiệu năng dành cho tác nhân (agentic benchmarks), thì cái tên Terminal Bench đã nói lên tất cả. Đó là một tập hợp các nhiệm vụ có thể thực hiện từ terminal, bao quát hàng loạt tác vụ đơn lẻ từ chơi cờ đến lắp ráp DNA.

Vì nó quá đơn giản, đây có lẽ là một trong những bài kiểm tra tệ nhất để đánh giá quy trình phát triển theo đặc tả.

Tuy nhiên, do tính chất đơn giản của nó, việc kiểm thử lại rất dễ dàng.

Tôi bắt đầu với một vài nhiệm vụ mà Codex bản gốc chạy cùng GPT-5.5 đã thất bại, chẳng hạn như lắp ráp/chèn DNA, trích xuất/xử lý video, trích xuất ELF và lắp ráp protein.

Nó đã hoạt động.

Những nhiệm vụ này được hưởng lợi từ một "lượt thiết kế" trước khi triển khai, vì tài liệu giúp tránh việc thu hẹp phạm vi và xác thực vòng lặp.

Sự tự mãn của tôi lại càng tăng thêm.

Lưu ý: Terminal Bench 1.x/2.x đã bão hòa, nhưng đó là câu chuyện của một ngày khác.

GPT-5.6?

Điểm chuẩn được công bố của GPT-5.5 là 83,8% (~74/89 nhiệm vụ, 5 lần chạy).

chum-codex đạt 89,9% hoặc khoảng 80/89 nhiệm vụ.

Hào hứng chia sẻ tin tức về việc đánh bại Codex, tôi đã chạy một vài bài kiểm tra Codex gốc chỉ để chắc chắn.

Để làm rõ bối cảnh: đây là ngày 25 tháng 6 năm 2026 và những tin đồn về việc GPT-5.6 sắp ra mắt đang lan truyền.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.