Hacker News: AI bài nổi bật
85

Thủ thuật

Thực hư chuyện RTK giúp giảm chi phí lập trình AI: Bài học từ hóa đơn 1.500 USD

(giờ Việt Nam)

Tóm tắt AI

Quesma thử nghiệm RTK trên Terminal-Bench 2.1 với Claude Code và DeepSeek V4, kết quả cho thấy RTK không thực sự giúp tối ưu chi phí như kỳ vọng sau 1.740 lần chạy.

Bản dịch AI

RTK reports huge token savings, but our cost benchmarks disagree

RTK (Rust Token Killer) thực hiện lọc và nén đầu ra của terminal trước khi AI agent đọc nó. Với hơn 79 nghìn lượt sao trên GitHub hiện nay, RTK là một trong những công cụ phổ biến nhất giúp việc lập trình bằng AI trở nên rẻ hơn.

Một bài đăng trên X cho biết RTK có thể cắt giảm tới 60% số lượng token của Claude Code đã đạt 313 nghìn lượt xem.

Tuy nhiên, kết quả chạy SkillsBench của JetBrains lại cho thấy không có sự tiết kiệm nào. Trong tệp README có một tuyên bố miễn trừ trách nhiệm:

RTK cắt giảm tới 90% đầu ra bash mà agent của bạn đọc. […] điều này không đồng nghĩa với việc hóa đơn của bạn giảm 90%.

Vì vậy, “ít đầu ra terminal hơn” không có nghĩa là “lập trình bằng AI rẻ hơn”. Nó có thể hữu ích, không có tác dụng gì, hoặc phản tác dụng (khiến agent phải thực hiện nhiều lượt hơn hoặc chất lượng thấp hơn). Trong bài viết này, chúng tôi trình bày những phát hiện của mình sau vài ngày thử nghiệm và chi hơn 1.500 USD cho các token.

Cách thức hoạt động của RTK

RTK có thể viết lại các lệnh Git, test, package và file mà agent chạy thông qua công cụ shell của nó (Bash trong Claude Code, bash trong OpenCode). Mỗi lần viết lại sẽ trả về một phiên bản ngắn gọn hơn của cùng một đầu ra đó.

Ví dụ, RTK giữ lại tên tệp, kích thước và quyền truy cập (644 nghĩa là rw-r—r—), nhưng loại bỏ thông tin về chủ sở hữu và ngày tháng:

Kiểm thử RTK trên Terminal-Bench 2.1

RTK nén đầu ra terminal, vì vậy chúng tôi đã kiểm thử nó trên Terminal-Bench 2.1, một bộ benchmark có sự tương tác với terminal rất lớn. Chúng tôi vẫn sử dụng phiên bản 2.1 thay vì các phiên bản mới hơn là 3.0 và 4.0: các agent vượt qua hầu hết các tác vụ của 2.1, trong khi 3.0 và 4.0 vẫn là một thử thách. Chi phí chỉ quan trọng đối với các tác vụ vượt qua được.

Chúng tôi đã chạy Claude Code với Fable 5.0 và OpenCode với DeepSeek V4 Pro 0813 thông qua OpenRouter. Mỗi tác vụ được lên lịch chạy năm lần không có RTK và năm lần có RTK, trên cùng một lộ trình mô hình, nền tảng và thời gian chờ cụ thể cho tác vụ.

Sau khi loại bỏ bốn tác vụ bảo mật của Fable bị từ chối, so sánh cuối cùng bao gồm 85 tác vụ Fable và 89 tác vụ DeepSeek, tương đương với 1.740 lần thử.

Biểu đồ đầu tiên cho thấy kết quả đầy hứa hẹn

Với RTK, chi phí giảm 5% đối với Fable và tăng 5% đối với DeepSeek.

Claude Code · Fable 5.0

cơ sở (baseline) $731 (tỷ lệ vượt qua 84%)

RTK $698 (tỷ lệ vượt qua 83%)

OpenCode · DeepSeek V4 Pro 0813

cơ sở (baseline) $51 (tỷ lệ vượt qua 71%)

RTK $54 (tỷ lệ vượt qua 69%)

Các lần thử vượt qua Các lần thử khác

Tỷ lệ vượt qua thấp hơn khi sử dụng RTK: giảm 1% đối với Fable và 2% đối với DeepSeek. Cả hai khoảng cách về tỷ lệ vượt qua đều nhỏ.

Khi chúng tôi chia tổng chi phí, bao gồm cả các lần thử thất bại, cho số lần vượt qua, Fable rẻ hơn 3% với RTK, và DeepSeek đắt hơn 7%.

Một cách khác là tính trọng số ngang nhau cho mỗi tác vụ, vì một tác vụ đắt đỏ có thể làm lu mờ nhiều tác vụ rẻ tiền. Chúng tôi đã so sánh trung bình các lần thử cơ sở của mỗi tác vụ với trung bình các lần thử có RTK, sau đó tính trung bình các thay đổi đó.

Thay đổi chi phí RTK so với cơ sở

Thay đổi tổng hóa đơn Thay đổi trung bình mỗi tác vụ Khoảng tin cậy 95%

Theo thước đo cấp độ tác vụ này, Fable đắt hơn 1%, không có sự khác biệt rõ ràng so với mức không. Chi phí tác vụ của DeepSeek tăng trung bình 17%.

Việc tính đến các thất bại không làm thay đổi xu hướng. Trong số 36 tác vụ DeepSeek mà tất cả mười lần thử đều vượt qua, mức tăng vẫn là 18%.

Một tác vụ đã tạo ra sự khác biệt trong toàn bộ bộ benchmark

Hầu như tất cả số tiền tiết kiệm được của Fable với RTK đều đến từ một tác vụ: winning-avg-corewars. Cả hai thiết lập đều vượt qua mọi lần thử, nhưng với RTK, nó hoàn thành chỉ với khoảng một nửa số lượt. Đối với các tác vụ khác, mức tiết kiệm được là dưới 1%.

DeepSeek có kết quả ngược lại ở cùng tác vụ đó. Cả hai thiết lập đều vượt qua mọi lần thử, nhưng RTK tốn nhiều lượt hơn và chi phí cao hơn. Ngay cả khi không tính tác vụ đó, chi phí vẫn cao hơn khi có RTK.

rtk gain là một thước đo chi phí vô dụng

RTK ghi lại rtk gain là đầu ra lệnh thô trừ đi đầu ra đã lọc tính bằng byte, chia cho 4, chứ không phải là số lượng token bị tính phí.

Trong 445 lần thử DeepSeek với RTK, RTK báo cáo đã tiết kiệm được 349,2 triệu token, giảm 89%.

Việc báo cáo tiết kiệm được lượng lớn token không có nghĩa là các tác vụ rẻ hơn.

rtk gain Thay đổi chi phí tác vụ trung bình 0% chỉnh sửa văn bản quy mô lớn 57,3M −19% bẻ khóa hash 7z 38,9M +28% 87 tác vụ khác 253,0M +18%

Trong train-fasttext, mô hình đã yêu cầu head -1 train.txt hai lần. RTK ghi nhận tiết kiệm được 120,5 triệu token mỗi lần bằng cách so sánh các lần đọc giới hạn đó với toàn bộ tệp. Hai lệnh gọi đó chiếm 69% bộ đếm tiết kiệm của so sánh, mặc dù các lệnh được yêu cầu sẽ không bao giờ trả về toàn bộ tệp.

Coi rtk gain là số tiền tiết kiệm được đồng nghĩa với việc giả định phần còn lại của lần thử sẽ giữ nguyên. RTK có thể thay đổi các lượt tiếp theo của agent. rtk gain không tính đến chi phí của những lượt đó.

Đây là điểm mà các bài đăng trên mạng xã hội bị sai lệch: rtk gain đếm đầu ra đã bị loại bỏ, không phải số tiền tiết kiệm được, và nó có thể làm cho một lần thử đắt đỏ trông có vẻ đã được tối ưu hóa.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.