Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Nghiên cứu cách tiết kiệm token, tôi lỡ tay 'đốt' sạch toàn bộ ngân sách

(giờ Việt Nam)

Tóm tắt AI

Một lập trình viên đã tiêu sạch hạn mức sử dụng gói Claude Max 5x chỉ trong 30 phút khi đang thực hiện nghiên cứu về kinh tế học token cho AI agent.

Bản dịch AI

I burned all my tokens researching how to save tokens

Trên trang chủ Hacker News ngày 19 tháng 7 năm 2026

Tại Quesma, chúng tôi đang nghiên cứu về kinh tế học của các AI agent: chi phí thực sự của việc lập trình bằng agent là bao nhiêu và bạn có thể làm gì với nó. Cho nghiên cứu này, tôi đang vận hành một thiết lập nghiên cứu chuyên sâu (deep research) của riêng mình, một quy trình gồm các agent xây dựng nên một cơ sở tri thức mà tôi thực sự có thể tin tưởng. Phiên bản đầu tiên của thiết lập này đã tiêu tốn toàn bộ hạn mức gói Claude Max 5x của tôi chỉ trong 30 phút. Bài viết này là câu chuyện về cách tôi khắc phục vấn đề chi phí và độ tin cậy, chỉ bằng cách sử dụng các gói đăng ký mà tôi đã trả phí, và cách bạn có thể xây dựng một hệ thống tương tự.

Mục tiêu của tôi là hiểu rõ toàn bộ trạng thái của cái gọi là tokenomics (kinh tế học token). Tôi muốn biết những hệ thống giám sát nào đang tồn tại, các đội ngũ quản lý chi tiêu cho AI của họ ra sao, và những công cụ cũng như phương pháp tối ưu hóa nào thực sự hiệu quả, cả trong các bài báo nghiên cứu lẫn trong thực tế.

Tôi bắt đầu theo cách thông thường với /deep-research. Tôi đưa cho nó câu hỏi mở lớn và để nó chạy. Sau khoảng 30 phút nghiên cứu, tôi chạm ngưỡng giới hạn và phải đợi vài giờ để nó thiết lập lại. Và tôi chẳng có kết quả nào cả. Quá trình này đã khởi chạy 111 agent và xếp hàng 123 tuyên bố cần xác minh, nhưng chỉ có 25 cái được xác minh trước khi chạm ngưỡng giới hạn, và quá trình tổng hợp cuối cùng không bao giờ được thực hiện.

Vì vậy, nó tác động trực tiếp đến tôi. Và điều này khá buồn cười: ngay từ ngày đầu tiên, tôi đã phải tối ưu hóa token trong khi vẫn đang tìm cách để tối ưu hóa token. Học thông qua thực hành.

Sử dụng mọi gói đăng ký mà tôi đã trả phí

Nếu Claude Fable 5 hết hạn sau 30 phút và /deep-research tiêu tốn quá nhiều token mà không mang lại kết quả, tôi có thể làm gì để nghiên cứu hiệu quả hơn? Tôi bắt đầu nghĩ về những loại công cụ mình đã có và đang trả phí. Claude, Codex và Antigravity: 3 gói đăng ký, và về lý thuyết là có lượng token gấp 3 lần mà không phải trả thêm bất kỳ chi phí nào. Điều gì sẽ xảy ra nếu tôi sử dụng tất cả các công cụ này cùng nhau, với bộ nhớ dùng chung?

Vì tôi đã sử dụng plugin claude-mem, tôi đã mở rộng nó để hỗ trợ Codex và Antigravity cục bộ, để cả 3 công cụ có thể sử dụng bộ nhớ dùng chung trong các phiên làm việc. Bất cứ điều gì một công cụ học được, các công cụ khác đều có thể sử dụng.

Các mô hình rẻ hơn đóng vai trò là subagent (agent phụ)

Thiết lập mặc định của tôi là Claude Code, vì vậy tôi đã sử dụng nó làm khung điều phối chính. Trong khi thực hiện nghiên cứu thủ công, tôi đã khám phá ra một mô hình điều phối mô hình (model-orchestration pattern), đó chính xác là thứ tôi cần vào lúc đó. Chúng ta không thực sự cần Fable cho mọi thứ: Claude Opus 4.8, Claude Sonnet 5, GPT-5.5 và Gemini 3.1 Pro đã là những mô hình xuất sắc cho nhiều tác vụ.

Claude Code đóng vai trò là khung điều phối: các agent Claude gốc, Codex và Antigravity đóng vai trò là các subagent không giao diện (headless), tất cả đều chia sẻ claude-mem.

Vì vậy, tôi đã kiểm tra một vài điểm chuẩn (benchmark) và phân tích chi phí, chủ yếu là Terminal-Bench cho công việc trên terminal và agent, SWE-bench Pro cho kỹ thuật phần mềm đầu cuối, và Artificial Analysis để có cái nhìn tổng quan về hiệu suất và giá cả. Tôi không coi bất kỳ cái nào trong số đó là chân lý cuối cùng; các điểm chuẩn tự đo lường những thứ riêng của chúng và các con số thay đổi hàng tháng. Tôi chỉ cần một điểm khởi đầu tương đối để biết ai giỏi việc gì, và việc sử dụng nhiều mô hình khác nhau là một phần của thử nghiệm ngay từ đầu; dù sao thì tôi cũng dự định điều chỉnh tỷ lệ sau khi chạy thực tế:

Tỷ lệ này không phải là phiên bản đầu tiên của tôi; tôi đã điều chỉnh nó vài lần khi các lần chạy trực tiếp cho thấy những điểm yếu, và các quy tắc dự phòng (fallback rules) xuất phát từ chính những thất bại đó.

Điều tuyệt vời nhất ở đây là tôi đã chuẩn bị để Codex và Antigravity được sử dụng như các subagent của Claude, được điều phối bởi Fable, tận dụng tính chất headless của cả hai. Tại sao nó lại hay? Bởi vì token được lấy từ các gói đăng ký Codex và Antigravity, nên tôi không phải trả thêm tiền, nhưng tôi ngay lập tức có nhiều trí tuệ hơn để sử dụng.

Toàn bộ thủ thuật nằm ở một tập lệnh Bash nhỏ mà các agent Claude của tôi có thể gọi như bất kỳ lệnh nào khác:

Trình bao bọc (wrapper) cũng theo dõi đầu ra để tìm các thông báo “usage limit” (giới hạn sử dụng) và “out of credits” (hết tín dụng) và trả về một mã thoát đặc biệt, và đây chính xác là cách hoạt động của cơ chế tự động chuyển sang các mô hình Claude: trình điều phối thấy tín hiệu và thực hiện công việc với một agent Claude thay thế.

Một điều nữa thực sự quan trọng là phải ghim mô hình theo vai trò, vì các subagent mặc định kế thừa mô hình của cha mẹ chúng, và đó chính xác là cách tôi đã đốt cháy hạn mức Fable của mình trong 30 phút.

Với kỹ thuật này, tôi đã có thể chạy nghiên cứu liên tục lâu hơn khoảng 10 lần so với ban đầu khi chỉ dùng Fable, được đo đơn giản bằng thời gian tôi có thể giữ cho các agent hoạt động trước khi bất kỳ gói đăng ký nào trong số 3 gói chạm ngưỡng giới hạn. Trước đây là 30 phút nghiên cứu, giờ là vài giờ mà không phải trả thêm một xu nào. Và khi Codex hoặc Antigravity chạm ngưỡng giới hạn của riêng chúng, khung làm việc sẽ đơn giản chuyển sang các mô hình Claude, vì vậy nghiên cứu không bị dừng lại.

Giảm thiểu ảo giác (hallucinations)

Chi phí chỉ là vấn đề đầu tiên, vấn đề thứ hai là sự tin tưởng. Trước khung nghiên cứu của tôi, khi mọi thứ được thực hiện bởi Fable, đôi khi tôi nhận được những kết quả trông có vẻ chắc chắn nhưng lại không đúng. Ví dụ, một giấy phép sai trên repo, một con số tiết kiệm không có nguồn, hoặc một con số không có trên trang được trích dẫn. Để giảm thiểu ảo giác, tôi đã triển khai các quy tắc rõ ràng trong khung nghiên cứu mà mọi kết quả tìm thấy phải vượt qua trước khi có thể được chia sẻ. Một vài trong số đó:

Danh sách này không được thiết kế ngay từ đầu. Nó phát triển trong quá trình nghiên cứu, bởi vì mỗi khi việc xác minh phát hiện ra một loại lỗi mới, quy tắc đó lại được đưa vào các prompt. Và một khung làm việc như vậy chỉ thực sự hiệu quả nếu bạn liên tục tinh chỉnh nó, vì vậy hãy xem xét các kết quả, gắn cờ những cái vô dụng và phản hồi lại.

/deep-research được thực hiện cuối cùng

Với chi phí và độ tin cậy đã được xử lý, mảnh ghép cuối cùng là công cụ /deep-research đã bắt đầu toàn bộ câu chuyện này. Nó vẫn nằm trong quy trình, nhưng là bước cuối cùng, không phải bước đầu tiên. Vào cuối mỗi ngày, tôi chạy nó trên những kết quả đã vượt qua xác minh, vì vậy thay vì nghiên cứu một cách mù quáng, nó đi qua các kết quả hiện có, đào sâu chúng, loại bỏ sự lộn xộn và cố gắng lấp đầy những khoảng trống mà khung làm việc đã bỏ lỡ. Nó cũng sử dụng ít token hơn theo cách này, vì nó làm việc thông qua một danh sách các tuyên bố cố định thay vì khám phá internet. Lần chạy cuối cùng sử dụng 61 agent và mất 22 phút. Hãy so sánh điều đó với ngày đầu tiên, khi 111 agent đốt cháy toàn bộ hạn mức trong khoảng 30 phút mà không bao giờ tạo ra báo cáo. Cùng một công cụ, chỉ là một công việc nhỏ hơn nhiều.

Quy trình trong một hình ảnh: tìm kiếm, xác minh, đánh giá, chạy công cụ, xác thực chuyên sâu, sau đó đưa vào wiki.

Kết quả: một cơ sở tri thức mà tôi có thể tin tưởng

Mọi thứ vượt qua xác minh đều được đưa vào một LLM wiki mà tôi lưu trong Obsidian, lấy cảm hứng từ mô hình LLM wiki của Karpathy: các ghi chú nguyên tử được liên kết, các agent thực hiện quét, và tôi thiết lập các quy tắc. Sau một tuần, nó chứa hàng trăm ghi chú đã được xác thực về giá cả, công cụ, điểm chuẩn và phương pháp thực hành.

Hàng trăm ghi chú về giá cả, công cụ và điểm chuẩn cho đến nay.

Các kiểm tra tự động không đủ nếu đứng một mình. Có lần, quy tắc phân loại của tôi đã âm thầm từ chối Headroom, một dự án 56k sao và là một trong những dự án lớn nhất trong danh mục của nó. Các agent đã làm mọi thứ đúng, xác minh xác nhận dự án là hợp pháp, và kiểm tra tuyên bố đã gắn cờ chính xác rằng các con số tiết kiệm tiêu đề của nó không được kiểm soát chất lượng. Nhưng quy tắc của tôi nói “tuyên bố chưa được xác thực nghĩa là không có mục nhập”, vì vậy một dự án mà một nửa ngành công nghiệp sử dụng đã trở nên vô hình trong cơ sở tri thức của tôi. Tôi chỉ nhận ra 2 ngày sau đó, khi tôi hỏi “làm thế nào chúng ta bỏ lỡ điều này?”. Giải pháp là một quy tắc mới: từ chối tuyên bố, không phải dự án. Các agent có thể thực hiện tìm kiếm và kiểm tra, nhưng không agent nào sẽ nói với bạn rằng quy tắc của chính bạn mới là lỗi.

Nếu bạn muốn xây dựng một cơ sở tri thức chất lượng, việc xác minh của con người và bổ sung nghiên cứu là bắt buộc. Nghiên cứu chỉ bằng AI có thể có chất lượng rất kém. Nghiên cứu chỉ bằng con người thì quá chậm. Cách tốt nhất là kết hợp: các agent thực hiện công việc nghiên cứu nặng nhọc, nhưng chúng chạy trên một quy trình được tạo ra và cải thiện liên tục bởi con người. Con người cũng xác minh kết quả và lấp đầy các khoảng trống.

Một vài kết quả từ cơ sở tri thức

Chủ đề kinh tế học token hóa ra lớn hơn nhiều so với tôi mong đợi. Đây là một mẫu nhỏ về những gì đã có bên trong, những kết quả làm tôi ngạc nhiên nhất:

Khung làm việc của chúng tôi gắn thẻ hầu hết các mục này là độ tin cậy trung bình, thường là 1 hoặc 2 nguồn đáng tin cậy, và chúng tôi giữ cho điều đó hiển thị thay vì giả vờ rằng nó đã được giải quyết.

Trước khi bạn đốt cháy hạn mức tiếp theo

Nếu bạn đang đốt cháy hạn mức cho nghiên cứu chuyên sâu ngày hôm nay, hãy thử đảo ngược thứ tự. Các mô hình rẻ tiền tìm kiếm, các mô hình chính xác xác minh, và nghiên cứu chuyên sâu được thực hiện cuối cùng. Và hãy kiểm tra xem bạn đã trả phí cho bao nhiêu trí tuệ. Một vài gói đăng ký với vai trò rõ ràng cho mỗi mô hình mang lại cho bạn nhiều hơn một mô hình tiên phong được sử dụng một cách mù quáng.

Và nếu bạn đang xây dựng quy trình nghiên cứu của riêng mình, hoặc hóa đơn AI của bạn tăng nhanh hơn mức sử dụng, chúng tôi thực sự muốn nghe ý kiến từ bạn. Hãy tham gia thảo luận trên Hacker News hoặc LinkedIn.

Hãy đón chờ các bài viết và bản phát hành trong tương lai.

AIClaudeLập trìnhKinh nghiệmToken
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.