IT Home
92

Thủ thuật

Anthropic chia sẻ 6 mẹo tối ưu chi phí Claude Code: Tiết kiệm gấp 10 lần nhờ quản lý bộ nhớ đệm token

(giờ Việt Nam)

Tóm tắt AI

Anthropic hướng dẫn cách tối ưu hóa chi phí sử dụng Claude Code, giúp các lập trình viên giảm đáng kể hóa đơn hàng tháng từ mức trung bình 150-250 USD bằng cách quản lý bộ nhớ đệm token hiệu quả.

Bản dịch AI

Ngay lúc này, Anthropic vừa đăng tải một bài blog. Thông điệp cốt lõi là: Các bạn ơi, đừng lãng phí token một cách vô ích nữa, chúng tôi nhìn mà không đành lòng!

Vì vậy, phía Anthropic đã liệt kê chi tiết sáu bí kíp tiết kiệm chi phí, xin được chia sẻ ngay sau đây:

1. Dùng lệnh /clear sau khi hoàn thành tác vụ. Sau khi sửa xong một bug, hãy xóa sạch đoạn hội thoại hiện tại, đừng để các tệp tin và kết quả lệnh của tác vụ trước đó bị kéo sang tác vụ tiếp theo, gây chiếm dụng ngữ cảnh (context) một cách lãng phí.

2. Thiết lập mô hình và cường độ suy luận (effort level) ngay từ đầu. Nếu thay đổi giữa chừng, bộ nhớ đệm (cache) của các prompt đã tích lũy trước đó sẽ bị vô hiệu hóa hoàn toàn, và toàn bộ lịch sử hội thoại sẽ phải tính toán lại theo giá gốc.

3. Sử dụng @ để tham chiếu tệp tin thay vì gõ đường dẫn thủ công. Dùng @ để đính kèm trực tiếp tệp vào tin nhắn, Claude sẽ không cần tốn thêm một lần gọi công cụ (tool call) để đọc tệp. Nếu bạn chỉ gõ tên tệp, Claude có thể sẽ phải tìm kiếm một vòng rồi mở thử vài tệp, tất cả các thao tác này đều sẽ đi vào lịch sử hội thoại và theo bạn trong mọi lượt chat sau đó.

4. Thêm tham số im lặng (quiet flag) cho các lệnh có đầu ra lớn. Hãy viết một cấu hình như --reporter=dot trong file CLAUDE.md để kết quả kiểm thử chỉ in ra vài dòng tóm tắt thay vì hàng trăm dòng chi tiết. Đầu ra càng ngắn, ngữ cảnh bị chiếm dụng càng ít.

5. Sử dụng /compact trước khi nghỉ ngơi. Việc nén hội thoại khi nó vẫn còn trong bộ nhớ đệm chỉ tốn 1/10 chi phí bình thường. Nếu đợi đến khi bộ nhớ đệm hết hạn mới nén, bạn sẽ phải trả giá gốc để đọc lại toàn bộ rồi mới nén được.

6. Giao các tác vụ có đầu ra lớn cho các Agent phụ. Agent phụ chạy trong một cửa sổ ngữ cảnh độc lập, sau khi làm xong chỉ truyền kết quả về, các tệp tin đã đọc và kết quả lệnh chạy trong quá trình đó sẽ không đi vào hội thoại chính của bạn.

Tiền kiếp và hậu kiếp của một token

Khi làm việc với Claude Code, API được tính theo mức sử dụng, với các gói đăng ký hàng tháng chia làm ba mức từ 20 USD đến 200 USD.

Theo tính toán từ phía Anthropic, trung bình mỗi ngày một lập trình viên tiêu tốn 13 USD tiền token, chi phí hàng tháng dao động từ 150 đến 250 USD.

Đây mới chỉ là mức trung bình. Cùng một lỗi cần sửa, cách đặt câu hỏi khác nhau có thể khiến chi phí chênh lệch gấp nhiều lần.

Hơn nữa, mỗi lượt hội thoại đều kéo theo toàn bộ nội dung của các lượt trước đó để gửi lại, hội thoại càng dài thì mỗi lượt chat càng đắt đỏ.

Để biết số tiền này được chi vào đâu, cần phải bắt đầu từ logic tính phí của token.

Mỗi khi bạn nhập một chỉ lệnh vào Claude Code, có hai việc xảy ra phía sau.

Việc thứ nhất gọi là tiền điền (prefill), tức là mô hình đọc toàn bộ yêu cầu của bạn cùng một lúc, bao gồm system prompt, CLAUDE.md, tin nhắn của bạn và mọi thứ đã tích lũy trong hội thoại trước đó. Đây đều là các input token.

Việc thứ hai gọi là giải mã (decode), tức là quá trình mô hình viết ra từng chữ một, bao gồm suy nghĩ của nó, các lệnh gọi công cụ và văn bản bạn thấy cuối cùng. Đây đều là các output token.

Sự khác biệt mấu chốt nằm ở đây.

Tiền điền (prefill) được thực hiện song song, xử lý toàn bộ input token qua GPU trong một lần. Giải mã (decode) được thực hiện tuần tự, mỗi khi nhả ra một token đều phải chạy mô hình một lần. Một phản hồi 200 token đồng nghĩa với 200 lần tính toán độc lập.

Vì vậy, không khó để hiểu tại sao output token lại đắt gấp 5 lần input token.

Trên cơ sở đó, hóa đơn cuối cùng phụ thuộc vào hai yếu tố.

Thứ nhất là mô hình, quyết định đơn giá của mỗi token.

Opus 3.5, input 5 USD / triệu token, output 25 USD.

Sonnet 3.5, input 2 USD, output 10 USD.

Haiku 3.5, input 1 USD, output 5 USD.

Thứ hai là cường độ suy luận (effort level), quyết định số lượng token.

Phần lớn output token trong một phiên hội thoại là các token suy nghĩ (thinking tokens), và cường độ suy luận chính là thứ kiểm soát lượng này. Cường độ càng cao, mô hình suy nghĩ càng lâu, số lượng token suy nghĩ được tạo ra càng nhiều. Sự chênh lệch giữa mức max và low có thể lên tới vài lần.

Hãy linh hoạt sử dụng Sonnet, chỉ dùng Opus cho những bài toán khó. Dùng dao mổ trâu giết gà là cách tiêu tiền lãng phí nhất.

Bộ nhớ đệm prompt (Prompt caching) là công cụ tiết kiệm tiền hiệu quả nhất

Trong định giá token còn một biến số khổng lồ, đó chính là bộ nhớ đệm (cache).

Mỗi yêu cầu của Claude Code đều bắt đầu bằng cùng một tiền tố, đó là system prompt, định nghĩa công cụ, CLAUDE.md và lịch sử hội thoại.

Nếu tiền tố của yêu cầu lần này giống hệt từng byte với lần trước, máy chủ sẽ không tính toán lại mà tải trực tiếp kết quả tính toán của lần trước đó.

Việc đọc từ bộ nhớ đệm chỉ tốn 0,1 lần giá input thông thường, tiết kiệm trực tiếp 90%.

Ghi vào bộ nhớ đệm đắt hơn một chút, tối đa gấp 2 lần. Nhưng việc ghi chỉ xảy ra một lần, còn các lượt sau đó đều được hưởng mức giá đọc 0,1 lần.

Ví dụ như sau.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.