Thủ thuật
Từ tối đa hóa đến tối ưu hóa token: Doanh nghiệp bắt đầu 'thắt lưng buộc bụng' với AI
(giờ Việt Nam)
Tóm tắt AI
Các doanh nghiệp đang chuyển dịch từ việc tiêu tốn token sang tối ưu hóa chi phí vận hành AI. Sự thay đổi này cho thấy ứng dụng AI trong doanh nghiệp đã bước sang giai đoạn thực dụng và nhạy cảm hơn với ngân sách.
Bản dịch AI

Chỉ trong vòng sáu tháng, kỷ nguyên "Token Maxxing" (tối đa hóa sử dụng Token) đã kết thúc.

👩 Tác giả: Shirley
🥷 Biên tập: Koji
🧑🎨 Thiết kế: NCon

Vào tháng 3 năm nay, Token Maxxing bắt đầu bùng nổ. Một số công ty trở nên lo lắng đến mức sợ rằng các kỹ sư không sử dụng AI đủ nhiều, nên họ đã bắt đầu thiết lập các bảng xếp hạng nội bộ để đánh giá nhân viên dựa trên mức tiêu thụ Token.
Đến tháng 6, chính những công ty đó đã triển khai các hạn mức ngân sách, hạn ngạch linh hoạt và quy trình phê duyệt, chuyển hướng mạnh mẽ sang "Token Minimizing" (tối thiểu hóa sử dụng Token). Chỉ trong vài tháng, việc sử dụng Token mà không tạo ra ROI (tỷ suất hoàn vốn) đã trở thành một dấu hiệu cảnh báo đỏ trong các hệ thống tài chính.
Sự quay đầu đột ngột này đã xác nhận chính xác những gì Crossing đã thảo luận với Yusen Dai, đối tác quản lý tại ZhenFund, trong podcast đầu năm của chúng tôi — ông ấy đã định hình năm 2026 là "Năm của chữ R" (The Year of R), đặt Return (Lợi nhuận/Kết quả) lên hàng đầu. Các công ty bắt đầu yêu cầu phải có kết quả từ các khoản đầu tư vào AI của họ.

Tokenmaxxing: Khi mức tiêu thụ trở thành bằng chứng của việc "AI-native" (thuần thục AI)
Vào ngày 16 tháng 3, tại sự kiện GTC, NVIDIA đã mô tả các trung tâm dữ liệu là những "nhà máy AI" sản xuất Token. Ba ngày sau, Jensen Huang xuất hiện trên podcast All-In, mở rộng khái niệm kinh tế Token này đến chính các kỹ sư. Ông nói rằng ông sẽ cảm thấy rất bất an nếu một kỹ sư có mức lương 500.000 USD/năm tiêu thụ ít hơn 250.000 USD Token mỗi năm. Đối với ông, điều đó giống như một nhà thiết kế chip chỉ sử dụng giấy và bút chì trong khi phần mềm CAD vẫn nằm đó không được sử dụng.
Bên trong Meta, cuộc đua này đã có một bảng điểm thực thụ.
Một nhân viên Meta đã tự ý xây dựng "Claudeonomics", tổng hợp mức sử dụng từ 85.000 tài khoản nội bộ thành bảng xếp hạng Top 250. Bảng xếp hạng này không cho thấy mã nguồn có được triển khai hay sản phẩm có được ra mắt hay không — nó chỉ đơn giản trao các danh hiệu như "Token Legend", "Cache Wizard" và "Session Immortal" dựa trên khối lượng Token. Trang tính toán của The Information cho thấy nhân viên đứng đầu đã tiêu thụ 328,5 tỷ Token trong 30 ngày, tương đương khoảng 1,8 triệu USD theo giá các mô hình mặc định và giá công khai — gấp bảy lần mức chuẩn hàng năm mà Huang đã nêu.

Bảng xếp hạng đã biến việc áp dụng AI thành một màn kịch năng suất đầy phi lý.
Một nhân viên Microsoft chia sẻ với Pragmatic Engineer rằng họ đã để AI đọc lại các tài liệu hiện có và soạn thảo các bản mẫu (prototype) sẽ không bao giờ được phát hành, chỉ để tránh bị coi là "sử dụng quá ít". Salesforce đã đưa áp lực vô hình này ngay lên màn hình máy tính. Một widget trên Mac cập nhật chi tiêu Token cá nhân mỗi 15 phút, hiển thị các mục tiêu chi tiêu tối thiểu cho Claude Code và Cursor, đồng thời cho phép nhân viên kiểm tra xem đồng nghiệp đã chi bao nhiêu.
Những động lực tương tự cũng xuất hiện tại Trung Quốc. Tháng 3 này, các nhân viên đã tiết lộ trên Maimai rằng Tencent đã phân bổ nguồn lực Token hàng năm trị giá khoảng 220.000 nhân dân tệ cho mỗi nhân viên. Đến cuối tháng 3, một số đơn vị kinh doanh bắt đầu theo dõi và xếp hạng mức sử dụng Token. Lo sợ bị tụt hậu, nhân viên bắt đầu xây dựng các quy trình làm việc vô nghĩa, để các Agent chạy tác vụ lặp đi lặp lại, thậm chí nhận thêm các dự án phụ — tất cả chỉ để giữ cho con số của họ không bị giảm.

Token Minimizing: Hóa đơn lên ngôi
Trong khi các bảng xếp hạng khuyến khích tiêu thụ, một bảng tính khác trong hệ thống tài chính đã gióng lên hồi chuông cảnh báo.
SaaS truyền thống tính phí theo đầu người (per seat), khiến ngân sách tương đương với số lượng nhân sự nhân với đơn giá. Các Agent đã biến chi phí cấp phép tương đối cố định này thành chi tiêu dựa trên mức sử dụng đầy biến động: một tác vụ đơn lẻ có thể kích hoạt nhiều lệnh gọi mô hình, mang theo ngữ cảnh ngày càng lớn và xoay vòng qua các bước lập kế hoạch, tạo lập, kiểm tra và viết lại. Hóa đơn giờ đây dao động theo độ phức tạp của tác vụ, lựa chọn mô hình, độ dài ngữ cảnh và tần suất thử lại — không còn chỉ gắn liền với số lượng nhân sự nữa.
Từ chi tiêu quá mức đến các hạn mức
Vào giữa tháng 4, CTO của Uber, Praveen Neppalli Naga, đã công khai tiết lộ rằng công ty đã tiêu hết ngân sách AI cả năm chỉ trong bốn tháng, với một số người dùng nặng tay tạo ra hóa đơn AI lên tới 2.000 USD mỗi tháng.
Một tháng sau, COO của Uber, Andrew Macdonald, thừa nhận trên podcast Rapid Response rằng khoảng 25% số lần commit mã nguồn của Uber trong quý trước đến từ Claude Code, nhưng điều đó không có nghĩa là có thêm 25% tính năng hữu ích cho người dùng được ra mắt. Ông nói thêm rằng sản lượng có thể đã tăng, mặc dù mối liên hệ đó vẫn chưa được xác lập. Khi ông hỏi các lãnh đạo kỹ thuật cấp cao rằng có bao nhiêu dự án từng bị gác lại đã được đưa vào phát triển nhờ vào việc tăng năng suất, họ không thể trả lời.
Vào ngày 2 tháng 6, Uber đã đạp phanh do cạn kiệt ngân sách, đặt ra hạn mức hàng tháng là 1.500 USD mỗi người cho mỗi công cụ AI như Claude Code và Cursor.
Từ kỹ thuật đến toàn công ty
Hai ngày sau, sự thay đổi này xuất hiện bên ngoài lĩnh vực công nghệ.
Gã khổng lồ bán lẻ Walmart đã thay đổi công cụ AI nội bộ Code Puppy từ sử dụng không giới hạn sang hạn ngạch Token cố định. Theo Business Insider, công cụ này cho phép nhân viên phát triển phần mềm thông qua ngôn ngữ tự nhiên. Trong năm qua, số lượng người dùng đã tăng từ khoảng 1.000 lên 75.000 — bộ phận thu mua, chuỗi cung ứng, quản lý cửa hàng và thậm chí cả nhân viên bán thời gian theo giờ cũng đang sử dụng nó, với số lượng người dùng không phải kỹ sư hiện đã ngang bằng với kỹ sư. Quản trị Token đã chuyển từ ngân sách kỹ thuật phần mềm sang hoạt động hàng ngày của một doanh nghiệp khổng lồ.
Cú sốc hóa đơn có thể xảy ra ngay cả khi mức sử dụng không tăng. Cũng trong tháng 6, startup dịch vụ khách hàng B2B Pylon đã vượt ngưỡng 150 chỗ ngồi của Anthropic Team và cần chuyển sang gói Enterprise, với Token được tính phí riêng theo giá API tiêu chuẩn. CEO Marty Kausas cho biết điều này sẽ khiến hóa đơn hàng năm của họ cho Anthropic tăng vọt từ 400.000 USD lên 1,4 triệu USD — mức tăng gấp 3,5 lần chỉ sau một đêm. Pylon sau đó yêu cầu các nhóm dịch vụ khách hàng phải được phê duyệt mới được sử dụng thêm Token. Ông cảm thấy việc kỹ thuật sử dụng các mô hình mạnh nhất là "rõ ràng xứng đáng", nhưng lợi nhuận đối với các vai trò khác thì không rõ ràng:
"Mọi người xây dựng các ứng dụng không ai dùng, phát triển lại các kỹ năng mà người khác đã làm rồi — không có ROI thực tế nào cả."
Các gã khổng lồ công nghệ Trung Quốc cũng điều chỉnh theo hướng tương tự. Theo The Economic Observer, vào tháng 6, nhân viên Tencent tại nhiều mảng kinh doanh đã bị cắt giảm hạn ngạch Token. Các thành viên nhóm mô hình lớn Hunyuan nhận được khoảng 7.000 nhân dân tệ mỗi tháng, YouTu Lab khoảng 5.250 nhân dân tệ, và một nhân viên thuê ngoài của Tencent Entertainment tiết lộ hạn ngạch hàng tháng của họ chỉ là 1.000 nhân dân tệ. Hạn ngạch được đưa vào các quỹ chung của bộ phận trước, sau đó các quản lý phân bổ linh hoạt dựa trên nhu cầu kinh doanh, với việc nhân viên có thể "giơ tay" để yêu cầu thêm.
Sau khi bị cắt giảm, một nhân viên nói đùa: "Trước đây, việc duy nhất tôi làm mỗi ngày ở công ty là bắt Workbuddy làm việc cật lực; giờ thì tôi lo lắng kiểm tra bảng điều khiển Token mỗi ngày, sợ làm nó cạn kiệt". Một người khác than thở: "Từ xa hoa sang tiết kiệm thật khó — tôi không thể quay lại cách lập trình kiểu cũ nữa"...
Các hạn mức có thể ngăn chặn hóa đơn, nhưng không thể trả lời câu hỏi tiền nên được chi vào đâu. Các công ty cần truy vết hóa đơn đó xa hơn, đến tận các tác vụ và kết quả bàn giao.
Token ROI: Cách các công ty đo lường lợi nhuận từ AI
Vào tháng 7, Business Insider trích dẫn báo cáo của một nhà phân tích UBS: trong các cuộc trò chuyện gần đây với hàng chục giám đốc CNTT doanh nghiệp, khoảng 60% các công ty được khảo sát đã thực hiện các mức độ kiểm soát khác nhau để thắt chặt chi tiêu AI. Nhà phân tích mô tả đây là một "vấn đề lành mạnh" — các công ty không dừng triển khai AI, và việc tối ưu hóa Token đang chuyển từ một biện pháp phản ứng sau khi vượt ngân sách thành một kỷ luật kỹ thuật bền vững.
Lý tưởng nhất, công thức sẽ là: Token ROI = mức tăng trưởng kinh doanh có thể xác minh ÷ (chi phí mô hình + đánh giá của con người + thử lại/làm lại + chi phí quản trị kỹ thuật). Nhưng cho đến nay, chưa có tiêu chuẩn nào được áp dụng trên nhiều công ty trong thực tế công khai. Tử số phụ thuộc vào các chỉ số kinh doanh của từng công ty, khiến các thuật toán thống nhất trở nên khó khăn, mặc dù một số công ty đang thúc đẩy theo hướng này; mẫu số thì dễ xử lý hơn, và hầu hết các công ty đều bắt đầu từ đây, hạch toán ở cấp độ tác vụ và quy trình làm việc.
Trước tiên, hãy nhìn vào chi tiêu: ai và tác vụ gì
Một số công ty đang tự xây dựng cơ chế hạch toán riêng; các nhà cung cấp cũng đang thương mại hóa các khả năng tương tự.
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.