QbitAI
92

Tin ngành

Cơn ác mộng chi phí của các ứng dụng AI trăm triệu người dùng: Cắt giảm 75% chi phí GPU nhờ kiến trúc đa đám mây

(giờ Việt Nam)

Tóm tắt AI

Các ứng dụng AI đang đối mặt với nghịch lý chi phí suy luận đắt đỏ. Giải pháp kiến trúc đa đám mây (multi-cloud) đang trở thành chìa khóa giúp các doanh nghiệp tối ưu hóa hạ tầng và cắt giảm tới 75% chi phí vận hành GPU.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

04/08/2026 09:27:41 Nguồn: QbitAI

AI vươn ra toàn cầu đang bị "xiềng xích điện toán ba tầng" bóp nghẹt

Đạt hơn 100 triệu DAU (người dùng hoạt động hàng ngày) lẽ ra phải là khoảnh khắc vinh quang để tất cả các nhà phát triển ứng dụng mở sâm panh ăn mừng.

Nhìn vào danh sách các ứng dụng tỷ người dùng trên toàn cầu — WeChat, TikTok, Instagram — đại đa số các sản phẩm khác chỉ có thể đứng từ xa ngưỡng mộ.

Hiện nay, một ứng dụng "AI phối đồ + gợi ý mua sắm" vươn ra thị trường quốc tế đã thực sự lọt vào câu lạc bộ đẳng cấp này. Người dùng chỉ cần tải lên một bức ảnh selfie, AI sẽ ngay lập tức tạo ra các hình ảnh tổng hợp bối cảnh đời thực sống động trên màn hình khóa điện thoại và dẫn dắt mua sắm một cách chính xác.

img

Thế nhưng, khi mở sổ sách kế toán ra, người sáng lập và CTO lại chẳng thể nào vui nổi.

Bởi lẽ, quy mô người dùng tăng trưởng thần tốc không hề mang lại nguồn thu dồi dào, mà ngược lại, nó đã biến thành một "cỗ máy nghiền tiền" không đáy.

Đội ngũ đã thực hiện một phép tính chi tiết đầy nghiệt ngã: Tại các thị trường mới nổi, khi chia đều doanh thu từ quảng cáo và kiếm tiền cho mỗi người dùng, ARPU (doanh thu trung bình trên mỗi người dùng) thu về chỉ vỏn vẹn 2 USD.

Vậy, chi phí điện toán đám mây và truyền tải dữ liệu cho mỗi người là bao nhiêu? Câu trả lời là: 3 USD.

Điều này đồng nghĩa với việc cứ mỗi người dùng hoạt động có được và giữ chân được, công ty lại phải bù lỗ ròng 1 USD!

Nói cách khác, người dùng càng đông, màn hình khóa càng được làm mới thường xuyên, thì dòng tiền của công ty càng chảy máu nhanh. Cái vòng lẩn quẩn "càng chạy càng lỗ" này đã đẩy đội ngũ đến bờ vực sinh tồn về mặt thương mại.

Khi mọi người đều đang điên cuồng chạy đua với các mô hình ngôn ngữ lớn (LLM), thì cơ sở hạ tầng đám mây nền tảng rốt cuộc đã kéo một ứng dụng trăm triệu người dùng vào cái bẫy tử thần như thế nào?

AI vươn ra toàn cầu đang bị "xiềng xích điện toán ba tầng" bóp nghẹt

Để hiểu rõ số tiền này đã bị đốt như thế nào, chúng ta cần phân tích mô hình vận hành trên đám mây trước đây của ứng dụng này.

Trước đó, họ đã thuê dịch vụ GPU của một trong hai "gã khổng lồ" đám mây hàng đầu thế giới để triển khai các mô hình mã nguồn mở nhằm tạo ảnh. Chip điện toán được cấu hình lúc bấy giờ là NVIDIA L4 GPU.

"Tiền thuê điện toán" đắt đỏ và lãng phí do chạy không tải

Bảng giá của các ông lớn cho thấy, tùy theo cấu hình, giá thuê instance L4 dao động từ 0,7 USD đến 8 USD mỗi giờ. Tuy nhiên, kết quả đo đạc thực tế cho thấy, để tạo một bức ảnh AI độ phân giải cao bằng L4, thời gian tiêu tốn mất đúng 12 giây.

Tính theo mức giá cực rẻ là 0,7 USD/giờ, chi phí điện toán thuần túy để tạo một bức ảnh là 0,0023 USD.

Cơ chế của ứng dụng này là tự động cập nhật màn hình khóa ở chế độ nền, sau khi người dùng tải ảnh selfie lên, hệ thống tạo ra khoảng 3 lượt suy luận (inference) tương đương mỗi ngày. Tính ra, chỉ riêng "tiền thuê card" cho mỗi người dùng mỗi năm đã đốt khoảng 2,55 USD.

Điều chí mạng hơn chính là "chi phí chạy không tải" (idle cost). Con số 2,55 USD chỉ đúng khi GPU phải hoạt động hết công suất 24/7. Chỉ cần doanh nghiệp có lúc cao điểm, lúc thấp điểm, GPU tồn tại trạng thái nhàn rỗi, thì chi phí thực tế phân bổ cho mỗi bức ảnh sẽ dễ dàng vượt ngưỡng 3 USD.

"Thuế lưu lượng giá trên trời" ẩn sau sổ sách

Điện toán đắt đỏ đã đành, một nhát dao chí mạng khác nằm ở phí lưu lượng xuất (Egress Fee).

Báo giá của các nhà cung cấp đám mây truyền thống thường chỉ bao gồm card đồ họa và CPU. Nhưng hình ảnh được tạo ra cần truyền tải đến điện thoại của người dùng ở nước ngoài, lưu lượng truy cập phải được tính phí riêng.

Một bức ảnh vài MB trông có vẻ không đáng kể, nhưng khi nhân với quy mô hàng trăm triệu người dùng hoạt động hàng ngày, lưu lượng xuất xuyên biên giới trực tiếp trở thành một con số thiên văn. Một người phụ trách AI vươn ra toàn cầu từng than thở: "Trên đám mây của các ông lớn truyền thống, trong ngành thường nói 'chi 10.000 cho điện toán thì mất 5.000 cho lưu lượng'."

"Bức tường tốc độ ánh sáng" vật lý và sự hao hụt điện toán

Ngoài ra còn có độ trễ mạng không thể tránh khỏi.

Nhiều ứng dụng vươn ra toàn cầu triển khai dịch vụ tại một vài trung tâm dữ liệu tập trung, trong khi người dùng lại phân bổ khắp thế giới. Truyền tải cáp quang tồn tại giới hạn vật lý, độ trễ khứ hồi xuyên quốc gia thường xuyên lên tới hàng trăm mili giây.

Kiểm tra thực tế trong ngành cho thấy: chỉ vì độ trễ mạng khứ hồi 14ms, hiệu suất sử dụng GPU đã giảm trực tiếp 30% (dẫn đến 30% công suất điện toán bị lãng phí do chạy không tải). Điện toán đắt, lưu lượng tăng vọt, độ trễ lại khiến card đồ họa chạy không tải — ba gánh nặng chồng chất khiến đội ngũ AI vươn ra toàn cầu hoàn toàn kiệt quệ.

Thay đổi giải pháp GPU, "thay thế ngang hàng" hóa đơn đắt đỏ

Đối mặt với tình thế tuyệt vọng "càng chạy càng lỗ", doanh nghiệp này không ngồi chờ chết. Sau khi đánh giá nhiều nhà cung cấp dịch vụ đám mây trên toàn cầu, họ đã đưa ra một quyết định táo bạo: chuyển sang Akamai Inference Cloud và tái cấu trúc lựa chọn GPU sang NVIDIA RTX PRO 6000.

Đây không phải là một chiếc card huấn luyện flagship theo nghĩa truyền thống, nhưng đối với suy luận AI, nó lại là vũ khí "giáng đòn hạ cấp" (downward strike) tuyệt vời.

img

Sau khi chuyển sang RTX PRO 6000, nhờ kiến trúc tiên tiến hơn và bộ nhớ đồ họa siêu lớn 96GB (xử lý hoàn hảo các mô hình lớn và KV Cache đồng thời cao), thời gian tạo ảnh đã được rút ngắn từ 12 giây xuống còn 3-5 giây.

Thời gian điện toán bị cắt giảm hơn một nửa, quy mô cụm máy chủ cần thiết thậm chí giảm trực tiếp 75%. Mặc dù giá thuê mỗi giờ của RTX PRO 6000 cao hơn L4, nhưng nhờ tốc độ tạo ảnh nhanh gấp 4 lần và tổng số card cần thiết giảm 3/4, tổng chi phí suy luận cuối cùng phân bổ cho mỗi bức ảnh lại rẻ hơn nhiều so với L4.

Tại sao không dùng trực tiếp card huấn luyện cấu hình cao nhất H100?

Có người có thể hỏi: Tại sao không dùng H100 cao cấp hơn?

Câu trả lời nằm ở định dạng lượng tử hóa. Kiến trúc H100 không hỗ trợ độ chính xác FP4 gốc, thấp nhất chỉ đến FP8. Trong khi đó, RTX PRO 6000 hỗ trợ gốc FP4, có thể cắt giảm một nửa nhu cầu bộ nhớ đồ họa mà gần như không làm mất đi độ chính xác của mô hình.

Trong phân khúc chuyên về suy luận, thông lượng suy luận của RTX PRO 6000 có thể đạt tới 1,63 lần so với H100, trong khi chi phí tổng thể lại rẻ hơn H100 tới 14%.

AIHạ tầng AIGPUChi phí AICloud Computing
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.