# Chi phí hiệu năng AI giảm kỷ lục: Mỗi năm rẻ đi 13 lần, hiệu suất thuật toán tăng gấp 3

- Nguồn: The Decoder: AI News
- Thời gian phát hành: 2026-09-24 23:00 (giờ Việt Nam)
- Điểm AI: 66/100
- Link AIHOT.vn: https://aihot.vn/items/69cdd1f1fc55ce07
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmufqz0oq05a4roxz6kn47orj
- Link gốc: https://the-decoder.com/ai-performance-costs-are-falling-faster-than-those-of-any-previous-technology

## Tóm tắt AI

Nghiên cứu từ Epoch AI cho thấy chi phí để đạt cùng một mức hiệu năng AI giảm trung bình 47% mỗi quý. Đặc biệt, các mô hình như GPT-5.6 dự kiến sẽ đạt hiệu suất vượt trội với chi phí thấp hơn gấp nhiều lần so với các thế hệ tiền nhiệm.

## Thân bài

![AI performance costs are falling faster than those of any previous technology](https://the-decoder.com/wp-content/uploads/2026/09/epoch_ai_plunging_price.png)

Chi phí để đạt được một mức hiệu suất cố định trên các bài kiểm tra đánh giá (benchmark) AI chọn lọc đã giảm mạnh kể từ năm 2023.

Epoch AI, một tổ chức nghiên cứu theo dõi các xu hướng AI, cho biết chi phí đang giảm trung bình khoảng 47% mỗi quý, tương đương khoảng 13 lần mỗi năm. Nhóm này cho biết chưa có công nghệ mang tính chuyển đổi nào khác giảm nhanh đến vậy. Tuy nhiên, con số này phản ánh giá thị trường cho một điểm số benchmark cố định, chứ không phải sự tiến bộ thuần túy về thuật toán hay kiến trúc, hoặc thậm chí là chi phí năng suất trong thực tế, [vốn là một câu chuyện hoàn toàn khác](https://the-decoder.com/frontier-radar-2-why-ai-productivity-gets-lost-between-benchmarks-and-the-balance-sheet/).

Các nhà nghiên cứu tại MIT khi xem xét [dữ liệu tương đương](https://arxiv.org/abs/2511.23455) nhận thấy chi phí giảm từ 5 đến 10 lần mỗi năm. Sau khi loại bỏ yếu tố phần cứng rẻ hơn và áp lực cạnh tranh về giá, họ xác định mức tăng thực tế về hiệu quả thuật toán là khoảng 3 lần mỗi năm. Hiệu suất đỉnh trên mỗi lần chạy thực tế có thể trở nên đắt đỏ hơn, vì các mô hình suy luận mới hơn tiêu tốn nhiều tài nguyên tính toán hơn cho mỗi tác vụ.

Tuy nhiên, cả hai nghiên cứu đều đang đặt ra những câu hỏi khác nhau. Nếu là để đạt được khả năng hàng đầu của năm ngoái? Rẻ hơn đáng kể. Nếu là để chạy mô hình tốt nhất hiện tại? Thường thì chi phí cho mỗi truy vấn lại cao hơn nhiều.

### Việc đạt được độ chính xác của o3 hiện nay chỉ tốn một phần nhỏ chi phí trước đây.

[Epoch sử dụng](https://epoch.ai/publications/the-plunging-price-of-thought) mô hình o3 của OpenAI làm ví dụ. Vào đầu năm 2025, o3 đạt 75% điểm trong bài kiểm tra GPQA Diamond, một bài kiểm tra khoa học trình độ tiến sĩ, với chi phí ước tính là 30 xu cho mỗi câu hỏi. Mười tám tháng sau, một mô hình thuộc dòng GPT-5.6 đạt cùng số điểm đó với giá bốn phần trăm của một xu. Epoch cho biết con số này bằng 1/725 giá gốc. Nếu ô tô giảm giá nhanh như vậy, một chiếc xe trị giá 50.000 euro sẽ có giá chưa đến 70 euro. OpenAI vừa ra mắt các mô hình [GPT-6 Sol và Luna thậm chí còn rẻ hơn](https://the-decoder.com/openais-gpt-6-sol-and-luna-cut-prices-in-half-but-barely-move-the-needle-on-performance/) chỉ vài ngày trước, vì vậy khoảng cách này có khả năng đã nới rộng hơn nữa.

![](https://the-decoder.com/wp-content/uploads/2026/09/epoch_ai_benchmark_costs-770x489.png)

Epoch dựa trên phân tích của mình từ năm bài kiểm tra benchmark bao gồm toán học, khoa học và các câu đố logic. Vì đây là một mẫu hẹp, tổ chức này gọi các phát hiện của mình là "những phép đo hợp lý nhưng còn thô dựa trên dữ liệu tốt nhất hiện có".

### Sự gia tăng về thuật toán chỉ giải thích một phần của sự sụt giảm.

Hans Gundlach và các đồng nghiệp tại MIT sử dụng dữ liệu giá từ nền tảng so sánh Artificial Analysis, bao gồm giai đoạn từ tháng 4 năm 2024 đến tháng 11 năm 2025, và đánh giá nhiều mô hình trên mỗi bài kiểm tra hơn so với các nghiên cứu trước đây. Các con số của họ thấp hơn Epoch một phần vì các mô hình suy luận mới hơn có thể sử dụng thêm [tài nguyên tính toán trong thời gian kiểm tra (test-time compute)](https://the-decoder.com/openai-co-founder-predicts-a-new-ai-age-of-discovery-as-llm-scaling-hits-a-wall/) cho các vấn đề khó, làm tăng chi phí cho mỗi câu trả lời đúng ngay cả khi giá trên mỗi token vẫn tiếp tục giảm. Token là đơn vị văn bản mà các nhà cung cấp tính phí, và việc chỉ so sánh chúng sẽ không phản ánh được bức tranh toàn cảnh.

Khi MIT phân tích những yếu tố đẩy giá xuống thấp hơn, phần cứng rẻ hơn chiếm một phần, cạnh tranh chiếm phần lớn hơn. Các nhà nghiên cứu kiểm soát yếu tố cạnh tranh bằng cách xem xét các mô hình mở một cách riêng biệt. Những gì còn lại là mức tăng hiệu quả thuật toán thuần túy, đạt khoảng 3 lần mỗi năm. Con số 13 lần của Epoch cao hơn vì nó không loại bỏ các tác động từ phần cứng và cạnh tranh.

![](https://the-decoder.com/wp-content/uploads/2026/09/gundlach_et_al.png)

### Điểm số benchmark tốt hơn không phải lúc nào cũng có nghĩa là hiệu quả tốt hơn.

MIT cũng phát hiện ra rằng một số cải thiện về hiệu suất đơn giản đến từ việc chi tiêu nhiều tài nguyên tính toán hơn. Một mô hình mới vượt qua phiên bản tiền nhiệm trên GPQA Diamond trông có vẻ là một bước tiến từ góc nhìn bên ngoài, nhưng các tác giả ước tính một phần lớn sự cải thiện đến từ việc sử dụng nhiều sức mạnh xử lý hơn cho mỗi câu hỏi. Nó đạt điểm cao hơn và tốn kém hơn để vận hành. Các bài kiểm tra về lập trình và toán học cũng cho thấy một mô hình tương tự ở quy mô nhỏ hơn.

Không phải mọi tiến bộ về benchmark đều là tiến bộ về hiệu quả. Các mô hình mới kết hợp quá trình huấn luyện tốt hơn, dữ liệu tốt hơn, kiến trúc tốt hơn và nhiều tài nguyên tính toán trong thời gian kiểm tra hơn. Một điểm số duy nhất hòa trộn tất cả những điều đó.

[Ngoài ra còn có vấn đề "benchmaxxing" (tối ưu hóa chỉ để đạt điểm benchmark)](https://the-decoder.com/frontier-radar-4-china-has-caught-up-so-whats-left-of-the-western-ai-lead/): Các công ty AI có thể tối ưu hóa cho các bài kiểm tra nổi tiếng, làm thổi phồng điểm số mà không mang lại lợi ích thực tế. Epoch cố gắng ngăn chặn điều này bằng cách đưa vào một bài kiểm tra có tên "Mystery Game Puzzles", dựa trên một trò chơi được giữ bí mật. Chi phí giảm chậm nhất ở bài kiểm tra đó, điều này phù hợp với lý thuyết benchmaxxing nhưng cũng có thể chỉ phản ánh định dạng tác vụ hoặc nhiễu trong dữ liệu.

### Chỉ riêng giá cả sẽ không cho bạn biết nên chọn mô hình nào.

Các mức giá trung bình chung không giúp ích nhiều khi bạn chọn một mô hình cho một công việc cụ thể. Các nền tảng như [Artificial Analysis](https://artificialanalysis.ai/models) xếp hạng các mô hình dựa trên chất lượng, giá cả, độ trễ, cửa sổ ngữ cảnh và tốc độ đầu ra, và lựa chọn rẻ nhất hiếm khi thắng ở mọi khía cạnh.

Một mô hình giá rẻ với độ trễ cao là vô dụng đối với chatbot thời gian thực. Một mô hình suy luận mạnh mẽ có thể quá chậm cho các quy trình tự động hóa. Một mô hình tiên phong đắt tiền hơn vẫn có thể tiết kiệm chi phí nếu nó đưa ra kết quả chính xác thường xuyên hơn và giảm bớt số lần phải thực hiện lại. Không điều nào trong số đó xuất hiện trong một phép so sánh giá-trên-mỗi-token đơn giản. Chúng tôi đã đi sâu vào [câu hỏi về kinh tế học token này trong Frontier Radar #3](https://the-decoder.com/frontier-radar-3-how-agentic-ai-is-turning-tokens-into-a-business-metric/).
