Thủ thuật
Điều gì xảy ra khi chi phí trí tuệ nhân tạo giảm 100 lần?
(giờ Việt Nam)
Tóm tắt AI
Chi phí vận hành các mô hình ngôn ngữ lớn đang giảm mạnh, với tốc độ giảm 100 lần mỗi năm. Sự sụt giảm này biến những dự án phân tích dữ liệu quy mô lớn vốn bất khả thi trước đây trở nên khả thi và hiệu quả về mặt kinh tế.
Bản dịch AI

Sự tiến bộ trong các mô hình ngôn ngữ lớn (large language models) thường được báo cáo dựa trên những gì mô hình tốt nhất hiện nay có thể làm được mà trước đây chưa mô hình nào làm được. Đó là hướng đi tạo nên các tiêu đề báo chí, và thực sự nó vô cùng đáng kinh ngạc. Mỗi bước tiến ở phân khúc cao cấp nhất cho phép mô hình xử lý những tác vụ vốn nằm ngoài tầm với, dù đó là sửa lỗi trong toàn bộ cơ sở mã (codebase) hay gần đây là đạt được những tiến bộ trong các bài toán toán học hóc búa chưa từng có lời giải.
Có một hướng tiến bộ thứ hai ít được chú ý hơn, đó là mức độ rẻ mà một năng lực nhất định có thể đạt được. Rất nhiều công việc hữu ích không đòi hỏi mô hình thông minh nhất hiện có, mà cần một mô hình "đủ tốt" được áp dụng hàng nghìn lần. Đọc mọi bài báo khoa học về một chủ đề, kiểm tra mọi hợp đồng trong kho lưu trữ để tìm một điều khoản cụ thể, hay tóm tắt mọi luồng thảo luận trong một diễn đàn lớn là những tác vụ như vậy. Đối với những việc này, câu hỏi không phải là liệu có mô hình nào làm được việc đó hay không, mà là liệu nó có thể thực hiện mười nghìn lần trong phạm vi ngân sách hay không. Phân khúc cao cấp mở ra các loại tác vụ mới; phân khúc giá rẻ mở ra quy mô thực hiện.
Khi chọn một mô hình cho một ứng dụng, bạn đang cân nhắc giữa năng lực của nó và chi phí cho mỗi lần gọi. Đối với việc lập trình bằng tác nhân (agentic coding), tôi tập trung gần như hoàn toàn vào năng lực, với suy nghĩ chung rằng chất lượng công việc được cải thiện xứng đáng với số tiền bỏ ra, ngay cả khi có những mô hình rẻ hơn nhiều mà vẫn đủ khả năng. Gần đây, sự chú ý của tôi đổ dồn vào chi phí của phân khúc giá rẻ. Chúng tôi đang đo lường tần suất các bộ dữ liệu được chia sẻ trên DANDI Archive được tái sử dụng trong các ấn phẩm sau này, nghĩa là phải đọc khoảng mười nghìn bài báo ứng viên bằng một mô hình và hỏi mỗi bài xem liệu dữ liệu có thực sự được tái sử dụng hay không. Với giá hiện nay, một lượt quét toàn bộ kho dữ liệu tốn hơn một trăm đô la một chút với một mô hình từng đứng đầu bảng xếp hạng vào mùa xuân. Với mức giá tháng 3 vừa qua, cùng một lượt quét với cùng mức năng lực đó sẽ tốn vài nghìn đô la, và một năm trước, năng lực đó thậm chí không có sẵn ở bất kỳ mức giá nào. Sự thay đổi ở phân khúc giá rẻ đó đã biến phân tích này từ một việc chỉ có thể làm trên mẫu thử thành một dự án khả thi. Tôi đã rất ngạc nhiên trước sự tiến bộ trên toàn bộ phổ chi phí, đặc biệt là việc các mô hình giá rẻ đã trở nên thông minh như thế nào.
Artificial Analysis đã thực hiện đo kiểm (benchmarking) trí tuệ và giá cả trên hàng trăm mô hình trong vài năm qua, và lượng dữ liệu đó đủ để tái dựng lại sự đánh đổi này. Cụ thể, biểu đồ này cho thấy chỉ số trí tuệ so với chi phí trên mỗi tác vụ, cung cấp ước tính chi phí thực tế cho các cấp độ năng lực mô hình khác nhau. Đường trên cùng là cái mà họ định nghĩa là "đường Pareto", đại diện cho các mô hình có năng lực tốt nhất tại một mức giá nhất định. Đường này mô tả biên giới thực sự của các LLM. Tôi đã lấy dữ liệu từ artificialanalysis.ai và xem xét cách biên giới Pareto dịch chuyển khi các mô hình mới được phát hành. Tôi nghĩ rằng việc dành chút thời gian để xem xét sự tiến bộ này và đưa ra một vài dự đoán cho vài tháng tới là rất xứng đáng.
Tóm tắt ngắn gọn: mức độ trí tuệ từng tốn 1,22 đô la mỗi tác vụ vào tháng 2 hiện chỉ tốn 0,022 đô la, giảm 56 lần trong chưa đầy sáu tháng, và tốc độ giảm đang tăng nhanh. Với tốc độ đo lường được, mức giảm 100 lần cho một cấp độ năng lực nhất định mất khoảng một năm, và câu hỏi đáng đặt ra không phải là liệu điều đó có xảy ra hay không, mà là nó sẽ thay đổi những gì.
Chỉ số Trí tuệ của Artificial Analysis (The Artificial Analysis Intelligence Index)
Trục năng lực trong suốt bài viết này là Chỉ số Trí tuệ của Artificial Analysis, vì vậy cần làm rõ con số đó là gì. Phiên bản hiện tại, v4.1.1, là mức trung bình có trọng số của chín đánh giá được nhóm thành bốn loại: tác vụ tác nhân (agentic tasks) chiếm 34%, lập trình 24%, suy luận khoa học 24% và năng lực chung 18%. Trọng số này phản ánh sự quan tâm của lĩnh vực: một phần ba số điểm đến từ khả năng hoàn thành công việc tác nhân nhiều bước của mô hình, chứ không phải từ việc trả lời các câu hỏi thi. Các đánh giá thành phần, trọng số và chi tiết chấm điểm được ghi lại trong phương pháp luận đo kiểm trí tuệ của Artificial Analysis.
Kết quả bạn nhận được là một con số duy nhất đại diện cho năng lực mô hình, giống như chỉ số IQ cho các LLM. Nó không hoàn hảo, và hai mô hình có cùng số điểm có thể có những thế mạnh khác nhau, nhưng tôi nhận thấy điểm số này thực hiện khá tốt việc chỉ ra năng lực của một mô hình.
Để làm điểm tham chiếu, "Claude 4.5 Sonnet (Reasoning)" của Anthropic đối với tôi và nhiều người khác là lần đầu tiên một mô hình cảm thấy đủ năng lực để sử dụng trong một khung tác nhân (agentic harness) để viết mã. Vào thời điểm đó, tôi đang sử dụng Cline, và mô hình này mang lại sự gia tăng năng suất đáng kể so với các quy trình tự động hoàn thành (auto-complete) và sao chép/dán. Mô hình đó có điểm trí tuệ là 37,4 (dựa trên hệ thống chấm điểm trí tuệ ngày nay). Mô hình hàng đầu hiện tại là Claude Opus 5 max effort, đạt 63,1.
Để có cảm nhận trực quan hơn về ý nghĩa của các cấp độ chỉ số khác nhau, tôi đã mượn bài kiểm tra pelican của Simon Willison: đưa ra câu lệnh cho mô hình "Tạo một tệp SVG hình một con bồ nông đang đi xe đạp" và xem kết quả trả về. Đó không phải là thứ mà chỉ số đo lường, nhưng là một tác vụ mà bất kỳ ai cũng có thể đánh giá bằng mắt thường. Các bảng dưới đây sử dụng dòng GPT-5.6 tại bốn điểm trên chỉ số: Luna ở mức nỗ lực thấp (low), cao (high) và rất cao (xhigh), và Sol ở mức nỗ lực tối đa (max). Tôi đã tạo ba mẫu cho mỗi mô hình và hiển thị mẫu đầu tiên; tất cả chúng đều có trong kho lưu trữ của trang web.
Sự tiến triển có thể thấy rõ: chi tiết hơn, tỷ lệ tốt hơn và một con bồ nông rõ ràng đang đạp xe thay vì lơ lửng phía trên nó.
Đo lường Chi phí trên mỗi Tác vụ
Chi phí trên mỗi token rất dễ tìm, nhưng các mô hình khác nhau có thể sử dụng số lượng token rất khác nhau, vì vậy một chỉ báo tốt hơn về chi phí của một mô hình cần phải tính đến điều này. Chi phí trên mỗi tác vụ là con số do chính Artificial Analysis đo lường: chi phí trung bình bằng USD để chạy một tác vụ từ bộ đánh giá Chỉ số Trí tuệ của họ, bao gồm các token đầu vào, suy luận và câu trả lời thực tế được tính phí trong quá trình chạy. Trang web hiển thị con số này nhưng gói API miễn phí thì không, vì vậy tôi đã trích xuất nó từ dữ liệu nhúng trong trang của mỗi mô hình trên trang web, bao gồm cả các mô hình họ đang đo kiểm và các mô hình đã ngừng hoạt động mà trang của chúng vẫn còn lưu giữ số đo (các phiên bản Claude Opus và Sonnet cũ hơn, dòng GPT-5.x, và các mô hình khác). Điều đó mang lại chi phí đo lường cho 137 mô hình từ DeepSeek V3 vào tháng 12 năm 2024, mỗi mô hình được ghép nối với ngày phát hành và điểm Chỉ số Trí tuệ trên thang đo hiện tại.
Biên giới đã dịch chuyển như thế nào
Biểu đồ dưới đây vẽ chỉ số trí tuệ so với chi phí đo lường trên mỗi tác vụ và vạch ra biên giới Pareto, cách rẻ nhất để đạt được từng cấp độ trí tuệ, như hiện nay và tại các khoảng thời gian hai tháng trong năm qua, sử dụng ngày phát hành của mỗi mô hình để tái dựng lại những gì đã có sẵn. Biểu đồ xây dựng từng biên giới một, tạm dừng ở bức tranh toàn cảnh và lặp lại; sử dụng nút để dừng nó. Di chuột vào bất kỳ điểm nào để xem mô hình đứng sau nó.
Mỗi biên giới kế tiếp nằm phía trên và bên trái của biên giới trước đó: nhiều trí tuệ hơn với cùng chi phí, hoặc cùng trí tuệ với chi phí thấp hơn. Tốc độ dịch chuyển đó đang tăng nhanh. Trong nửa cuối năm 2025, biên giới chỉ nhích dần: chỉ có hai bước nhảy nhỏ giữa tháng 8 và tháng 10, và một bước nhảy giữa tháng 10 và tháng 12. Các biên giới tháng 2 và tháng 4 mỗi lần đã dịch chuyển một phần lớn của đường cong, và hai ảnh chụp nhanh gần nhất đã thay thế gần như hoàn toàn biên giới, với mười trong số mười một mô hình biên giới tháng 6 là mới kể từ tháng 4 và mười lăm trong số mười sáu mô hình hiện nay là mới kể từ tháng 6.
Cạnh bên phải kể câu chuyện về năng lực. Trần của biên giới đã tăng từ chỉ số 35,3 vào tháng 8 năm 2025 (GPT-5 với giá 0,26 đô la mỗi tác vụ) lên 37,4 vào tháng 10 năm đó (Claude 4.5 Sonnet), 48,4 vào tháng 2 (Claude Sonnet 4.6), 55,0 vào tháng 4 (Claude Opus 4.7 với giá 2,23 đô la), 62,1 vào tháng 6 (Claude Fable 5 với giá 3,14 đô la) và 63,1 hôm nay (Claude Opus 5 với giá 2,34 đô la): hai mươi tám điểm Chỉ số Trí tuệ trong một năm. Nửa bên trái cho thấy trí tuệ ngày càng tăng của các mô hình giá rẻ. Tính đến ngày 19 tháng 8 năm 2026, thang nỗ lực GPT-5.6 Luna hiện sở hữu gần như mọi thứ dưới chỉ số 52, với mức độ từng là trần của tháng 8 năm 2025 hiện có sẵn với giá 0,0088 đô la mỗi tác vụ. Biên giới tháng 6 năm 2026 bị thống trị bất thường bởi các mô hình trọng số mở (open weights): sáu trong số mười một mô hình của nó là mô hình mở (trong đó có MiMo-V2.5, DeepSeek V4 Pro, MiniMax-M3 và GLM-5.2), và chúng nắm giữ toàn bộ phạm vi giữa từ chỉ số 38 đến 53. Trong các ảnh chụp nhanh trước đó, các mô hình mở chỉ xuất hiện ở cuối phạm vi, và ngày nay, sau khi GPT-5.6 Luna ra mắt, chỉ có hai trong số mười sáu mô hình biên giới là mô hình mở.
Lưu ý rằng một mô hình duy nhất có thể bao phủ một phần lớn phạm vi này thông qua các mức nỗ lực suy luận khác nhau: thang GPT-5.6 Luna chạy từ 0,0088 đô la ở mức nỗ lực thấp đến 0,047 đô la ở mức tối đa và bao phủ toàn bộ nửa dưới của biên giới, trong khi Claude Opus 5 trải dài từ 0,43 đô la ở mức thấp đến 2,34 đô la ở mức tối đa và đạt được khoảng mười điểm Chỉ số Trí tuệ trong quá trình đó. Nỗ lực hiện là một nút xoay chính trong sự đánh đổi chi phí/trí tuệ, và kết quả là, chi phí và trí tuệ gắn bó chặt chẽ với nhau.
Biểu đồ các kỷ lục dưới đây theo dõi chi phí đo lường trên mỗi tác vụ rẻ nhất đạt được bởi bất kỳ mô hình nào được phát hành tại hoặc trên một cấp độ Chỉ số Trí tuệ nhất định. Chuỗi dữ liệu kéo dài đến giữa năm 2025 cho các cấp độ thấp hơn, và các cấp độ cao hơn xuất hiện khi chúng trở nên khả dụng.
Một cấp độ năng lực lần đầu tiên được đạt tới bởi một mô hình biên giới lớn với mức giá cao cấp. Sau một thời gian, các mô hình rẻ hơn đạt tới cùng cấp độ đó, và kỷ lục giảm xuống một bậc độ lớn hoặc hơn. Cấp độ ≥ 40 mở đầu với Claude Sonnet 4.6 vào tháng 2 với giá 1,22 đô la mỗi tác vụ, bị Gemini 3.1 Pro Preview vượt qua trong vòng hai ngày với giá 0,33 đô la; MiMo-V2.5-Pro, một mô hình trọng số mở, đã cắt giảm kỷ lục xuống 0,034 đô la vào tháng 4, và GPT-5.6 Luna ở mức nỗ lực cao đang giữ kỷ lục ở mức 0,022 đô la hôm nay. Cấp độ ≥ 50 đi theo cùng một quỹ đạo chậm hơn một tháng: GPT-5.4 đã vượt qua nó vào tháng 3 với giá 1,10 đô la, GPT-5.5 và sau đó là GLM-5.2 và Grok 4.5 đã hạ thấp kỷ lục trong suốt mùa xuân, thiết lập nỗ lực xhigh của GPT-5.6 Luna đã chiếm kỷ lục ở mức 0,16 đô la khi ra mắt vào ngày 9 tháng 7, và việc OpenAI cắt giảm giá 80% vào ngày 30 tháng 7 đã đưa nó xuống 0,032 đô la, mức giảm 35 lần trong năm tháng.
Lần vượt qua đầu tiên là một mô hình biên giới nỗ lực tối đa được định giá ở mức cao cấp khi ra mắt, thường là từ Anthropic hoặc OpenAI. Sau đó, các mô hình chưng cất (distilled) nhỏ từ các phòng thí nghiệm lớn (dòng GPT-5.6 Luna giữ ba trong số bốn kỷ lục hiện tại) và các bản phát hành trọng số mở (MiMo, DeepSeek V4, GLM, Hy3) đẩy giá xuống đáng kể. Trên các cấp độ có đủ lịch sử để đo lường, các kỷ lục giảm một nửa sau mỗi bốn đến mười tuần.
Cấp độ cao nhất là nơi giá cao cấp vẫn tồn tại. Chỉ có sáu mô hình đạt điểm 60 trở lên, và mô hình rẻ nhất trong số đó, Grok 4.6, vẫn có giá 0,84 đô la mỗi tác vụ. Nhưng kỷ lục đó đã giảm 3,8 lần kể từ tháng 6, và nếu mô hình từ các cấp độ thấp hơn được giữ nguyên, một mô hình chưng cất ở cấp độ này sẽ làm sụp đổ giá cả trong vòng vài quý.
Đối với tôi, kết quả ấn tượng nhất là mức giá thấp của "GPT-5.6 Luna" của OpenAI so với trí tuệ của nó. Giờ đây, trí tuệ của "Claude 4.5 Sonnet (Reasoning)" của Anthropic – thứ đã khởi đầu cuộc cách mạng khung lập trình 10 tháng trước – đã có sẵn khi sử dụng "GPT-5.6 Luna (medium)" với giá chỉ bằng 1/40! Con số đó phụ thuộc vào đợt cắt giảm giá ngày 30 tháng 7; tại giá ra mắt của Luna ba tuần trước đó, nó sẽ là 1/8.
Các lưu ý
Hạn chế quan trọng nhất là chi phí là các giá trị đo lường mới nhất được lập chỉ mục theo ngày phát hành, không phải các phép đo lịch sử được thực hiện tại thời điểm ra mắt. Giá cả bị cắt giảm trong suốt vòng đời của một mô hình, vì vậy các điểm sớm phản ánh bất kỳ đợt cắt giảm nào kể từ khi ra mắt, điều này làm sai lệch phân tích theo hướng đánh giá thấp sự sụp đổ và định ngày quá sớm. Đợt cắt giảm duy nhất tôi đã điều chỉnh là đợt lớn nhất gần đây: OpenAI đã cắt giảm giá của GPT-5.6 Luna 80% vào ngày 30 tháng 7 năm 2026, ba tuần sau khi ra mắt vào ngày 9 tháng 7 (Terra bị cắt 20% cùng ngày và Sol không thay đổi). Vì việc cắt giảm giá không thay đổi số lượng token mà một tác vụ sử dụng, tôi đã tái dựng chi phí mỗi tác vụ khi ra mắt của Luna bằng cách điều chỉnh giá trị đo lường theo tỷ lệ giá, và trong biểu đồ và bảng kỷ lục, các kỷ lục của Luna được tính theo ngày cắt giảm, không phải ngày phát hành. Điều này kéo dài thời gian giảm một nửa đo lường cho ba cấp độ thấp hơn thêm vài ngày mỗi cấp độ. Các mô hình khác có thể đã có những đợt cắt giảm mà tôi không tìm thấy, và giá đo lường cuối cùng của một mô hình đã ngừng hoạt động có thể không phải là giá khi nó ra mắt. Độ bao phủ là vấn đề thứ hai. Các mô hình đã ngừng hoạt động chỉ được bao gồm khi trang của chúng vẫn còn lưu giữ số đo, điều này khôi phục được 44 trong số 228 mô hình đã ngừng hoạt động với giá và điểm số; phần còn lại, bao gồm o3, GPT-5.3 Codex và mọi thứ từ kỷ nguyên GPT-4, đều vô hình, vì vậy các biên giới cũ nhất dựa trên ít mô hình hơn thực tế đã tồn tại và giá mở đầu thực sự của các cấp độ thấp hơn có khả năng được thiết lập bởi các mô hình mà phân tích này không thể nhìn thấy.
Điểm Chỉ số Trí tuệ của các mô hình đã ngừng hoạt động nằm trên thang đo hiện tại, nhưng bản thân Chỉ số là một tổng hợp của nhiều đánh giá. Và chi phí trên mỗi tác vụ trên một bộ đánh giá là một khối lượng công việc nặng về suy luận với các câu lệnh dài; khối lượng công việc trò chuyện với các câu lệnh ngắn và câu trả lời ngắn sẽ có quy mô khác nhau giữa các mô hình, đặc biệt là giữa các biến thể suy luận và không suy luận.
Dự đoán
Ngoại suy các tốc độ đo lường là rủi ro, vì mỗi sự sụp đổ là một sự kiện cạnh tranh chứ không phải là một quy luật, nhưng các quỹ đạo đã đủ đều đặn để đáng đưa ra các con số. Tại cấp độ ≥ 60 với thời gian giảm một nửa hiện tại là khoảng 34 ngày, kỷ lục 0,84 đô la của Grok 4.6 sẽ giảm xuống dưới mười xu vào khoảng đầu tháng 12. Chỉ số 55, mà Grok 4.5 đang giữ ở mức 0,36 đô la hôm nay, sẽ có giá dưới một xu vào giữa tháng 10. Trần của biên giới khó dự đoán hơn: nó đã tăng hai mươi tám điểm trong năm nhưng chỉ một điểm kể từ tháng 6, điều này được hiểu là sự bão hòa của chỉ số hiện tại, không phải sự chậm lại của các mô hình, vì vậy tôi mong đợi cột mốc tiếp theo ở đó sẽ là một bản sửa đổi chỉ số, không phải một con số lớn. Và nếu mô hình của bốn cấp độ cuối cùng được giữ nguyên, bất kể chỉ số sửa đổi gọi biên giới là gì, nó sẽ ra mắt với giá vài đô la mỗi tác vụ và sẽ được thương mại hóa trong vòng một quý.
Hai hướng tiến bộ
Hai hướng tiến bộ phục vụ các loại công việc khác nhau. Trần cao hơn thay đổi những gì có thể thực hiện được: những tác vụ mà năm ngoái không mô hình nào làm được và hiện nay một mô hình có thể làm. Sàn thấp hơn thay đổi những gì có thể chi trả được ở quy mô lớn: những tác vụ mà một mô hình đã có thể làm, nhưng không thể thực hiện mười nghìn lần. Việc quét tài liệu đã thúc đẩy bài viết này là một vấn đề về sàn. Mô hình chỉ cần đọc một bài báo và trả lời một câu hỏi được xác định rõ ràng, điều mà các mô hình thấp hơn nhiều so với biên giới hiện tại xử lý đáng tin cậy, nhưng nó cần làm điều đó cho mọi bài báo ứng viên, và sự khác biệt giữa 1 đô la và 0,02 đô la mỗi bài báo là sự khác biệt giữa một nghiên cứu thí điểm và một cuộc điều tra dân số hoàn chỉnh. Khám phá pháp lý, đánh giá hệ thống, quản lý dữ liệu quy mô lớn, kiểm duyệt nội dung và phân loại hỗ trợ khách hàng đều có hình thái tương tự, và tất cả chúng đều trở nên rẻ hơn theo cấp số nhân sau mỗi vài tháng mà không cần bất kỳ thay đổi nào trong chính công việc đó. Hệ quả thực tế là tập hợp các vấn đề đáng thử nghiệm với một mô hình đang mở rộng từ cả hai phía cùng một lúc, và sự mở rộng ở phía giá rẻ là điều dễ bị bỏ lỡ.
Trí tuệ rẻ hơn nghĩa là chi tiêu nhiều hơn cho nó
Một cách đọc tự nhiên của các biểu đồ này là chi tiêu cho các LLM sẽ giảm xuống. Điều ngược lại đang xảy ra. Năm 1865, William Stanley Jevons quan sát thấy rằng các động cơ hơi nước hiệu quả hơn, cần ít than hơn trên mỗi đơn vị công việc, đã làm tăng tổng mức tiêu thụ than của Anh thay vì giảm nó, bởi vì công việc rẻ hơn tìm thấy nhiều công dụng hơn. Động lực tương tự áp dụng khi chi phí của một đơn vị trí tuệ giảm 30 lần. Công việc vốn đã được thực hiện trở nên rẻ hơn, nhưng hiệu ứng lớn hơn nhiều là công việc vốn không được thực hiện vì nó không vượt qua được ngưỡng chi phí. Hiện tượng này được gọi là nghịch lý Jevons. Việc quét tài liệu của chúng tôi là một ví dụ nhỏ: với giá năm ngoái, nó sẽ chỉ được chạy một lần trên mẫu thử, nếu có, và với giá năm nay, chúng tôi chạy nó trên toàn bộ kho dữ liệu, lặp lại nó khi đường ống (pipeline) thay đổi và đang lên kế hoạch chạy mỗi kết quả dương tính ba lần để giảm nhiễu. Chi phí mỗi bài báo giảm hơn một bậc độ lớn và tổng chi tiêu của chúng tôi cho dự án đã tăng lên. Nhu cầu về trí tuệ ở một mức giá nhất định có vẻ rất co giãn, và chừng nào điều đó còn giữ nguyên, biên giới giảm xuống sẽ chuyển thành nhiều token được tiêu thụ hơn, chứ không phải ít đô la được chi tiêu hơn.
Sự chuyển động của biên giới dễ dự đoán hơn bất kỳ bản phát hành cá nhân nào. Mỗi cấp độ năng lực cho đến nay đều đi theo cùng một quỹ đạo: ra mắt cao cấp, thương mại hóa nhanh chóng, một kỷ lục ổn định được giữ bởi một mô hình chưng cất hoặc trọng số mở với giá chỉ bằng vài phần trăm giá ra mắt. Nếu một năng lực tồn tại ở bất kỳ mức giá nào ngày nay, giả định lập kế hoạch hợp lý là nó sẽ tồn tại ở mức giá hàng hóa trong vòng vài tháng. Đối với thiết kế hệ thống, điều đó ủng hộ các kiến trúc nơi mô hình là một thành phần có thể thay thế và việc định tuyến giữa các cấp độ năng lực là rõ ràng, bởi vì bản thân các ranh giới cấp độ chưa ổn định và không có dấu hiệu ổn định sớm.
Các bộ định tuyến mô hình (model routers) xuất hiện trên thị trường là một dấu hiệu cho thấy điều này đang được vận hành. OpenRouter hiện cung cấp một bộ định tuyến lấy điểm năng lực tối thiểu và gửi mỗi yêu cầu đến mô hình rẻ nhất trên biên giới của Artificial Analysis vượt qua nó, để một hệ thống tự động hưởng lợi từ biên giới đang dịch chuyển mà không cần nhà phát triển theo dõi. Việc mã hóa cứng (hardcoding) tên mô hình vào một ứng dụng đã trở thành cách nhanh nhất để trả quá mức.
Điều gì thay đổi ở mức 100 lần
Nếu tốc độ của năm qua được giữ nguyên, năng lực từng tốn một đô la mỗi tác vụ vào đầu năm 2026 sẽ tốn một xu vào cuối năm đó, và các mô hình chỉ số 60 tốn vài đô la mỗi tác vụ ngày nay sẽ dưới mười xu trong vòng vài quý. Tôi muốn cẩn thận để không suy diễn quá mức từ một năm dữ liệu, nhưng một vài hệ quả trực tiếp từ các con số.
Đọc mọi thứ trở thành mặc định. Với một xu mỗi tài liệu, một mô hình có thể đọc mọi bài báo trong một lĩnh vực, mọi hồ sơ trong một kho lưu trữ, mọi email hoặc mọi tin nhắn trong hàng đợi hỗ trợ như một vấn đề thường lệ, và câu hỏi chuyển từ việc xem tài liệu nào sang việc đặt câu hỏi nào cho tất cả chúng. Các dự án như điều tra dân số tái sử dụng của chúng tôi ngừng là dự án và trở thành giám sát: quá trình quét có thể chạy trên mọi ấn phẩm mới khi nó xuất hiện. Các quy trình làm việc nhiều lượt (multi-pass) trở thành tiêu chuẩn, vì chạy một tác vụ ba lần và lấy sự đồng thuận tốn ít chi phí hơn so với việc chạy nó một lần vài tháng trước đó, và những lợi ích về độ chính xác từ đó là rất lớn. Và bản thân các cấp độ năng lực ngừng là một cách có ý nghĩa để mô tả một hệ thống, bởi vì một đường ống sẽ định tuyến từng bước đến bất kỳ mức độ trí tuệ nào nó cần với bất kỳ chi phí nào cho mức độ đó trong tuần đó. Nguồn lực khan hiếm trong thế giới đó không phải là trí tuệ mà là sự phán đoán về việc hướng nó vào đâu, sự thật cơ bản (ground truth) để kiểm tra nó và các hệ thống để chạy nó ở quy mô lớn. Đó là những phần của công việc không trở nên rẻ hơn.
Siêu dữ liệu mô hình được lấy từ API miễn phí của Artificial Analysis, và chi phí đo lường trên mỗi tác vụ được trích xuất từ các trang mô hình trên artificialanalysis.ai, vào ngày 19 tháng 8 năm 2026. Rất hoan nghênh các ý kiến đính chính.
Ben Dichter, Tiến sĩ, là Người sáng lập CatalystNeuro. Ông nhận bằng Tiến sĩ về Kỹ thuật Sinh học từ Chương trình Chung về Kỹ thuật Sinh học UC Berkeley – UCSF. Hiện ông là chuyên gia tư vấn khoa học dữ liệu cho các phòng thí nghiệm thần kinh học, tập trung vào việc thúc đẩy hợp tác bằng cách xây dựng các hệ thống chia sẻ dữ liệu và phân tích.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.