Thủ thuật
Ai thực sự cần mô hình SOTA? Dữ liệu từ OpenRouter cho thấy 84% token đến từ các mô hình không phải hàng đầu
(giờ Việt Nam)
Tóm tắt AI
Dữ liệu từ OpenRouter chỉ ra rằng người dùng ưu tiên các mô hình nhỏ, chi phí thấp với hiệu năng đạt khoảng 77-80% so với các mô hình SOTA đắt đỏ, giúp tối ưu hóa đáng kể chi phí vận hành.
Bản dịch AI
Tóm lại: Các mô hình hiện đại nhất (state of the art - SOTA) đã thông minh hơn hai phần ba so với tháng 11 năm ngoái và các phòng thí nghiệm tung ra hai mô hình mới mỗi ba ngày. Tuy nhiên, 84% token trên OpenRouter không phải là SOTA. Sáu mô hình chiếm đa số áp đảo mang lại khoảng 77% hiệu suất của các mô hình tiên phong (frontier) với mức giá chỉ bằng 2,5% so với Claude Fable 5. Dữ liệu của Ramp cho thấy độ co giãn của giá trên thị trường. Các mô hình tiên phong vẫn chiến thắng về kiến trúc phần mềm và thiết kế bảo mật; việc triển khai ứng dụng tối ưu hóa một đường biên Pareto khác, đó là ưu tiên giá cả hơn hiệu suất.
Các mô hình SOTA đã thông minh hơn hai phần ba so với tháng 11 năm ngoái. Tốc độ cải tiến điên cuồng này vẫn được duy trì, với hai mô hình mới ra đời mỗi ba ngày. 1
Nhưng 84% token trên OpenRouter không phải là SOTA. 2 3
Trên thực tế, sáu mô hình mà người dùng chọn để tạo ra đa số áp đảo các token đó mang lại khoảng 77% hiệu suất của các mô hình tiên phong. Chúng có chi phí chỉ bằng 2,5% so với Claude Fable 5. 2
Chỉ số này liên tục nhảy vọt. Những bước tiến lớn từ ba đến năm điểm Artificial Analysis xuất hiện khoảng mỗi quý một lần. Những bước tiến nhỏ hơn lấp đầy các khoảng trống.
Sáu mô hình chiếm 80% lưu lượng trong tuần ngày 10 tháng 8. Giá trung bình của chúng là 0,50 USD cho mỗi triệu token so với 20 USD của Fable 5.
Dữ liệu của Ramp cho thấy người mua rất nhạy cảm về giá. Fable 5 với mức giá khoảng 10 USD/triệu token đã chiếm 6% số token của Anthropic và 11% chi tiêu của Anthropic một tháng sau khi ra mắt. GPT-5.6 Sol, phân khúc chính đắt đỏ nhất của OpenAI, nắm giữ khoảng một phần tư số token của OpenAI. 4
Fable 5 tạo ra doanh thu từ mô hình tương đương khoảng 75% so với GPT-5.6 Sol trong tháng 7, mặc dù đắt hơn đáng kể.
Mỗi bản phát hành SOTA mới sẽ chiếm thị phần ít hơn so với bản trước đó.
Các doanh nghiệp sẽ hợp nhất chi tiêu. Các hợp đồng tập trung vào một hoặc hai nhà cung cấp, giống như trong kỷ nguyên điện toán đám mây, và một khi một mô hình hoàn thành tốt công việc có giá trị cao, khối lượng công việc đó sẽ được duy trì.
Hiệu suất hiện đã đủ tốt với mức chiết khấu đáng kể. Khoảng cách đang dần được thu hẹp từ phía dưới. Mô hình mã nguồn mở (open-weight) tốt nhất đã đạt 80% điểm số của mô hình tiên phong vào tháng 5, tăng từ 48% một năm trước đó. 2
Triển khai ứng dụng lại là một câu chuyện khác. Nhiều công ty trong danh mục đầu tư và các startup của chúng tôi mặc định chọn các mô hình nhỏ hơn, mô hình được tinh chỉnh (fine-tuned) và mã nguồn mở. Họ đang tối ưu hóa dựa trên một đường biên Pareto khác: giá cả thay vì hiệu suất.
Nếu thị phần ngừng dịch chuyển và mức "đủ tốt" vẫn duy trì, kinh tế học của SOTA sẽ thay đổi. Một đợt huấn luyện tốn kém hàng trăm triệu đô la phải giành được thị phần để tự hoàn vốn, và rào cản đó sẽ tăng dần theo thời gian.
Tiêu đề này nghe có vẻ bông đùa. Nhiều người vẫn mua SOTA, và có lý do chính đáng cho điều đó. Kiến trúc kỹ thuật phần mềm và thiết kế bảo mật là những trường hợp rõ ràng nhất, nơi mô hình tốt nhất hiện có xứng đáng với giá tiền của nó.
Nhưng dữ liệu mở mà chúng ta có cho thấy đường biên thực sự quan trọng lại là đường biên còn lại.
Danh mục mô hình và Chỉ số thông minh (Intelligence Index) của Artificial Analysis. Số lượng phát hành hàng tháng của các phòng thí nghiệm lớn và lộ trình mô hình tiên phong. Mẫu bắt đầu từ 01-11-2025. Xu hướng tốc độ phát hành đi ngang. Khoảng cách trung vị giữa các bước tiến lớn (≥3 điểm) của mô hình tiên phong là khoảng 3,5 tháng. Chỉ số thông minh ↩︎
SOTA có nghĩa là điểm số Artificial Analysis tốt nhất hiện có trong một tuần nhất định; một mô hình được coi là gần SOTA khi điểm số nằm trong phạm vi 10% so với mô hình tốt nhất được nêu tên trong tuần đó. Các mô hình hàng đầu hàng tuần trên OpenRouter được kết nối với điểm số Artificial Analysis, lấy từ danh sách đầu của OpenRouter thay vì mọi API. Chuỗi thị phần, các tuần từ 03-11-2025 đến 25-05-2026 (n=30), chỉ tính các mô hình có tên, loại trừ các mô hình khác. Mười ba tuần đầu so với mười ba tuần cuối là khoảng 17,5% so với 14,6% gần mức tiên phong (~82-85% nằm ngoài). Ảnh chụp nhanh mức độ tập trung, tuần ngày 10-08-2026, các mô hình chiếm khoảng 80% đầu tiên của các token có tên. Artificial Analysis theo trọng số token thấp hơn khoảng 23% so với SOTA của danh mục toàn cầu (~77% chất lượng tiên phong) và thấp hơn khoảng 10% so với mô hình tốt nhất trong danh sách OpenRouter đó. Giỏ hàng trung bình khoảng 0,50 USD/triệu token so với 20 USD/triệu token của Fable 5 (~40 lần). Kiểm tra lịch sử tháng 05-2026, thấp hơn khoảng 16% so với mô hình dẫn đầu danh sách địa phương. Mô hình mã nguồn mở tốt nhất đạt 47,5% điểm số tiên phong trong mười ba tuần đầu so với 70,9% trong mười ba tuần cuối; tuần tốt nhất là 25-05-2026, DeepSeek V4 Pro đạt 45,27 so với 56,31 của mô hình tiên phong (80,4%). Xếp hạng OpenRouter ↩︎ ↩︎ ↩︎
Các nguồn dữ liệu này không nắm bắt được các đám mây bên thứ nhất, các dịch vụ riêng của OpenAI, Anthropic và Google. Lưu lượng truy cập tiên phong chạy trên các API gốc không bao giờ lọt vào bảng xếp hạng OpenRouter, vì vậy dữ liệu có độ chệch nhất định. ↩︎
Ramp Economics Lab, Chỉ số AI tháng 08-2026 (Mức độ tiếp nhận Fable 5). econlab.substack.com/p/ai-index-august-2026 ↩︎
Nhận bản tin tiếp theo trong hộp thư của bạn
Bài đọc 1 phút giúp biến dữ liệu công nghệ thành lợi thế chiến lược. Được đọc bởi hơn 150 nghìn nhà sáng lập và điều hành.
Đối tác chung (GP) tại Theory Ventures. Cựu Giám đốc sản phẩm (PM) tại Google. Chia sẻ những thông tin chuyên sâu dựa trên dữ liệu về AI, web3 và đầu tư mạo hiểm.
Bloomberg • WSJ • Economist
Bài viết được AI dịch và tổng hợp tự động từ Tomer Tunguz Blog (phân tích VC). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.