Tomer Tunguz Blog (phân tích VC)
85

Tin ngành

Hiệu ứng 'Siêu thị AI' trên OpenRouter: Thị trường mô hình đang phân hóa mạnh mẽ

(giờ Việt Nam)

Tóm tắt AI

Thị trường AI trên OpenRouter đang phân hóa rõ rệt như các kệ hàng siêu thị, khi mô hình mã nguồn mở GPT-OSS 120b vẫn duy trì được 36% lưu lượng truy cập so với flagship Opus 4.8 của Anthropic.

Bản dịch AI

Yeltsin in the AI Aisle

Tóm lại: Mẫu GPT-OSS-120b đã một năm tuổi vẫn phục vụ 36% lưu lượng token hàng ngày của Claude Opus 4.8 trên OpenRouter vì thị trường suy luận (inference market) đã phân mảnh dựa trên chi phí, tốc độ và độ chính xác. GLM 5.2 hiện đang vượt mặt các mô hình tiên phong với 495 tỷ token mỗi ngày, và Opus 5 đã được ra mắt để cạnh tranh trong phân khúc mô hình mã nguồn mở (open-weight). Kiến trúc Mixture-of-experts cho phép một mô hình 118B giải mã với chi phí của một mô hình 26B, qua đó dịch chuyển ranh giới của phân khúc mô hình chạy cục bộ (local segment).

Năm 1989, Boris Yeltsin đã ghé vào một siêu thị Randalls ở Houston và bị choáng ngợp bởi sự đa dạng của các loại kem.[1] OpenRouter chính là lối đi trong siêu thị đó dành cho AI.

Và người mua sắm đưa ra những lựa chọn đầy bất ngờ: Mô hình mã nguồn mở GPT-OSS 120b[2] đã một năm tuổi của OpenAI chiếm tới 36% lưu lượng của Claude Opus 4.8 từ Anthropic.[3]

Tại sao một mô hình từ tháng 8 năm 2025 vẫn nắm giữ một phần ba lưu lượng truy cập của một mô hình tiên phong vừa ra mắt cách đây vài tuần?

Thị trường token đã bị phân mảnh.

Daily tokens served on OpenRouter, 7-day average: GLM 5.2 tops the field at 495B, above Claude Opus 4.8 at 199.6B; a year-old GPT-OSS-120b holds 71.3B, roughly a third of Opus, with Gemma 4 26B at 50B

Sự phân mảnh xảy ra vì nhu cầu của người mua rất đa dạng.

Sự phân mảnh này đang tăng tốc nhờ vào cạnh tranh. Tuần trước, Anthropic đã ra mắt Opus 5, nhỏ hơn và rẻ hơn Fable,[4] nhằm mục đích cạnh tranh trực tiếp với phân khúc mà Kimi 3 của Moonshot đang nhắm tới.[5] Trong thị trường mô hình tầm trung, Poolside đã tung ra Laguna S 2.1, một mô hình tầm trung của Mỹ.[6]

Kích thước (nhỏ, trung bình, lớn, XL), nguồn gốc (Mỹ so với Trung Quốc), kiến trúc (dày đặc so với thưa thớt), độ chính xác (tập trung vào lập trình hoặc tổng quát), tốc độ (token mỗi giây), phương thức (chỉ văn bản hoặc đa phương thức); có rất nhiều "hương vị" AI khác nhau.

Tôi đã dành cả cuối tuần để thay thế mô hình đang vận hành tác nhân (agent) của mình. Mô hình cũ là Gemma 4 26b; mô hình thay thế là Laguna S 2.1, một mô hình có 118 tỷ tham số. Theo mọi con số mà tôi cho là quan trọng, mô hình 118b lẽ ra phải chậm hơn.

Trên máy M5 Max của tôi, cả hai đều tạo văn bản với tốc độ như nhau, vì Laguna sử dụng kiến trúc mixture-of-experts: 118 tỷ tham số nằm trong bộ nhớ, nhưng chỉ 8 tỷ tham số được kích hoạt cho mỗi token. Một mô hình 118b hiện chạy với chi phí giải mã của một mô hình 26b, điều này đưa chất lượng ở đẳng cấp tiên phong xuống phân khúc chạy cục bộ.

Độ chính xác thể hiện rõ ở những nơi quan trọng. Hệ thống cục bộ của tôi chạy một tác nhân lập trình và email dựa trên các lệnh gọi công cụ (tool calls), và qua các mô hình mà tôi đã thử nghiệm, tỷ lệ lỗi khi gọi công cụ giảm từ 29,4% xuống 20,1% khi số lượng tham số hoạt động tăng lên.[7] Laguna giảm tỷ lệ lỗi xuống 7 điểm phần trăm so với mô hình 26b mà nó thay thế.

MCP tool-call failure rate for the local model driving a production automation stack, measured from real traffic: Ornith-1.0 35B at 29.4%, Gemma 4 26B at 27.1%, & Laguna S 2.1 at 20.1%, roughly a quar

Sự phân mảnh là dấu hiệu của một thị trường cạnh tranh lành mạnh. Các mô hình tiên phong vẫn phục vụ những tác vụ khó nhất thế giới. Nó không còn phải phục vụ tất cả mọi thứ nữa, và phân khúc trên máy tính xách tay của tôi vừa có một ngưỡng chất lượng cao hơn nhiều; một xu hướng mà sự cạnh tranh sẽ thúc đẩy không ngừng nghỉ.

Chuyến thăm của Boris Yeltsin năm 1989 tới một cửa hàng tạp hóa ở Houston, một siêu thị Randalls tại Clear Lake, ngày 16 tháng 9 năm 1989. ↩︎

Giới thiệu gpt-oss (OpenAI), phát hành ngày 5 tháng 8 năm 2025. ↩︎

Các trang hoạt động của mô hình trên OpenRouter, trung bình 7 ngày, truy xuất ngày 27-07-2026: GPT-OSS-120b, GLM 5.2, Claude Opus 4.8. ↩︎

Anthropic ra mắt Claude Opus 5 với giá bằng một nửa, phát hành ngày 24 tháng 7 năm 2026. ↩︎

Kimi 3 của Moonshot được kỳ vọng sẽ thu hẹp khoảng cách với Opus 4.8 của Anthropic (TechCrunch). ↩︎

Giới thiệu Laguna S 2.1 (Poolside), một mô hình mã nguồn mở với tổng 118 tỷ tham số, 8 tỷ tham số hoạt động, phát hành ngày 22 tháng 7 năm 2026. ↩︎

Dữ liệu sản xuất của tác giả: Nhật ký gọi công cụ MCP từ một tác nhân lập trình và email cục bộ, được đo lường trên ba mô hình cục bộ trong năm tháng. ↩︎

Nhận bài viết tiếp theo trong hộp thư đến của bạn

Bài đọc 1 phút giúp biến dữ liệu công nghệ thành lợi thế chiến lược. Được đọc bởi hơn 150 nghìn nhà sáng lập và điều hành.

Đối tác quản lý (GP) tại Theory Ventures. Cựu Giám đốc sản phẩm (PM) tại Google. Chia sẻ những thông tin chi tiết dựa trên dữ liệu về AI, web3 và đầu tư mạo hiểm.

Bloomberg • WSJ • Economist

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Tomer Tunguz Blog (phân tích VC). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.