Tin ngành
Khi các ông lớn AI cùng chọn một hạ tầng Agent: Nền móng cho kỷ nguyên AGI đã lộ diện
(giờ Việt Nam)
Tóm tắt AI
Sự đồng thuận của các nhà phát triển mô hình lớn về một hạ tầng Agent chung đang đánh dấu bước ngoặt quan trọng trong việc xây dựng nền tảng cho kỷ nguyên AGI.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
20:33:23, 20/07/2026 Nguồn: QbitAI
Lựa chọn chung trong kỷ nguyên mô hình lớn
Hãy bắt đầu bằng một câu chuyện thú vị.
Ngay tại diễn đàn WAIC hôm nay, MiniMax và StepFun đã cùng xuất hiện tại diễn đàn của một công ty AI Infra. Trong đó, MiniMax tham gia ký kết hợp tác chiến lược, còn StepFun thực hiện bài phát biểu chính.

Những dấu hiệu này thực ra đã xuất hiện từ sớm hơn. Tại Diễn đàn Trung Quan Thôn cách đây 4 tháng, Trương Bằng (Zhipu AI) và Dương Thực Lân (Kimi/Moonshot AI) từng cùng ngồi chung bàn tròn với nhà đồng sáng lập kiêm CEO của công ty này, đồng thời được xác nhận ngay tại chỗ rằng công ty này đã cung cấp dịch vụ cho Kimi và Zhipu AI.

Bốn công ty mô hình nền tảng hàng đầu trong nước lần lượt đạt được sự hợp tác sâu rộng với cùng một đơn vị AI Infra. Nói vui một chút thì — tập hợp đủ bốn "viên ngọc rồng" này là có thể triệu hồi thần long rồi.
Công ty AI Infra này chính là InnoGrit.
Vị thế này khá giống với "CATL trong lĩnh vực pin" — những người sản xuất ô tô có thể "anh em cùng leo núi, mỗi người tự nỗ lực", nhưng ở tầng pin, không thể nào né tránh được. Điều mà InnoGrit muốn làm chính là trở thành lựa chọn chung trong kỷ nguyên mô hình lớn.
Vấn đề vì thế trở nên thú vị hơn:
Rốt cuộc họ đã nhìn thấy điều gì ở công ty này?
Câu trả lời cần được tìm từ hai phía.
Về phía nhu cầu, năm 2026, suy luận (inference) bắt đầu vượt qua huấn luyện (training) để trở thành chiến trường chính tiêu thụ sức mạnh tính toán AI. Chi phí suy luận đã giảm 280 lần trong hai năm, nhưng tổng chi tiêu cho AI của các doanh nghiệp không giảm mà còn tăng. Lượng gọi Token trung bình mỗi ngày tại Trung Quốc đã vượt mốc 140 nghìn tỷ, tăng 40% trong một năm, nhu cầu đang tăng theo cấp số nhân.
Về phía cung lại là một bộ mặt hoàn toàn khác. Logic mở rộng năng lực tính toán vật lý vẫn là tuyến tính; dù có xây thêm vài phòng máy hay mua thêm vài chiếc card, khoảng trống đó vẫn không thể lấp đầy trong vòng 3-5 năm tới.
Một bên tăng trưởng theo cấp số nhân, một bên leo dốc tuyến tính, khoảng cách ở giữa chính là vị trí mà InnoGrit muốn đặt chân vào.
Khó khăn hơn nữa là, việc triển khai mô hình có tốt hay không, người ngoài rất khó đánh giá.
Một yêu cầu được gửi đi, mô hình phản hồi bình thường, nhưng độ chính xác của đầu ra có thể đã âm thầm giảm 30%. Những vấn đề như vậy các hệ thống giám sát thông thường không thể phát hiện ra.
Đến khi người dùng nhận ra sự bất thường trong nghiệp vụ, thì thương hiệu của mô hình đó đã bị hủy hoại.
Ngưỡng cửa vô hình này mới là thứ quyết định thực sự xem nhà cung cấp nào có thể trụ lại trên bàn cờ.
Tại sao các mô hình lớn trong nước lại ưu tiên chọn InnoGrit?
Kể từ khi nền kinh tế Token bùng nổ toàn diện, nhu cầu suy luận đang tăng tốc, khoảng trống về sức mạnh tính toán cũng liên tục mở rộng.
Nhưng ngưỡng cửa của lĩnh vực kinh doanh MaaS (Model-as-a-Service) cao hơn nhiều so với tưởng tượng của thế giới bên ngoài.
Tại sao Kimi, Zhipu AI, MiniMax và StepFun đều gật đầu đồng ý? Tất nhiên họ có những tính toán riêng, nhưng về bản chất, họ đang cùng đặt cược vào ba yếu tố —
Ví dụ: Hiệu quả mô hình có bị giảm sút không, chi phí có chịu nổi không, và khi xảy ra sự cố có ổn định được không.
Trước hết là về hiệu quả.
Sự sụt giảm ngầm như đã đề cập ở trên là điều đau đầu nhất trong ngành này.
Có những nhà cung cấp bên thứ ba sau khi triển khai mô hình đã khiến độ chính xác giảm 30% so với bản gốc mà khách hàng thậm chí không nhận ra, cho đến khi các chỉ số kinh doanh bắt đầu đi xuống mới quay lại kiểm tra.
Cách làm của InnoGrit trong việc này là thiết lập một bộ tiêu chuẩn kiểm thử đầu vào.
Bộ tiêu chuẩn này sẽ kiểm tra từng hạng mục, từ tính nhất quán của việc gọi công cụ (tool calling) đến sự căn chỉnh độ chính xác của chế độ suy luận. Mỗi mô hình mới trước khi lên kệ đều phải vượt qua cửa ải này.
Kết quả là, khách hàng dù sử dụng API của InnoGrit hay của nhà sản xuất gốc thì trải nghiệm gần như không có sự khác biệt.
Tiếp theo là về chi phí.
Tại WAIC năm nay, InnoGrit đã công bố một công nghệ lõi tự phát triển — Tách biệt PD (Prefill-Decode) không đồng nhất xuyên cụm.

Prefill và Decode trong suy luận mô hình lớn là hai giai đoạn có tải trọng hoàn toàn khác nhau, yêu cầu phần cứng cũng khác nhau. Việc triển khai tách biệt cho phép các loại chip khác nhau thực hiện công việc mà chúng giỏi nhất.
Tuy nhiên, sau khi tách ra các phòng máy khác nhau, sẽ gặp phải một vấn đề mới.
Sau khi tách PD, cần truyền KV Cache giữa các chip không đồng nhất qua mạng WAN Ethernet, đối mặt với tình trạng băng thông thấp và độ trễ cao. Điều này giống như hai vận động viên tiếp sức đều chạy rất xuất sắc, nhưng khi trao gậy lại gặp sự cố.
Vì vậy, InnoGrit trước tiên đã di chuyển công nghệ Radix Cache được thiết kế cho các instance Decode vào kiến trúc xuyên cụm này một cách sáng tạo, giúp giảm trực tiếp lượng dữ liệu truyền tải xuống một bậc độ lớn.
Tiếp đó, họ tiên phong tạo ra kiến trúc PDD, chia chuỗi PD truyền thống thành ba cấp: P, RelayDecode và MainDecode.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.