Artificial Intelligence News
85

Tin ngành

Alibaba và DeepSeek châm ngòi cuộc đua giảm giá mô hình AI tại Trung Quốc

(giờ Việt Nam)

Tóm tắt AI

Alibaba vừa ra mắt Qwen3.8-Max với 2,4 nghìn tỷ tham số, trong khi DeepSeek gây chú ý với mức giá suy luận cực rẻ, thúc đẩy cuộc đua tối ưu chi phí trong ngành AI Trung Quốc.

Bản dịch AI

Alibaba, DeepSeek push China’s AI model race towards lower costs

Alibaba vừa ra mắt Qwen3.8-Max, mô hình AI lớn nhất từ trước đến nay của hãng, trong khi mô hình V4-Flash mới nhất của DeepSeek đang thu hút sự chú ý nhờ mức giá suy luận (inference pricing) thấp hơn so với nhiều hệ thống cạnh tranh.

Qwen3.8-Max sở hữu 2,4 nghìn tỷ tham số và sử dụng kiến trúc mixture-of-experts (hỗn hợp chuyên gia), chỉ kích hoạt một phần mô hình cho mỗi yêu cầu. Alibaba cho biết có khoảng 95 tỷ tham số được kích hoạt tại một thời điểm, giúp giảm chi phí và độ trễ phản hồi so với việc kích hoạt toàn bộ mô hình.

DeepSeek sử dụng kiến trúc thưa (sparse architecture) tương tự ở quy mô nhỏ hơn. Artificial Analysis liệt kê V4-Flash có tổng cộng 284 tỷ tham số, với 13 tỷ tham số hoạt động trong quá trình suy luận, trong khi Kimi K3 của Moonshot AI có tổng cộng 2,8 nghìn tỷ tham số và khoảng 104 tỷ tham số hoạt động.

Qwen3.8-Max có khả năng xử lý văn bản, hình ảnh, video và hỗ trợ ngữ cảnh lên đến một triệu token. Alibaba cũng cho biết mô hình này đã hoàn thành một dự án kỹ thuật phần mềm trong vòng 16 ngày.

Quy mô của nó tương đương với Kimi K3 mà Moonshot AI đã phát hành vào tháng 7. Hai công ty này cũng đang cạnh tranh về giá, với Qwen3.8-Max có giá 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra, so với mức giá lần lượt là 3 USD và 15 USD của Kimi K3.

Kích thước mô hình không phải là yếu tố duy nhất quyết định chi phí suy luận. Kiến trúc, số lượng tham số hoạt động, mức tiêu thụ token và số lượng lệnh gọi cần thiết để hoàn thành một tác vụ cũng ảnh hưởng đến chi phí vận hành của mô hình.

Qwen3.8-Max đã vươn lên vị trí dẫn đầu trong số các mô hình văn bản của Trung Quốc trên nền tảng so sánh cộng đồng Arena.AI sau khi ra mắt, mặc dù vẫn xếp sau một số mô hình của Anthropic trong bảng xếp hạng tổng thể. Nó cũng đứng thứ hai trên bảng xếp hạng của Arena.AI dành cho các mô hình phân tích hình ảnh và tài liệu trực quan khác, xếp sau một biến thể của Claude Fable 5 từ Anthropic.

DeepSeek thúc đẩy giảm giá suy luận

DeepSeek đã áp dụng một cách tiếp cận khác với V4-Flash. Thay vì chạy đua theo quy mô tổng thể của các mô hình mới nhất từ Alibaba và Moonshot AI, hãng đã định giá mô hình này thấp hơn nhiều hệ thống AI phổ biến.

Theo Artificial Analysis, V4-Flash có giá 0,14 USD cho mỗi triệu token đầu vào và 0,28 USD cho mỗi triệu token đầu ra. Công ty nghiên cứu này liệt kê mô hình có cửa sổ ngữ cảnh một triệu token và tổng cộng 284 tỷ tham số, trong đó 13 tỷ tham số hoạt động trong quá trình suy luận.

Artificial Analysis liệt kê mức giá cache-hit là 0,003 USD cho mỗi triệu token đối với phiên bản Max Effort của V4-Flash, thấp hơn 98% so với mức giá đầu vào tiêu chuẩn. Dữ liệu đầu vào được lưu trong bộ nhớ đệm (cached input) bao gồm các ngữ cảnh đã xử lý trước đó, có thể được tái sử dụng cho các yêu cầu tiếp theo.

Mức giá token thấp hơn của DeepSeek cũng được thể hiện qua các bài kiểm tra đánh giá của Artificial Analysis. Reuters đưa tin rằng công ty nghiên cứu này ước tính chi phí trung bình của V4-Flash là ba xu cho mỗi bài kiểm tra, so với 86 xu cho Kimi K3, 1,86 USD cho GPT-5.6 Sol của OpenAI và 3,15 USD cho Claude Fable 5 của Anthropic.

Phép so sánh này tính đến lượng đầu vào và đầu ra mà mỗi mô hình sử dụng để hoàn thành bài kiểm tra. Mức giá trên mỗi token thấp hơn không nhất thiết dẫn đến chi phí tác vụ thấp hơn nếu mô hình tạo ra nhiều đầu ra hơn hoặc yêu cầu thêm các tương tác bổ sung.

Artificial Analysis đã chấm cho phiên bản suy luận Max Effort của DeepSeek V4-Flash số điểm 40 trên Chỉ số Thông minh (Intelligence Index) của họ. Công ty nghiên cứu cũng ghi nhận tốc độ đầu ra khoảng 118 token mỗi giây trong quá trình thử nghiệm.

Giá token chỉ phản ánh một phần câu chuyện về chi phí

Kimi K3 của Moonshot AI cung cấp một ví dụ khác về việc giá API được quảng cáo có thể khác biệt như thế nào so với chi phí thực tế để hoàn thành các khối lượng công việc dài hơn. Artificial Analysis liệt kê mô hình này ở mức 3 USD cho mỗi triệu token đầu vào và 15 USD cho mỗi triệu token đầu ra, với dữ liệu đầu vào được lưu trong bộ nhớ đệm có giá 0,30 USD cho mỗi triệu token.

Trên bài kiểm tra AA-Briefcase của Artificial Analysis dành cho công việc tri thức mang tính đại lý (agentic knowledge work), Kimi K3 có chi phí trung bình 10,57 USD cho mỗi tác vụ. Nó tạo ra khoảng 120.000 token đầu ra và sử dụng trung bình 83 lượt tương tác cho mỗi tác vụ.

Artificial Analysis cho biết chi phí này phản ánh giá token, khối lượng đầu ra và số lượng tương tác của mô hình Kimi K3. Do đó, việc gọi mô hình lặp đi lặp lại và tạo ra đầu ra lớn hơn có thể làm tăng tổng chi phí hoàn thành khối lượng công việc vượt xa mức giá API tiêu đề.

Kimi K3 đã ghi nhận số điểm tổng thể cao thứ hai trên bảng đánh giá AA-Briefcase tại thời điểm thử nghiệm, xếp sau Claude Fable 5. Nó cũng đạt 57 điểm trên Chỉ số Thông minh rộng hơn của Artificial Analysis.

Sự so sánh với DeepSeek cho thấy lý do tại sao các phép đo chi phí trên mỗi tác vụ lại bổ sung ngữ cảnh hữu ích cho việc định giá API tiêu chuẩn. Các mô hình với kiến trúc và mô hình sử dụng khác nhau có thể tiêu thụ lượng tài nguyên tính toán và token khác biệt đáng kể khi thực hiện cùng một loại tác vụ.

Trọng số mở (open weights) bổ sung thêm một tùy chọn triển khai

Chi phí cũng đang được định hình bởi cách các nhà phát triển Trung Quốc phân phối mô hình của họ. Alibaba, DeepSeek và Moonshot AI vẫn tiếp tục hỗ trợ các bản phát hành trọng số mở song song với quyền truy cập API được lưu trữ, mang đến cho các nhà phát triển nhiều lựa chọn hơn về cách triển khai mô hình.

Artificial Analysis liệt kê DeepSeek V4-Flash là một mô hình trọng số mở theo giấy phép MIT, với các trọng số có sẵn thông qua Hugging Face. Kimi K3 cũng có sẵn dưới dạng mô hình trọng số mở theo giấy phép riêng của Moonshot AI.

Trọng số mở cho phép các nhà phát triển chạy mô hình trên cơ sở hạ tầng của riêng họ hoặc thông qua các nhà cung cấp bên thứ ba thay vì chỉ dựa vào dịch vụ suy luận do nhà phát triển lưu trữ. Chi phí triển khai vẫn phụ thuộc vào phần cứng và cơ sở hạ tầng được sử dụng, nhưng quyền truy cập vào mô hình không bị ràng buộc với một API lưu trữ duy nhất.

Cách tiếp cận này khác với các mô hình chính được cung cấp bởi OpenAI, Anthropic và Google, vốn thường giữ kín trọng số mô hình của họ.

Lian Jye Su, chuyên gia phân tích chính tại Omdia, cho biết việc lựa chọn mô hình cho nhiều khối lượng công việc kinh doanh không chỉ phụ thuộc vào việc có quyền truy cập vào hệ thống hiệu suất cao nhất.

"Nhiều quy trình làm việc kinh doanh không cần đến mô hình tốt nhất của ngành," Su nói. "Họ cần những mô hình đủ tốt, giá cả phải chăng, minh bạch và dễ tiếp cận, và các mô hình trọng số mở giúp đáp ứng nhu cầu đó."

(Ảnh: Solen Feyissa)

Xem thêm: Alibaba đang thiết kế chip AI xoay quanh các tác nhân (agents), và điều đó thay đổi bản chất thực sự của cuộc đua này.

Banner for AI & Big Data Expo by TechEx events.

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy tham khảo AI & Big Data Expo diễn ra tại Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác bao gồm Cyber Security & Cloud Expo. Nhấp vào đây để biết thêm thông tin.

AI News được vận hành bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới tại đây.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.