The Decoder: AI News
88

Mô hình

Ra mắt GLM-5.3-Flash: 320 tỷ tham số, cửa sổ ngữ cảnh triệu token với chi phí siêu rẻ

(giờ Việt Nam)

Tóm tắt AI

Z.ai vừa trình làng GLM-5.3-Flash, mô hình mã nguồn mở chạy hoàn toàn trên chip nội địa với hiệu suất ngang ngửa GPU Nvidia nhưng chi phí vận hành chỉ bằng 1/7,5 so với bản tiền nhiệm.

Bản dịch AI

Mô hình GLM-5.3-Flash mới của Z.ai mang lại giá trị vượt trội so với chi phí, đi kèm với những điểm yếu rõ ràng và mang đến một góc nhìn đáng chú ý về cơ sở hạ tầng.

Theo Z.ai, GLM-5.3-Flash là mô hình đa phương thức (multimodal) thuần túy đầu tiên trong dòng GLM-5. Mô hình này có tổng cộng 320 tỷ tham số, trong đó chỉ có 18 tỷ tham số hoạt động, được phát hành dưới giấy phép MIT và cung cấp cửa sổ ngữ cảnh (context window) lên tới một triệu token. Trọng số của mô hình hiện đã có sẵn trên Hugging Face.

Các phép đo từ Artificial Analysis cho thấy mô hình đạt 57 điểm trên Chỉ số Thông minh (Intelligence Index) ở mức nỗ lực suy luận tối đa. Con số này chỉ kém 3 điểm so với phiên bản GLM-5.3 lớn hơn (đạt 60 điểm) và ngang bằng với GPT-5.6 Terra và Muse Spark 1.2.

Mức giá là điểm nổi bật nhất. Chi phí cho mỗi tác vụ trên chỉ số này là 0,09 đô la, so với 0,68 đô la của GLM-5.3, rẻ hơn khoảng 7,5 lần. Theo Artificial Analysis, điều này đưa mô hình vào biên Pareto về trí tuệ và chi phí, đồng thời bổ sung nó vào danh sách ngày càng dài các mô hình Trung Quốc gần đây đã gây áp lực lớn về giá lên các nhà cung cấp phương Tây.

Trên API của Z.ai, GLM-5.3-Flash có giá 0,15 đô la cho mỗi triệu token đầu vào và 0,50 đô la cho mỗi triệu token đầu ra, chỉ bằng hơn mười phần trăm giá của GLM-5.3. Đối với các tác vụ đại lý (agentic tasks), mô hình này bắt kịp người anh em lớn hơn của mình. Trên GDPval-AA v2, nó đạt điểm Elo khoảng 1770, ngang bằng với GLM-5.3 và Grok 4.6, và chỉ đứng sau Claude Opus 5. Tuy nhiên, nó vẫn kém hiệu quả hơn về token. Artificial Analysis phát hiện ra rằng khoảng 90 phần trăm số token đầu ra mà nó tiêu thụ được dùng cho việc suy luận.

Chip Trung Quốc thay vì Nvidia

Trước khi ra mắt, Z.ai đã thử nghiệm mô hình ẩn danh dưới tên "ox-alpha" trên OpenCode và OpenRouter, nơi nó trở thành mô hình phổ biến nhất trong tuần. Điều thú vị là theo Z.ai, toàn bộ lưu lượng truy cập đó đều chạy trên các chip AI của Trung Quốc.

SemiAnalysis báo cáo rằng hệ thống đã xử lý 100 nghìn tỷ token mỗi ngày, một mức công suất mà cho đến nay chỉ được coi là khả thi đối với các phòng thí nghiệm tiên phong. Z.ai cho biết hiệu suất phần cứng và chi phí trên mỗi token của họ ngang bằng với các GPU Nvidia phổ biến. SemiAnalysis coi đây là một bài kiểm tra khác đối với "hào kỹ thuật CUDA", tiếp nối các kết quả gần đây từ chip mới của OpenAI.

CUDA là lớp lập trình của Nvidia nằm giữa phần mềm AI và card đồ họa. Nó đã phát triển trong gần 20 năm và hầu như mọi khung làm việc (framework) AI đều được tinh chỉnh cho nó. Việc chuyển sang các loại chip khác đồng nghĩa với việc phải làm lại công việc đó, lập trình lại các thao tác tính toán, điều chỉnh quyền truy cập bộ nhớ và truy tìm các điểm nghẽn.

Vì vậy, Z.ai đã xây dựng phần mềm phục vụ (serving software) riêng trên nền tảng SGLang và chia quá trình xử lý thành các giai đoạn có thể mở rộng độc lập. Nhóm nghiên cứu cho biết điều này đã tăng gấp ba lần thông lượng so với nỗ lực đầu tiên trên cùng phần cứng. Một đại lý dựa trên GLM-5.3 đã hỗ trợ quá trình tối ưu hóa này.

Tin tức AI không thổi phồng – Được tuyển chọn bởi con người

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo tiên phong "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.

Đăng ký ngay

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.