Mô hình
Z.ai ra mắt GLM-5.3-Flash: Mô hình MoE đa phương thức 320B, hỗ trợ cửa sổ ngữ cảnh 1 triệu token
(giờ Việt Nam)
Tóm tắt AI
Z.ai trình làng GLM-5.3-Flash, mô hình đa phương thức gốc với 320 tỷ tham số, hỗ trợ xử lý hình ảnh, video và cửa sổ ngữ cảnh lên tới 1 triệu token, hiện đã mở mã nguồn theo giấy phép MIT.
Bản dịch AI

Z.ai vừa ra mắt GLM-5.3-Flash, mô hình đa phương thức (multimodal) thuần túy đầu tiên trong dòng GLM-5 và là mô hình lập trình có năng lực mạnh mẽ nhất với chi phí rẻ nhất mà phòng thí nghiệm này từng phát hành. Đây là mô hình mixture-of-experts với tổng cộng 320 tỷ tham số và 18 tỷ tham số hoạt động trên mỗi token, sở hữu cửa sổ ngữ cảnh 1.048.576 token, hỗ trợ đầu vào là hình ảnh và video — được phát hành theo giấy phép MIT với trọng số (weights) có sẵn trên Hugging Face. Theo báo cáo từ Z.ai, mô hình này vượt trội hơn GLM-5.2 trong các bài kiểm tra đánh giá (benchmarks) và khối lượng công việc thực tế với mức giá chỉ bằng khoảng một phần mười, đồng thời đạt kết quả chênh lệch chưa đầy nửa điểm so với Claude Opus 4.8 trong bài kiểm tra lập trình nội bộ. Mô hình này đã dành tuần đầu tiên chạy ẩn danh dưới tên gọi “Ox Alpha” trên OpenCode và OpenRouter, được vận hành hoàn toàn trên các chip AI do Trung Quốc sản xuất trong nước.
Liệu mô hình này có thể triển khai được không?
Có, theo hai hướng. Các trọng số đã có sẵn trên Hugging Face theo giấy phép MIT, và một API được lưu trữ (hosted API) cũng đã có bảng giá và đang hoạt động.
Kiến trúc chính là yếu tố tạo nên hiệu suất
GLM-5.3-Flash bắt đầu từ một mô hình cơ sở mới được huấn luyện trên tập dữ liệu đa phương thức quy mô 30 nghìn tỷ token. Có ba thay đổi đáng chú ý:
Các bài kiểm tra đánh giá (Benchmarks)
Hầu hết các con số được đề cập trong bảng dưới đây đều do Z.ai báo cáo và các bộ công cụ kiểm tra (harnesses) khác nhau tùy theo từng bài test — các chú thích trong thẻ mô hình (model card) đã chỉ rõ nhiệt độ (temperature), giới hạn ngữ cảnh và các mô hình giám khảo (judge models) cho từng benchmark, vì vậy hãy xem việc so sánh giữa các mô hình là phụ thuộc vào thiết lập cụ thể.
Một cách độc lập, Artificial Analysis chấm mô hình này 57 điểm trên Intelligence Index, với tốc độ 48,7 token đầu ra/giây và 1,52 giây TTFT trên API của Z.ai — đây là tỷ lệ trí thông minh trên mỗi đô la rất mạnh mẽ, nhưng tốc độ phản hồi còn chậm và văn phong khá dài dòng. Thị giác (Vision) là điểm yếu: mô hình này vẫn xếp sau Gemini 3.7 Flash trong các bài kiểm tra BabyVision và MVbench.
Câu chuyện về khả năng phục vụ (serving) là phần ít được nhắc đến
Z.ai cho biết toàn bộ bản xem trước Ox Alpha chạy trên các chip AI do Trung Quốc sản xuất trong nước, sử dụng một engine tùy chỉnh dựa trên SGLang giúp phân tách quá trình mã hóa (encoding), tiền nạp (prefill) và giải mã (decoding), đồng thời báo cáo mức cải thiện hiệu suất phục vụ tổng thể (end-to-end) gấp 3 lần trên hàng chục nghìn bộ tăng tốc (accelerators).
Giá cả và quyền truy cập
Giá API tiêu chuẩn là 0,15 USD/triệu token đầu vào, 0,03 USD/triệu token đầu vào đã lưu vào bộ nhớ đệm (cached input), và 0,50 USD/triệu token đầu ra. Z.ai báo cáo đạt 57 điểm trên Artificial Analysis Intelligence Index v4.1.1 với mức giá 0,045 USD mỗi tác vụ ở gói giảm giá. Mô hình hiện đã khả dụng cho tất cả các gói GLM Coding Plan — Lite (18 USD/tháng), Pro (80 USD), Max (168 USD) — với hạn mức sử dụng gấp 3 lần so với GLM-5.3, và các khả năng đa phương thức của nó được tích hợp vào ZCode thông qua Browser Use và Computer Use. Việc phục vụ cục bộ (local serving) được hỗ trợ trên SGLang, vLLM, TokenSpeed và KTransformers.
Những điểm chính cần lưu ý
Hãy xem qua Model Weights và Blog. Ngoài ra, đừng quên theo dõi chúng tôi trên Twitter, tham gia cộng đồng 150k+ ML SubReddit và đăng ký nhận bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến (webinar), v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy (machine learning) và học sâu (deep learning) một cách chuẩn xác về mặt kỹ thuật nhưng vẫn dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với công chúng.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.