Mô hình
Zhipu ra mắt mô hình đa phương thức GLM-5.3-Flash: Hiệu năng ngang ngửa Claude Opus với giá siêu rẻ
(giờ Việt Nam)
Tóm tắt AI
Zhipu giới thiệu GLM-5.3-Flash, mô hình đa phương thức 320B với 18B tham số kích hoạt, đạt hiệu suất tương đương Claude Opus 4.8 nhưng có mức giá chỉ bằng 1/40.
Bản dịch AI
Theo tin từ IT ngày 26 tháng 8, tối nay Zhipu đã ra mắt và mã nguồn mở GLM-5.3-Flash (320B-A18B), đây là mô hình đa phương thức (multimodal) thuần túy đầu tiên thuộc dòng GLM-5. Mô hình này có tổng số tham số là 320B (320 tỷ), với số tham số kích hoạt chỉ là 18B (18 tỷ).

Trước khi chính thức phát hành, Zhipu đã tiến hành thử nghiệm quy mô lớn trên OpenCode và OpenRouter dưới tên mô hình ẩn danh Ox-Alpha (cộng đồng Trung Quốc gọi là "Niu Lai"). Ox-Alpha nhanh chóng trở thành mô hình phổ biến nhất trong tuần đó, thiết lập kỷ lục mới về lưu lượng truy cập trên cả hai nền tảng. Đáng chú ý, toàn bộ lưu lượng yêu cầu này đều được hỗ trợ sức mạnh tính toán bởi các chip nội địa.


Khả năng của GLM-5.3-Flash vượt trội hơn GLM-5.2, đạt 57 điểm trong chỉ số Artificial Analysis Intelligence Index (AA) uy tín toàn cầu, lọt vào nhóm các mô hình tiên tiến hàng đầu thế giới, ngang bằng với điểm số của Claude Opus 4.8 – mô hình phổ biến nhất của Anthropic. Trong đánh giá trải nghiệm thực tế Z.ai Code Bench, hiệu suất lập trình của nó cũng tương đương với Claude Opus 4.8.

Đồng thời, giá của GLM-5.3-Flash được định mức bằng 1/10 so với GLM-5.3, trong thời gian giảm giá giới hạn chỉ bằng 1/20 so với GLM-5.3 và bằng 1/40 so với Opus 4.8.


Phía chính thức cho biết, trong các bài kiểm tra chuẩn và sử dụng thực tế, GLM-5.3-Flash vượt trội toàn diện so với GLM-5.2 dù có số tham số cao gấp đôi, trong khi giá thành chỉ bằng 1/10 so với mô hình này.
Theo giới thiệu, điều này có được là nhờ kiến trúc mô hình hoàn toàn mới. Kiến trúc của GLM-5.3-Flash được thiết kế chuyên biệt cho chi phí cực thấp, tổng số tham số tương đương với GLM-4.5 (355B so với 320B), nhưng số tham số kích hoạt (32B → 18B) và số lớp (92 → 45) đã giảm gần một nửa. Kết hợp với kho dữ liệu tiền huấn luyện đa phương thức 30T Token mới nhất, GLM-5.3-Flash có thể đạt hiệu suất mạnh mẽ hơn với ít tài nguyên tính toán hơn.
GLM-5.3-Flash cũng thực hiện nhiều nâng cấp kiến trúc, là mô hình tiên tiến mã nguồn mở đầu tiên áp dụng kiến trúc lai giữa cơ chế chú ý thưa (sparse attention) và cơ chế chú ý tuyến tính (linear attention), giúp giảm đáng kể chi phí dịch vụ cho ngữ cảnh dài trong khi vẫn duy trì khả năng xử lý ngữ cảnh dài chính xác; đồng thời sử dụng kết nối siêu cấp ràng buộc đa tạp (Manifold-Constrained Hyper-Connections, mHC) để nâng cao khả năng mở rộng (Scaling) của mô hình.
Phía chính thức cho biết, khả năng thị giác của GLM-5.3-Flash được tích hợp thuần túy vào vòng lặp Coding, cho phép mô hình chủ động quan sát giao diện, kết quả render và phản hồi tương tác, từ đó liên tục thử nghiệm và cải tiến. Dù là phát triển front-end, xây dựng game, cảnh 3D trên Blender, hay vận hành môi trường thực tế được điều khiển bởi BUA, CUA, mô hình đều có thể phối hợp hoàn thành nhiệm vụ giữa mã nguồn, trình duyệt và giao diện đồ họa.
GLM-5.3-Flash tiếp tục mở rộng sang các kịch bản công việc như Office, nghiên cứu tài chính và tài liệu chuyên môn. Nó có khả năng tự phân tách các mục tiêu phức tạp, gọi các công cụ phù hợp, kiểm tra và tối ưu hóa đầu ra, hoàn thành quy trình làm việc trọn vẹn từ nghiên cứu phân tích, xây dựng mô hình đến bàn giao thành phẩm dưới dạng PPTX, PDF, DOCX, XLSX.
GLM-5.3-Flash chính thức mở mã nguồn cho toàn cầu, đã được tích hợp vào các nền tảng lập trình như ZCode, đồng thời đưa vào GLM Coding Plan (phát hành giới hạn 10.000 thẻ trải nghiệm mỗi ngày) và mở quyền truy cập API đồng bộ.
IT đính kèm các liên kết liên quan:
Nền tảng mở BigModel: https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
Z.ai: https://docs.z.ai/guides/vlm/glm-5.3-flash
GLM Coding Plan: https://bigmodel.cn/glm-coding
HuggingFace: https://huggingface.co/zai-org/GLM-5.3-Flash
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.