# Moore Threads hỗ trợ Day-0 cho mô hình GLM-5.3-Flash của Zhipu AI

- Nguồn: IT Home
- Thời gian phát hành: 2026-08-27 17:26 (giờ Việt Nam)
- Điểm AI: 39/100
- Link AIHOT.vn: https://aihot.vn/items/530d326e3f353f22
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtbfs3sl0v1troampg71it1y
- Link gốc: https://www.ithome.com/0/995/237.htm

## Tóm tắt AI

Moore Threads đã tối ưu hóa dòng card đồ họa MTT S5000 để hỗ trợ mô hình đa phương thức GLM-5.3-Flash, giúp tăng cường hiệu suất suy luận cho các ngữ cảnh dài thông qua kiến trúc MUSA.

## Thân bài

Theo tin từ IT ngày 27 tháng 8, Zhipu gần đây đã ra mắt và mã nguồn mở GLM-5.3-Flash (320B-A18B). Moore Threads hôm nay chính thức thông báo rằng, dựa trên card tính toán thông minh tích hợp huấn luyện và suy luận AI MTT S5000 cùng ngăn xếp phần mềm MUSA, họ đã hỗ trợ Day-0, hiện thực hóa việc thích ứng cực nhanh và vận hành hiệu quả mô hình này.

Theo giới thiệu, là mô hình đa phương thức gốc đầu tiên của dòng GLM-5, GLM-5.3-Flash có tổng tham số là 320B, tham số kích hoạt chỉ 18B. Mô hình này đạt 57 điểm trong chỉ số Artificial Analysis Intelligence Index (AA) uy tín toàn cầu, lọt vào phân khúc năng lực mô hình tiên tiến thế giới, ngang bằng với điểm số của Claude Opus 4.8, mô hình phổ biến nhất của Anthropic. Trong đánh giá trải nghiệm thực tế Z.ai Code Bench tự phát triển, hiệu suất lập trình của nó tương đương với Claude Opus 4.8.

![图片](https://img.ithome.com/newsuploadfiles/2026/8/854bbb86-a9aa-4f28-8269-52fb2d41f737.png?x-bce-process=image/format,f_auto)

Trước đó, mô hình này đã được thử nghiệm công khai ẩn danh trên OpenCode và OpenRouter với mật danh Ox-Alpha (biệt danh cộng đồng là "Niu Lai"). Nhờ tốc độ suy luận vượt trội và hiệu suất thông minh, nó đã nhanh chóng trở thành mô hình được yêu thích nhất trong tuần đó, thiết lập kỷ lục mới về lưu lượng gọi API trên cả hai nền tảng.

Ngay trong ngày GLM-5.3-Flash ra mắt, đội ngũ kỹ thuật của Moore Threads đã hoàn thành việc phân tách kiến trúc mô hình, phân tích kỹ thuật cốt lõi và rà soát các toán tử điển hình. Đối với cơ chế KDA được sử dụng trong cơ chế chú ý tuyến tính (linear attention) của kiến trúc hỗn hợp này, đội ngũ đã dựa trên công cụ tối ưu hóa toán tử MATE để nhanh chóng hoàn thành việc tùy chỉnh và tinh chỉnh chuyên sâu các dạng toán tử mới như cập nhật ma trận trạng thái, quét song song phân khối, đồng thời phối hợp sâu và kết nối liền mạch với hệ thống quản lý bộ nhớ đệm SGLang-MUSA, từ đó giải phóng lợi thế hiệu quả của KDA trong suy luận ngữ cảnh dài.

![图片](https://img.ithome.com/newsuploadfiles/2026/8/8ee9d8a3-98a8-45cb-90f8-ef643ea485c7.png?x-bce-process=image/format,f_auto)

IT đính kèm địa chỉ mã nguồn mở của GLM-5.3-Flash:

https://huggingface.co/zai-org/GLM-5.3-Flash

Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết có chứa liên kết ngoài của IT đều bao gồm tuyên bố này.
