‹ Quay lạiTinh chọnĐiểm AI 74/100
Zhipu AI: Nghiên cứu (Dữ liệu nhúng trên web)
Tinh chọnĐiểm AI 74/100

Mô hình

Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp

(giờ Việt Nam)

Tóm tắt AI

Zhipu vừa phát hành GLM-5.3-Flash, mô hình đa phương thức đầu tiên trong dòng GLM-5 với hiệu suất ngang ngửa Claude Opus 4.8 nhưng giá thành chỉ bằng 1/40, đồng thời đánh dấu bước tiến lớn khi vận hành trên hạ tầng chip nội địa.

Chính văn · Bản dịch AI

Hôm nay, chúng tôi ra mắt và mã nguồn mở GLM-5.3-Flash (320B-A18B), đây là mô hình đa phương thức (multimodal) thuần túy đầu tiên thuộc dòng GLM-5.

Mọi người dường như đã quen với việc gắn liền trí tuệ tiên phong với mức giá đắt đỏ, và coi đó là cái giá tất yếu phải trả cho sự tiến bộ công nghệ. Hôm nay, GLM-5.3-Flash đã xuất hiện: với tổng tham số 320B, năng lực vượt trội hơn GLM-5.2, đạt 57 điểm trong chỉ số Artificial Analysis Intelligence Index (AA) uy tín toàn cầu, lọt vào phân khúc năng lực mô hình tiên phong thế giới, ngang bằng với điểm số của Claude Opus 4.8 – mô hình phổ biến nhất của Anthropic. Trong đánh giá thực tế trên Z.ai Code Bench do chúng tôi tự phát triển, hiệu suất lập trình của nó tương đương với Claude Opus 4.8.

Đồng thời, GLM-5.3-Flash có mức giá chỉ bằng 1/10 so với GLM-5.3, trong thời gian giảm giá giới hạn chỉ bằng 1/20 GLM-5.3 và bằng 1/40 so với Opus 4.8. Cùng một trí tuệ, mức giá chỉ bằng 1/40, trí tuệ tiên phong, lần đầu tiên bạn không cần phải dè sẻn khi sử dụng.

Để thu thập phản hồi rộng rãi và chuyên sâu từ người dùng, trước khi phát hành chính thức, chúng tôi đã tiến hành thử nghiệm quy mô lớn trên OpenCode và OpenRouter dưới tên mô hình ẩn danh Ox-Alpha (cộng đồng Trung Quốc gọi là "Ngưu Lai"). Ox-Alpha nhanh chóng trở thành mô hình được yêu thích nhất trong tuần, thiết lập kỷ lục mới về lưu lượng truy cập trên cả hai nền tảng. Toàn bộ lưu lượng yêu cầu này đều được hỗ trợ sức mạnh tính toán bởi chip nội địa.

Trong các bài kiểm tra chuẩn (benchmark) và sử dụng thực tế, GLM-5.3-Flash vượt trội toàn diện so với GLM-5.2 dù có số lượng tham số gấp đôi, trong khi giá thành chỉ bằng 1/10. Điều này có được nhờ kiến trúc mô hình hoàn toàn mới. Kiến trúc của GLM-5.3-Flash được thiết kế chuyên biệt cho chi phí cực thấp, tổng tham số tương đương GLM-4.5 (355B so với 320B), nhưng tham số kích hoạt (32B → 18B) và số lớp (92 → 45) gần như giảm một nửa. Kết hợp với kho dữ liệu tiền huấn luyện đa phương thức 30T Token mới nhất của chúng tôi, GLM-5.3-Flash có thể đạt hiệu suất mạnh mẽ hơn với ít tài nguyên tính toán hơn.

GLM-5.3-Flash cũng thực hiện nhiều nâng cấp kiến trúc, là mô hình tiên phong mã nguồn mở đầu tiên áp dụng kiến trúc hỗn hợp giữa chú ý thưa (sparse attention) và chú ý tuyến tính (linear attention), giúp giảm đáng kể chi phí dịch vụ ngữ cảnh dài trong khi vẫn duy trì khả năng xử lý ngữ cảnh dài chính xác; đồng thời sử dụng các kết nối siêu cấp ràng buộc đa tạp (Manifold-Constrained Hyper-Connections, mHC) để nâng cao khả năng mở rộng (Scaling) của mô hình. Chi tiết kỹ thuật cụ thể xem tại Blog: https://z.ai/blog/glm-5.3-flash.

Kiến trúc chi phí cực thấp

Để giảm chi phí chú ý trong các kịch bản ngữ cảnh dài của mô hình, chúng tôi áp dụng kiến trúc hỗn hợp kết hợp giữa chú ý tuyến tính và chú ý thưa. Trong đó, chú ý tuyến tính nắm bắt các phụ thuộc cục bộ thông qua cơ chế đệ quy, còn chú ý thưa sử dụng bộ lập chỉ mục (indexer) nhẹ để truy xuất ngữ cảnh toàn cục. Chúng tôi giới thiệu IndexPool để giảm hơn nữa độ trễ và tiêu thụ bộ nhớ của bộ lập chỉ mục trong ngữ cảnh 1M, bằng cách nén 4 vector bộ nhớ đệm của bộ lập chỉ mục thành 1 thông qua gộp có trọng số (weighted pooling).

Để chứng minh hiệu quả kiến trúc, chúng tôi so sánh GLM-5.3-Flash với GLM-5.3, DeepSeek-V4-Flash và Kimi-K3, tập trung vào lượng tính toán trên mỗi Token và kích thước bộ nhớ đệm KV. Để so sánh công bằng giữa các mô hình có quy mô khác nhau, chúng tôi lần lượt hiển thị lượng tính toán chú ý trên mỗi Head, mỗi lớp và kích thước bộ nhớ đệm KV trung bình trên mỗi lớp (BF16). So với GLM-5.3, lượng tính toán chú ý và kích thước bộ nhớ đệm KV của GLM-5.3-Flash lần lượt giảm 3,01 lần và 4,44 lần.

Trong tất cả các mô hình cơ sở, GLM-5.3-Flash có lượng tính toán chú ý thấp nhất. Tuy nhiên, kích thước bộ nhớ đệm KV của nó vẫn cao hơn một chút so với Kimi-K3 và DeepSeek-V4-Flash, đây cũng là hướng chúng tôi sẽ tối ưu hóa thêm trong các công việc tiếp theo.

Phản hồi thị giác trong vòng lặp mã nguồn

GLM-5.3-Flash là mô hình đa phương thức thuần túy đầu tiên của dòng GLM-5. Mã hóa thị giác (Visual Coding) không chỉ là xử lý hình ảnh, mà còn mở rộng ranh giới mà lập trình có thể chạm tới. Đối với các tác vụ như phát triển giao diện người dùng (frontend), phát triển game, mô phỏng 3D, sản phẩm cuối cùng bao gồm các giao diện, tương tác hoặc thế giới ảo mà người dùng có thể cảm nhận được. Khả năng thị giác được tích hợp nguyên bản vào mô hình, cho phép nó tự chủ phán đoán khi nào cần "quan sát" và sử dụng phản hồi thị giác để hướng dẫn hành động tiếp theo.

Chúng tôi đã phát triển quy trình tổng hợp dữ liệu cho mã hóa thị giác, tập trung vào khả năng tự phán đoán thị giác và cải thiện trong quá trình kiểm thử của mô hình. Các quỹ đạo được tạo ra yêu cầu mô hình tương tác với môi trường, kiểm tra đầu ra của chính mình và thực hiện cải tiến lặp đi lặp lại. Trong lập trình frontend, chúng tôi cũng khám phá học tăng cường dựa trên phản hồi môi trường và thông qua xác thực Agent dựa trên quy trình người dùng thực tế để tăng cường khả năng phán đoán GUI. Điều này mở rộng phạm vi xác thực từ tính đúng đắn của chức năng sang hiệu ứng hiển thị và trải nghiệm tương tác.

Đáng ngạc nhiên là, Coding cung cấp cho mô hình một tác nhân để thể hiện và kiểm chứng kiến thức thế giới của nó. Việc xây dựng một cảnh quay nhất quán trong Blender đòi hỏi phải chuyển đổi kiến thức về hình học, vật liệu, ánh sáng và không gian thành một cấu trúc 3D nhất quán ở các góc nhìn khác nhau. Trong điều kiện không có bất kỳ tài liệu bên ngoài nào, GLM-5.3-Flash đã tự vận hành trong 16 giờ để dựng lên một căn hộ chuyên nghiệp của đầu bếp và bếp thử nghiệm rộng khoảng 400 mét vuông.

Trong ZCode, Browser Use Agent (BUA) và Computer Use Agent (CUA) mở rộng hơn nữa khả năng đa phương thức, cho phép mô hình phối hợp làm việc giữa mã nguồn, trình duyệt và giao diện đồ họa, đồng thời quan sát và xác thực kết quả đầu ra của chính mình – nhiều vấn đề chỉ bộc lộ trong quá trình hiển thị, tương tác hoặc chơi thử. Dưới đây là tổng hợp các thử nghiệm thực tế sử dụng GLM-5.3-Flash trong ZCode: từ hình ảnh đến dự án có thể chạy được, từ bộ phim hai giờ đến thành phẩm 8 phút, và các tài liệu chuyên nghiệp dành cho nhân viên văn phòng có thể bàn giao ngay.

Đối tác làm việc vượt xa Coding

Hiệu suất của GLM-5.3-Flash trong các công việc chuyên môn được cải thiện đáng kể so với các mô hình cùng cấp. Đối với các tác vụ văn phòng và tài liệu như PPTX, PDF, DOCX và XLSX, khả năng hiểu thị giác mới được bổ sung cho phép mô hình kiểm tra và tối ưu hóa đầu ra của chính mình, đồng thời có khả năng phán đoán thẩm mỹ tốt hơn. Mô hình cũng có thể so sánh kết quả đầu ra của mình với ngữ cảnh thị giác và kết quả mong đợi, từ đó đạt được khả năng tự xác thực và tối ưu hóa hiệu quả hơn – bao gồm đánh giá chất lượng trình bày và phán đoán thẩm mỹ chính xác hơn.

Chúng tôi tối ưu hóa chuyên biệt cho các công việc chuyên môn như tài chính, pháp lý. Về tài chính, GLM-5.3-Flash có thể bao quát toàn bộ quy trình từ nghiên cứu tài chính dựa trên nguồn tin, tạo báo cáo đến mô hình hóa và phân tích tài chính, cung cấp các căn cứ tham khảo có thể truy xuất trong suốt quá trình. Về pháp lý, nó có thể rà soát các điều khoản về chi phí, tài khoản và trách nhiệm trong hợp đồng, đồng thời ghi chú theo thông lệ của luật sư. Nó cũng có thể soạn thảo thư luật sư, hợp đồng và văn bản tố tụng, với định dạng và bố cục tuân thủ các quy chuẩn thực tế, có thể bàn giao ngay sau khi tạo.

Báo cáo nghiên cứu tài chính · Nhận xét kết quả kinh doanh

Văn bản pháp lý · Ghi chú và sửa đổi hợp đồng

Chạy trên chip nội địa

Trong tuần qua, lần đầu tiên chúng tôi thử nghiệm cung cấp dịch vụ trong lưu lượng truy cập quy mô lớn bằng cụm chip nội địa lớn, các chip này được kết nối thông qua mạng kết nối băng thông cao tự phát triển.

Để khắc phục vấn đề sức mạnh tính toán và dung lượng bộ nhớ của từng chip đơn lẻ tương đối hạn chế, chúng tôi đã xây dựng công cụ suy luận chuyên dụng dựa trên SGLang. Đáng chú ý là toàn bộ công việc xây dựng này được tăng tốc đáng kể bởi infra agent do GLM-5.3 điều khiển, nó hỗ trợ các kỹ sư phát triển và tối ưu hóa toán tử, chẩn đoán nút thắt hiệu suất, cải thiện ngăn xếp dịch vụ triển khai, tạo thành vòng lặp tích cực "mô hình tối ưu hóa hệ thống, hệ thống gánh vác mô hình".

Nút thắt chính của các chip này nằm ở dung lượng bộ nhớ và băng thông, đặc biệt là việc hỗ trợ độ dài ngữ cảnh lên tới 1M là một thách thức lớn. Điều này đòi hỏi chúng tôi phải thực hiện tối ưu hóa bộ nhớ quyết liệt nhắm vào kiến trúc tầng dưới, bao gồm các tối ưu hóa tùy chỉnh như đổi sức mạnh tính toán lấy băng thông, đổi giao tiếp lấy bộ nhớ đồ họa (VRAM). Ngăn xếp công nghệ của chúng tôi kết hợp song song tensor trong nút (intra-node tensor parallelism) cho chú ý tuyến tính và LM head, ReplaySSM, lượng tử hóa W8A8, lượng tử hóa bộ nhớ đệm hỗn hợp INT8/FP8/BF16, và các kỹ thuật như Layer Split.

Ở cấp độ cụm, chúng tôi áp dụng kiến trúc tách biệt Encode–Prefill–Decode (EPD) cấp sản xuất, chia nhỏ việc mã hóa đa phương thức, tiền điền (prefill) prompt và giải mã từng token thành các nhóm công việc có thể lập lịch độc lập, mở rộng/thu hẹp độc lập, từ đó đạt được dịch vụ hiệu quả và đáng tin cậy trên chip tăng tốc nội địa.

So với đường cơ sở ban đầu trên cùng phần cứng, hiệu suất dịch vụ end-to-end đã tăng 3 lần, hiệu quả phần cứng và chi phí trên mỗi token đã đạt mức tương đương với GPU NVIDIA chủ đạo. Điều này chứng minh rằng chip nội địa hoàn toàn có thể hỗ trợ nhu cầu suy luận của các mô hình tiên phong một cách hiệu quả và kinh tế trong các kịch bản quy mô lớn.

Hiện tại, GLM-5.3-Flash đã chính thức mở mã nguồn cho toàn cầu, đã kết nối với các nền tảng lập trình như ZCode, và được đưa vào GLM Coding Plan (phát hành giới hạn 10.000 thẻ trải nghiệm mỗi ngày), đồng thời mở API cho việc gọi hàm.

1. Kết nối API chính thức

2. Trải nghiệm trực tuyến

3. Agent

4. Blog

5. Liên kết mã nguồn mở

Bài viết được AI dịch và tổng hợp tự động từ Zhipu AI: Nghiên cứu (Dữ liệu nhúng trên web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Zhipu ra mắt mô hình đa phương thức thuần túy GLM-5.3-Flash
Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp | AIHOT.vn