Mô hình
Z.ai ra mắt GLM-5.3-Flash: Mô hình đa phương thức 1 triệu token, hiệu năng ngang ngửa Claude Opus
(giờ Việt Nam)
Tóm tắt AI
Z.ai vừa trình làng GLM-5.3-Flash, mô hình đa phương thức mã nguồn mở chạy trên chip nội địa Trung Quốc với cửa sổ ngữ cảnh 1 triệu token, hứa hẹn hiệu suất lập trình vượt trội với chi phí tối ưu.
Bản dịch AI
Một ngày yên ắng.
Tin tức AI từ 25/8/2026 đến 26/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn đăng ký/hủy đăng ký nhận email theo tần suất mong muốn!
Tóm tắt AI trên Twitter
Tin nổi bật: Ra mắt GLM 5.3 Flash và các phản ứng
Chuyện gì đã xảy ra
Z.ai đã chính thức ra mắt GLM-5.3-Flash, tiết lộ rằng mô hình "Ox Alpha" được giới thiệu trước đó chính là danh tính công khai của nó.
Các tuyên bố chính thức và chi tiết ra mắt
Tweet ra mắt chính thức của Z.ai là cơ sở thực tế: GLM-5.3-Flash được mô tả như sau:
Phân phối/tính khả dụng khi ra mắt:
Tuyên bố về hiệu suất tự công bố mạnh mẽ nhất đến từ luồng thảo luận về lập trình của Z.ai: trên Z.ai Code Bench, GLM-5.3-Flash “vượt trội rõ rệt so với GLM-5.2 ở mọi cấp độ nỗ lực và có hiệu suất ngang ngửa với Claude Opus 4.8”. Vì đây là kết quả đánh giá từ chính nhà phát triển, nó hữu ích nhưng cần được xem xét thận trọng hơn so với các đánh giá độc lập.
Một bài đăng hỗ trợ ra mắt tiếp theo từ AutoClaw đã định hình mô hình này phù hợp cho việc hiểu ngôn ngữ hình ảnh, tạo mã và các tác vụ đại lý (agentic) dài hạn, đồng thời đi kèm với các khoản tín dụng/hoàn tiền. Tuy nhiên, đây chủ yếu là thông tin triển khai thay vì bằng chứng kỹ thuật mới: Bài đăng ra mắt của AutoClaw.
Các đánh giá độc lập và định vị chi phí/hiệu suất
Đánh giá độc lập thực chất nhất trong tập hợp các tweet đến từ Artificial Analysis. Tóm tắt của họ: GLM-5.3-Flash đạt 57 điểm trên Chỉ số Trí tuệ của Artificial Analysis (Artificial Analysis Intelligence Index).
Các chỉ số được Artificial Analysis trích dẫn
Các so sánh được Artificial Analysis trích dẫn
Hiệu quả sử dụng token và sự kết hợp suy luận
Artificial Analysis lưu ý một sự đánh đổi thú vị:
Đây là một sắc thái quan trọng: khía cạnh kinh tế của mô hình trông rất tuyệt vời phần lớn là do giá token cực kỳ thấp, chứ không phải vì nó đặc biệt tiết kiệm token.
Đánh giá về tác vụ đại lý/công việc từ Artificial Analysis
Artificial Analysis cũng báo cáo rằng GLM-5.3-Flash mạnh hơn so với những gì các chỉ số kiến thức thô thể hiện trong các tác vụ đại lý:
Số liệu về kiến thức/ảo giác
Điều này gợi ý một chủ đề lặp đi lặp lại trong các phản ứng: GLM-5.3-Flash có thể mạnh hơn nhiều trong các quy trình làm việc thực tế về mã/đại lý so với kiến thức thực tế rộng lớn.
Chi tiết về kiến trúc và hệ thống
Một số phản ứng có hiểu biết về kỹ thuật đã cố gắng đảo ngược kỹ thuật hoặc tóm tắt những thay đổi từ GLM-5.2 / GLM-5.x.
Phân tích kiến trúc công khai chi tiết nhất trong tập hợp các tweet đến từ rasbt, người cho biết GLM-5.3-Flash chuyển từ cấu trúc xương sống 744B-A40B của GLM-5.2 sang 320B-A18B, và sử dụng:
Cùng tweet đó mô tả nó là “siêu lai” (super hybrid) vì cả hai thành phần chú ý (attention) chính đều đã là các biến thể “hiệu quả” thay vì chỉ là sự kết hợp đơn giản giữa hiệu quả/toàn bộ chú ý.
Một tóm tắt định hướng hệ thống hữu ích khác từ thealexker đã định hình bản phát hành này như một câu chuyện về hiệu suất, làm nổi bật:
Bài đăng về bối cảnh rộng hơn từ eliebakouch mang tính chủ quan nhưng đáng chú ý về mặt kỹ thuật vì nó đặt GLM vào xu hướng mô hình mở của Trung Quốc:
Bài đăng đó không phải là bản tóm tắt trực tiếp về bài báo GLM, nhưng nó giúp giải thích lý do tại sao các chi tiết kiến trúc ngay lập tức gây tiếng vang với các kỹ sư mô hình: GLM-5.3-Flash dường như là một điểm dữ liệu khác trong không gian thiết kế OSS (phần mềm nguồn mở) tiên phong của Trung Quốc đang hội tụ nhanh chóng theo hướng ưu tiên hiệu suất.
Góc nhìn về chip Trung Quốc và ý nghĩa đối với việc phục vụ (serving)
Khía cạnh phần cứng/phục vụ là một trong những phần được thảo luận nhiều nhất của buổi ra mắt.
Bản thân Z.ai cho biết mô hình này “chạy hoàn toàn trên chip AI của Trung Quốc”. Sự khuếch đại mạnh mẽ nhất đến từ SemiAnalysis, tập trung vào tuyên bố rằng 100 nghìn tỷ token/ngày đang được phục vụ trên chip Trung Quốc. Tweet đó không cung cấp tất cả các dẫn xuất, nhưng nó đã định hình thành tựu cơ sở hạ tầng này là phần gây sốc nhất của sự kiện tiết lộ.
Các phản ứng nhấn mạnh tầm quan trọng:
Cũng có những suy luận sơ bộ về công suất từ teortaxesTex:
Ước tính đó mang tính suy đoán hơn là xác nhận, nhưng nó cho thấy cách các kỹ sư diễn giải tuyên bố phục vụ: không chỉ là lời quảng cáo sáo rỗng, mà là một tuyên bố về cơ sở hạ tầng ngụ ý các đội tàu tăng tốc nội địa rất lớn và tối ưu hóa suy luận trưởng thành.
Các phản ứng về việc áp dụng và phân phối
Một phần đáng chú ý của chu kỳ phản ứng là tốc độ xuất hiện các bài đăng về cách sử dụng.
Cline cho biết GLM-5.3 Flash đã trở thành mô hình phát triển nhanh nhất trong lịch sử của Cline, chiếm 11% tổng lưu lượng truy cập trong chưa đầy một tuần, đồng thời quảng cáo nó là miễn phí trong Cline. Điều này một phần là quảng bá, nhưng nó cũng là một tín hiệu nhu cầu cụ thể.
Các nhà cung cấp cơ sở hạ tầng đã hành động nhanh chóng:
Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.