MarkTechPost
88

Mô hình

So sánh GLM-5.3-Flash và Qwen3.8-Flash-Next: Hai phòng thí nghiệm AI Trung Quốc cùng chọn một hướng đi

(giờ Việt Nam)

Tóm tắt AI

Z.ai và Qwen đã vô tình tạo ra các mô hình có kiến trúc gần như tương đồng, từ cơ chế trộn tuyến tính 3:1 đến kỹ thuật huấn luyện Muon, cho thấy sự hội tụ công nghệ thú vị trong giới AI Trung Quốc.

Bản dịch AI

GLM-5.3-Flash vs Qwen3.8-Flash-Next: Two Chinese AI Labs Independently Converge on the Same Model Architecture

Hai mô hình mã nguồn mở tiên phong đã được ra mắt chỉ cách nhau một ngày trong tuần này. Z.ai đã phát hành GLM-5.3-Flash, một mô hình MoE đa phương thức với 320 tỷ tham số, trong đó có 18 tỷ tham số hoạt động. Đội ngũ Qwen của Alibaba đã phát hành Qwen3.8-Flash-Next, một mô hình 125 tỷ tham số với 6 tỷ tham số hoạt động, mang đến cái nhìn trước về kiến trúc Qwen4.

Hai đội ngũ đã thiết kế các hệ thống này một cách độc lập. Tuy nhiên, cấu hình của chúng lại giống hệt nhau. Cả hai đều sử dụng sự kết hợp lai 3:1 giữa cơ chế chú ý tuyến tính (linear attention) và chú ý toàn phần (full attention). Cả hai đều chọn lọc ngữ cảnh bằng một bộ lập chỉ mục nén (compressed indexer) giới hạn ở 2048 token. Cả hai đều mở rộng luồng dư (residual stream) thành 4 nhánh có cổng (gated branches). Cả hai đều huấn luyện với bộ tối ưu hóa Muon, trong đó các ma trận tham số hợp nhất được tách ra trước khi thực hiện trực giao hóa. Bài viết này sẽ đi sâu vào công thức chung, điểm bất đồng duy nhất và phòng thí nghiệm duy nhất có quan điểm khác biệt.

Tóm tắt về hai bản phát hành

GLM-5.3-Flash là mô hình đa phương thức gốc đầu tiên trong dòng GLM-5, được phát hành theo giấy phép MIT trên Hugging Face. Z.ai đã thử nghiệm mô hình này ẩn danh dưới tên Ox Alpha trên OpenRouter, nơi nó trở thành mô hình phổ biến nhất trong tuần. Mô hình được huấn luyện trên tập dữ liệu đa phương thức 30 nghìn tỷ token và hỗ trợ cửa sổ ngữ cảnh 1 triệu token. Z.ai cho biết mô hình này vượt trội hơn GLM-5.2 trên các tiêu chuẩn đánh giá với mức giá chỉ bằng một phần mười, đồng thời tiệm cận với Claude Opus 4.8 trong các bài kiểm tra về lập trình và tác nhân (agentic). Giá niêm yết là 0,15 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra.

Qwen3.8-Flash-Next đóng vai trò tương tự như Qwen3-Next đối với Qwen3.5: một bản xem trước công khai sớm của dòng kiến trúc tiếp theo. Thẻ mô hình liệt kê một mô hình chính 125 tỷ tham số cùng với bảng nhúng n-gram 51 tỷ tham số bổ sung, với 6 tỷ tham số được kích hoạt trên mỗi token. Ngữ cảnh gốc là 262.144 token, có thể mở rộng lên 1 triệu token với YaRN. Đội ngũ Qwen báo cáo rằng quá trình huấn luyện chỉ tiêu tốn khoảng 1/9 tài nguyên tính toán so với Qwen3.7-Plus. Báo cáo kỹ thuật đi kèm có tiêu đề “Về thiết kế kiến trúc Qwen3.8-Next: Đánh giá, Hiệu quả và Độ ổn định trong huấn luyện.”

Điểm hội tụ 1: Ba trong số bốn lớp chú ý là lớp tuyến tính

GLM-5.3-Flash xếp chồng 45 lớp: 34 lớp chú ý tuyến tính và 11 lớp chú ý toàn phần, theo cấu hình được công bố. Qwen3.8-Flash-Next xếp chồng 48 lớp trong một khối lặp lại gồm 3 lớp Gated DeltaNet cộng với 1 lớp Qwen Sparse Attention, theo công thức vLLM. Cả hai đều đạt được cùng tỷ lệ 3:1.

Các lớp tuyến tính là các lớp tiết kiệm chi phí. Thay vì sử dụng bộ nhớ đệm KV (KV cache) tăng dần theo văn bản, chúng nén toàn bộ lịch sử vào một trạng thái tái phát (recurrent state) có kích thước cố định. Khối lượng tính toán trên mỗi token vẫn không đổi bất kể độ dài ngữ cảnh. GLM sử dụng Kimi Delta Attention (KDA), thiết kế chú ý tuyến tính được giới thiệu bởi Kimi Linear của Moonshot AI, áp dụng cổng phân rã chi tiết theo từng kênh. Qwen sử dụng Gated DeltaNet (GDN) của riêng mình, thực hiện phân cổng ở cấp độ từng đầu (per-head). Độ chi tiết của cổng khác nhau, nhưng cùng thuộc họ quy tắc delta và cùng thực hiện một nhiệm vụ.

Một phần tư số lớp còn lại thực hiện truy xuất tầm xa chính xác. GLM sử dụng NoPE multi-head latent attention (MLA) theo phong cách DeepSeek. Qwen sử dụng grouped-query attention bên trong QSA. Đây là nơi bộ nhớ đệm KV thực sự tồn tại, và cũng là nơi thủ thuật chung thứ hai xuất hiện.

Điểm hội tụ 2: Nén 4 lần, chấm điểm và giữ lại 2048 token

Không mô hình nào cho phép các lớp chú ý toàn phần của chúng chú ý trên toàn bộ ngữ cảnh. Cả hai đều gắn một bộ lập chỉ mục nhỏ đã qua học tập để chấm điểm các đoạn lịch sử và chỉ giữ lại những đoạn tốt nhất. Các tham số khớp nhau gần như chính xác.

Các lớp thưa (sparse layers) của GLM sử dụng bộ lập chỉ mục lightning 32 đầu với lựa chọn top-2048, kế thừa từ DSA của DeepSeek. Để cắt giảm chi phí lập chỉ mục ở ngữ cảnh 1 triệu token, Z.ai giới thiệu IndexPool, giúp nén bốn vectơ khóa của bộ lập chỉ mục thành một thông qua gộp có trọng số trước khi chấm điểm. QSA của Qwen hoạt động ở độ chi tiết khối siêu nhỏ: bộ lập chỉ mục nhẹ nén chấm điểm các khối 4-token và giữ lại 512 khối hàng đầu, chính xác là 2048 token. Như vậy, cả hai mô hình đều nén ngữ cảnh 4 lần trước khi chấm điểm và cả hai đều giới hạn ngân sách chú ý ở 2048 token. Qwen cho biết QSA giúp tăng tốc độ prefill lên tới 7,6 lần và tốc độ giải mã lên 4,9 lần so với chú ý toàn phần ở ngữ cảnh 1 triệu token.

Tác động kết hợp đối với GLM là rất lớn. So với mô hình GLM-5.3 đầy đủ, Z.ai báo cáo rằng kiến trúc Flash cắt giảm khoảng 3 lần khối lượng tính toán chú ý và 4,4 lần kích thước bộ nhớ đệm KV, đồng thời giảm gần một nửa số tham số hoạt động (18 tỷ so với 32 tỷ) và số lớp (45 so với 92).

Điểm hội tụ 3: Bốn luồng dư thay vì một

Cả hai mô hình đều từ bỏ luồng dư đơn lẻ vốn đã định hình các kiến trúc transformer từ năm 2017. Cả hai mở rộng nó thành bốn nhánh song song, với các cổng kiểm soát những gì mỗi khối đọc vào và ghi ra.

GLM áp dụng Manifold-Constrained Hyper-Connections (mHC), một thiết kế có nguồn gốc từ DeepSeek, được cấu hình với 4 nhánh trong các trọng số được phát hành. Qwen đã viết biến thể riêng của mình, Gated Residual, giúp điều tiết luồng qua 4 luồng mở rộng thông qua cổng đọc phụ thuộc vào dữ liệu theo từng phần tử và cổng ghi vô hướng theo từng nhánh. Theo đội ngũ Qwen, Gated Residual loại bỏ bước trộn nhánh bổ sung được sử dụng bởi Hyper-Connections, giảm chi phí truy cập bộ nhớ, và cổng này triệt tiêu các giá trị ngoại lai kích hoạt đủ tốt để cho phép lưu trữ dư FP8. Đáng chú ý, đội ngũ Qwen đã thử nghiệm cả hai cách tiếp cận và thấy chúng có chất lượng tương đương nhau. Hai phòng thí nghiệm, hai cách triển khai, một kết luận giống hệt nhau: bốn luồng có cổng tốt hơn một luồng.

Điểm hội tụ 4: Muon, với các ma trận hợp nhất được tách theo thành phần

Cả hai mô hình đều huấn luyện với bộ tối ưu hóa Muon. Và cả hai đều áp dụng cùng một tinh chỉnh tinh tế: các ma trận chiếu hợp nhất được tách thành các phép biến đổi độc lập trước khi Muon thực hiện trực giao hóa chúng. Qwen ghi lại việc tách các phép chiếu QKV, SwiGLU và GDN hợp nhất, gán Muon cho các bản đồ tuyến tính 2D thực sự và AdamW cho các phần nhúng, bộ định tuyến và tham số hạng thấp. Qwen cũng điều chỉnh lại các định luật quy mô cho kiến trúc mới và loại bỏ hoàn toàn việc khởi động kích thước lô (batch-size warmup), sau khi đo lường rằng việc khởi động này tốn thêm 18,8% số bước tối ưu hóa mà không cải thiện kết quả.

Điểm bất đồng: Mã hóa vị trí (Positional Encoding)

Sự khác biệt rõ ràng duy nhất là các nhúng vị trí xoay (rotary position embeddings - RoPE) trong các lớp chú ý toàn phần. GLM-5.3-Flash loại bỏ chúng: cấu hình đặt qk_rope_head_dim = 0, khiến các lớp MLA thưa của nó hoàn toàn là NoPE. Thông tin vị trí chảy ngầm qua các lớp tuyến tính tái phát.

Qwen đã thử nghiệm điều tương tự nhưng vẫn giữ lại RoPE. Theo báo cáo kỹ thuật của Qwen3.8-Next, NoPE không tạo ra sự khác biệt có thể đo lường được trong quá trình tiền huấn luyện. Sự thất bại xuất hiện sau đó: sau khi hậu huấn luyện, biến thể NoPE thường không dừng tạo văn bản. Đó là một kết quả cảnh báo hữu ích cho lĩnh vực này. Các đường cong mất mát (loss curves) trong tiền huấn luyện có thể che giấu các khiếm khuyết hành vi chỉ xuất hiện sau khi tinh chỉnh giai đoạn RLHF.

Sự hội tụ rộng hơn và một người bất đồng quan điểm

Công thức này không giới hạn ở hai phòng thí nghiệm. DeepSeek đã tiên phong với mô hình lập chỉ mục thưa cộng với ngân sách 2048 với DSA trong DeepSeek-V3.2-Exp, và mHC là một thiết kế của DeepSeek hiện đang được sử dụng trong GLM. Kimi của Moonshot đã đóng góp KDA, chính là lớp chú ý tuyến tính mà GLM đã áp dụng. Các mô hình mở của Trung Quốc đang thụ phấn chéo các thành phần kiến trúc một cách rõ rệt và hội tụ vào các thiết lập chung.

Người bất đồng quan điểm đáng chú ý là MiniMax. Trong quá trình phát triển M2, đội ngũ này đã thử nghiệm rộng rãi chú ý tuyến tính và cửa sổ trượt ở quy mô lớn và nhận thấy những thiếu hụt nghiêm trọng trong suy luận đa bước, đặc biệt là vượt quá ngữ cảnh 32K sau SFT. M2 được phát hành với chú ý softmax toàn phần trong mọi lớp. Đối với M3, MiniMax đã áp dụng MiniMax Sparse Attention (MSA), giúp làm thưa chú ý softmax thông qua lựa chọn khối nhưng hoàn toàn không bao gồm các lớp chú ý tuyến tính. Vì vậy, lĩnh vực này vẫn chưa hoàn toàn ổn định. Z.ai, Qwen, DeepSeek và Kimi đang đặt cược rằng sự kết hợp lai tuyến tính 3:1 sẽ bảo toàn khả năng suy luận. Các thử nghiệm của MiniMax cho thấy điều đó không xảy ra, ít nhất là đối với hệ thống của họ.

Những điểm chính cần lưu ý

Nguồn: GLM-5.3-Flash trên Hugging Face, tài liệu Z.ai GLM-5.3-Flash, Báo cáo kỹ thuật GLM-5 (arXiv:2602.15763), Qwen3.8-Flash-Next trên Hugging Face, GitHub Qwen3.8-Flash-Next, Blog kỹ thuật NVIDIA, Báo cáo MiniMax-M2 (arXiv:2605.26494) và MiniMax Sparse Attention (arXiv:2606.13392).

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.

AI Trung QuốcKiến trúc mô hìnhGLMQwenCông nghệ AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.