Nathan Lambert: Interconnects
88

Thủ thuật

GLM-5.3: Cách các phòng thí nghiệm Trung Quốc bắt kịp cuộc đua AI toàn cầu

(giờ Việt Nam)

Tóm tắt AI

Z.ai vừa ra mắt GLM-5.3 với hiệu năng vượt trội Kimi K3 và tiệm cận các mô hình hàng đầu thế giới dù chỉ sở hữu 750B tham số. Mô hình sẽ sớm mở API và công khai mã nguồn trên Hugging Face trong hai tuần tới.

Bản dịch AI

GLM-5.3: How Chinese labs keep stride with the frontier

Hôm nay, Z.ai đã công bố mô hình GLM-5.3 của họ. Hiện tại, mô hình này chỉ khả dụng trong gói lập trình (coding plan), sẽ sớm có mặt trên API của họ và dự kiến ra mắt trên Hugging Face (dưới dạng open weights) trong hai tuần tới. Mô hình này trông thực sự xuất sắc với điểm số tăng đáng kinh ngạc. Trên nhiều tiêu chuẩn đánh giá (benchmarks), mô hình đã vượt qua Kimi K3 của Moonshot AI và ở một số bài kiểm tra khác, nó còn vượt mặt cả Claude Fable 5 hoặc GPT-5.6-Sol.

Dưới đây là bảng so sánh đầy đủ hơn:

Điều này đưa mô hình vào vị trí dẫn đầu trong các tiêu chuẩn đánh giá về lập trình tác nhân (agentic coding), với chỉ khoảng 750 tỷ tham số – bằng một phần ba so với Kimi K3! Bài đăng trên blog của Z.ai khá thẳng thắn và mở đầu bằng một câu khẳng định táo bạo:

Mở rộng quy mô hậu huấn luyện (post-training) là tất cả những gì chúng tôi đã làm cho GLM-5.3.

GLM-5.3 là cùng một mô hình cơ sở với GLM-5.2 nhưng được mở rộng đáng kể về hậu huấn luyện. Nếu đơn giản hóa vấn đề, Z.ai dường như có thế mạnh về hậu huấn luyện so với Kimi, vốn là một kiệt tác về tiền huấn luyện (pretraining). Sau bản phát hành này, đã có rất nhiều cuộc thảo luận tự hỏi làm thế nào Trung Quốc có thể bắt kịp tốt đến vậy? Làm sao một mô hình nhỏ như thế lại có thể ngang hàng với các mô hình công khai hàng đầu của Mỹ? Liệu những kết quả này có thực không?

Lời giải thích đơn giản nhất là Z.ai rất giỏi trong lĩnh vực của họ – cần nhớ rằng họ đã làm việc với dòng mô hình này lâu hơn hầu hết mọi người trong ngành. Dưới đây là lịch sử tóm tắt của các mô hình GLM.

Zhipu AI được thành lập – 2019

GLM (General Language Model) — Tháng 3 năm 2021 — được phát hành bởi THUDM, nhóm Khai thác dữ liệu / Kỹ thuật tri thức của Đại học Thanh Hoa. Weights

GLM-130B — Tháng 8 năm 2022 — Phiên bản mở rộng quy mô. Báo cáo kỹ thuật cho GLM-130B đến GLM-4 — Weights

ChatGLM — 14 tháng 3 năm 2023 — phiên bản trò chuyện đầu tiên. Weights

ChatGLM2 — 25 tháng 6 năm 2023 — Weights

ChatGLM3 — 27 tháng 10 năm 2023 — Weights

GLM-4 — 16 tháng 1 năm 2024 — đổi thương hiệu thành GLM; phiên bản open-weight GLM-4-9B ra mắt sau đó vào tháng 6. Weights

GLM-5 — 11 tháng 2 năm 2026 — thế hệ lớn mới nhất. Weights

GLM 5.2, ra mắt vào ngày 22 tháng 6 năm nay, là một sự kiện lớn – vài tuần sau khi phát hành, tôi thường xuyên nghe từ các nhà nghiên cứu AI mà tôi quen biết rằng họ vẫn sử dụng mô hình này vì tốc độ (một số triển khai mô hình trên các cụm nội bộ để có tốc độ nhanh hơn so với các dịch vụ công cộng) và sự đơn giản (là một mô hình không có các cơ chế rollback, v.v., khi làm việc trên các hệ thống AI tiên tiến). GLM-5.2 hoàn toàn xứng đáng với sự kỳ vọng.

Bản thân tôi cũng từng trải qua cảm giác phủ nhận tương tự, tự hỏi "làm thế nào họ cứ làm được điều này? Chắc chắn các mô hình không tốt như vẻ ngoài của chúng." Có điều gì đó hơi khó chịu khi các công ty Mỹ có lợi thế về nguồn lực áp đảo như vậy nhưng dường như không thể bứt phá về khả năng. Câu trả lời phổ biến là chưng cất (distillation), điều mà tôi đã viết rất nhiều, nhưng tôi cho rằng đó không phải là yếu tố chính. Về vấn đề này, gần đây có một bài báo cho thấy các phương pháp đơn giản để trích xuất các dấu vết suy luận (reasoning traces) từ các mô hình tiên tiến – đây là loại kỹ thuật mà các phòng thí nghiệm Trung Quốc chắc chắn có thể sử dụng ở quy mô lớn. Tôi bối rối không hiểu tại sao các phòng thí nghiệm ở Mỹ không vá lỗi hành vi này nhanh hơn; thay vào đó, họ lại chạy đến chính phủ để yêu cầu hỗ trợ chính sách. Điều đó không hợp lý với tôi.

Blog của Z.ai rất trực diện và phù hợp với chế độ huấn luyện dựa trên RL (Học tăng cường). Họ cho biết họ đã sử dụng "nhiều môi trường hơn, nhiều tác vụ đa dạng hơn và dành nhiều tài nguyên tính toán hơn để huấn luyện trên đó." Người ta không thể chỉ đơn giản là "chưng cất" các môi trường RL, cơ sở hạ tầng để chạy chúng ở quy mô lớn, hay các thuật toán để kết hợp chúng lại với nhau một cách hiệu quả.

Vậy, nếu không phải là chưng cất thì các phòng thí nghiệm Trung Quốc làm điều đó như thế nào? Họ có đang "benchmaxxing" không? Một định nghĩa được chấp nhận của benchmaxxing là tập trung mô hình vào các bộ dữ liệu kiểm tra, khiến hiệu suất thực tế khác biệt đáng kể so với điểm số trên giấy tờ. Các yếu tố quyết định mang tính tổng thể hơn là kỹ thuật (vâng, các chi tiết kỹ thuật chắc chắn quan trọng, nhưng khó phân biệt giữa phòng thí nghiệm này với phòng thí nghiệm khác):

Thời gian phát hành của Z.ai có lẽ tính bằng ngày, không phải hàng tháng như OpenAI hay Anthropic. Rất, rất có khả năng OpenAI và Anthropic có các mô hình nội bộ tốt hơn nhiều so với Z.ai và Moonshot AI. Tuy nhiên, các công ty Mỹ này thường mất hàng tháng để phát hành mô hình ra công chúng, điều này vô tình giúp các phòng thí nghiệm Trung Quốc có lợi thế lớn trong các quyết định áp dụng công nghệ tiên tiến. Nói một cách đơn giản – các phòng thí nghiệm Trung Quốc tận dụng toàn bộ thời gian mà các phòng thí nghiệm Mỹ dùng để kiểm thử trước khi phát hành để tiếp tục tối ưu hóa trên các bảng xếp hạng (SpaceXAI có lẽ gần với các phòng thí nghiệm Trung Quốc hơn ở điểm này). Với tốc độ tiến bộ nhanh chóng như hiện nay, đây có lẽ là yếu tố quyết định lớn nhất lý giải tại sao các phòng thí nghiệm Trung Quốc vẫn duy trì được vị thế tiên phong. Cho đến nay, điều này vẫn có thể chấp nhận được về mặt kinh tế đối với các phòng thí nghiệm Mỹ, vì họ vẫn có nhu cầu khổng lồ đối với các mô hình của mình.

Khi các vòng lặp tự cải thiện mô hình tăng tốc trong các phòng thí nghiệm xây dựng LLM, nếu bất kỳ vòng lặp phản hồi nào yêu cầu dữ liệu người dùng, chu kỳ phát hành nhanh hơn này có thể ưu tiên đáng kể cho các phòng thí nghiệm Trung Quốc, mang lại cho các sản phẩm của họ vòng đời dài hơn trước khi mô hình vượt trội tiếp theo xuất hiện, từ đó làm giảm nhu cầu đối với các mô hình của họ.

Đây rõ ràng là những động lực cạnh tranh mà nhiều người trong ngành lo ngại. Với quá nhiều phòng thí nghiệm đang xây dựng các mô hình tiên tiến trong phạm vi năng lực hàng đầu, khó có thể thấy điều này giảm bớt trong tương lai gần.

Vâng, Z.ai có lẽ quan tâm đến các bảng xếp hạng công khai nhiều hơn một chút so với OpenAI hay Anthropic. Những bảng xếp hạng này, ví dụ như đạt điểm cao trên Artificial Analysis Intelligence Index hoặc các trình tổng hợp tương tự, có tác động trực tiếp đến giá cổ phiếu của họ. Theo nhiều cách, họ cần làm điều này để tiếp tục huy động vốn và duy trì tinh thần làm việc của đội ngũ, vì việc trở thành kẻ yếu thế đầy nghị lực sánh ngang với các gã khổng lồ Mỹ là một câu chuyện tuyệt vời. Benchmaxxing tinh vi không nhất thiết phải xuất phát từ sự tuyệt vọng hay bất kỳ áp lực tương tự nào. Đó là tiêu chuẩn ngành trên một số lượng đáng kể các phòng thí nghiệm. Chiến lược thu thập dữ liệu của nhiều công ty là mua dữ liệu về các tiêu chuẩn mà họ đang bị tụt hậu.

Benchmaxxing tinh vi không nhất thiết phải xuất phát từ sự tuyệt vọng hay bất kỳ áp lực tương tự nào. Đó là tiêu chuẩn ngành trên một số lượng đáng kể các phòng thí nghiệm. Chiến lược thu thập dữ liệu của nhiều công ty là mua dữ liệu về các tiêu chuẩn mà họ đang bị tụt hậu.

Z.ai không benchmaxxing đến mức làm "cháy" GLM-5.3 (ít nhất là không cố ý, và họ sẽ kiểm tra điều đó). Mọi phòng thí nghiệm hiện nay đều đang đối mặt với những khó khăn trong việc mở rộng quy mô RL. Các mô hình Opus 5 và Sonnet 5 của Anthropic có danh tiếng rất trái chiều, bất chấp điểm số benchmark đáng kinh ngạc. Mọi người trong ngành đều ở cùng một con thuyền, vì vậy một số trọng số mô hình cuối cùng sẽ dễ sử dụng hơn những mô hình khác, nhưng điểm số benchmark trong các blog phát hành của họ là thực tế.

GLM-5.3 có lẽ là một mô hình hẹp hơn so với Claude Fable hoặc GPT Sol. Khi GPT-5.2 được phát hành, nó đã nhận được những đánh giá trái chiều bên ngoài lĩnh vực lập trình tác nhân. Đồng thời, OpenAI và Anthropic hỗ trợ các doanh nghiệp rất lớn với vô số trường hợp sử dụng cho mô hình của họ. Đây là lợi thế của việc trở thành một công ty sớm trong đường cong áp dụng – bạn có thể nhắm mục tiêu vào các trường hợp sử dụng có giá trị nhất. Trong quá trình hậu huấn luyện, việc bớt quan tâm đến một vài thứ sẽ giúp việc lắp ráp mô hình cuối cùng dễ dàng hơn nhiều. Tôi đang nói quá lên một chút, vì Z.ai được cho là đã đạt doanh thu định kỳ hàng năm (ARR) 1 tỷ USD nhờ vào mảng kinh doanh triển khai tại chỗ (on-premises) mạnh mẽ.

Tôi đang nói quá lên một chút, vì Z.ai

Tương tự, các mô hình GLM hàng đầu chưa có khả năng thị giác. Việc chỉ thuần văn bản chắc chắn giúp Z.ai đạt được điểm số cạnh tranh hơn, nhưng đây là một không gian cạnh tranh hơn. Ở phía bên kia là các mô hình như Inkling-Small, được thiết kế để trở thành mô hình đa phương thức (omnimodal).

Z.ai là một tổ chức LLM cực kỳ lành nghề – một tổ chức có khả năng sử dụng tài nguyên tính toán hiệu quả hơn nhiều so với OpenAI / Anthropic. Điều này cần được nhắc lại. Những người này rất giỏi trong những gì họ làm. Công ty có mối quan hệ rất chặt chẽ với Đại học Thanh Hoa, nơi quy tụ nhiều nhà khoa học máy tính giỏi nhất Trung Quốc. Nguồn nhân tài dồi dào, đầy nhiệt huyết này cũng quan trọng đối với sự thành công của họ như đối với bất kỳ đối tác phương Tây nào.

Nhìn chung, có vẻ như họ đang thực hiện một chiến lược hoàn hảo với dòng mô hình GLM. Chúc mừng bản phát hành mới! Tôi rất hào hứng chờ đợi các trọng số được công bố để có thể thực hiện các thử nghiệm mở rộng hơn (tôi thường sử dụng các dịch vụ suy luận open-weight của Mỹ như Fireworks hoặc Baseten).

Để lại bình luận

Đây là một bước tiến khác hướng tới sự phổ biến tất yếu của các năng lực mạng mạnh mẽ trên toàn nền kinh tế. Z.ai đã thừa nhận điều này khi nói rằng:

GLM-5.3 là mô hình có năng lực nhất của chúng tôi cho đến nay đối với các tác vụ an ninh mạng. Nó mang lại những cải tiến đáng kể trong việc phát hiện lỗ hổng, phân tích khai thác và các tác vụ bảo mật phức tạp gồm nhiều bước. Những khả năng này có thể giúp những người phòng thủ xác định các điểm yếu sớm hơn, xác thực rủi ro và đẩy nhanh quá trình khắc phục.

Chúng cũng tạo ra những rủi ro sử dụng kép rõ ràng. Do đó, chúng tôi đang thực hiện cách tiếp cận theo từng giai đoạn để phát hành. Các đối tác bảo mật được chọn sẽ đánh giá GLM-5.3 trong môi trường được kiểm soát trước. Quyền truy cập rộng rãi hơn và tính khả dụng của API sẽ theo sau. Khi các đánh giá an toàn cần thiết và công tác chuẩn bị phát hành hoàn tất, chúng tôi sẽ công bố toàn bộ trọng số mô hình của GLM-5.3.

Họ tiếp tục thừa nhận cách họ giám sát suy luận trên nền tảng của mình thông qua trình phân loại yêu cầu và giám sát chuỗi suy nghĩ (chain of thought) (bên cạnh việc căn chỉnh mô hình). Quỷ dữ nằm ở các chi tiết ở đây, và mức độ thực thi mà mỗi phòng thí nghiệm AI sẽ đạt được vẫn chưa rõ ràng. Sự lan tỏa năng lực được xác định bởi mẫu số chung thấp nhất.

AI Trung QuốcGLM-5.3Mô hình ngôn ngữCông nghệ AIZ.ai
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Nathan Lambert: Interconnects. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.