Mô hình
Z.ai ra mắt GLM-5.3: Đột phá khả năng lập trình và xử lý tác vụ dài mà không cần huấn luyện lại
(giờ Việt Nam)
Tóm tắt AI
Z.ai vừa trình làng GLM-5.3, phiên bản nâng cấp dựa trên nền tảng 743B cũ thông qua kỹ thuật hậu huấn luyện chuyên sâu. Mô hình đạt hiệu suất ấn tượng trong lập trình và các tác vụ phức tạp, vượt qua nhiều đối thủ sừng sỏ như Mythos 5 và GPT-5.6 Sol.
Bản dịch AI

Z.ai vừa phát hành GLM-5.3. GLM-5.3 chạy trên cùng mô hình cơ sở 743B như GLM-5.2. Mọi sự cải thiện được báo cáo đều đến từ quá trình hậu huấn luyện (post-training) được mở rộng: nhiều môi trường tác vụ hơn, nhiều loại môi trường hơn và thời gian huấn luyện dài hơn. Kết quả đạt được ở hai lĩnh vực. Khả năng lập trình nhảy vọt nhất ở các tiêu chuẩn đánh giá (benchmark) có phạm vi dài nhất, với Terminal-Bench 3.0 tăng từ 4,6 lên 28,3. Lĩnh vực an ninh mạng có bước tiến xa hơn mức Z.ai dự kiến, với CyberGym đạt 84,5%. Trọng số (weights) hiện chưa được công khai.
Có thể triển khai được không?
Một phần, GLM-5.3 đã hoạt động thông qua Z.ai API, GLM Coding Plan và ZCode. Trọng số vẫn chưa được phát hành. Z.ai cho biết họ sẽ công bố chúng khoảng hai tuần sau khi ra mắt, sau khi hoàn tất quá trình đánh giá an toàn và củng cố hệ thống.
Kết quả về lập trình
Terminal-Bench 3.0 tăng từ 4,6 lên 28,3 so với GLM-5.2. DeepSWE v1.1 tăng từ 46,2 lên 66,9. Agents’ Last Exam (CLI) tăng từ 23,8 lên 28,5. Trên GDPval-AA v2, bao gồm 44 ngành nghề, GLM-5.3 đạt 1.769 điểm.
Trên Z.ai Code Bench, một bài đánh giá nội bộ, công ty báo cáo mức cải thiện 50% so với GLM-5.2. Họ báo cáo đạt 31,4% ở mức khoảng 50.000 token đầu ra mỗi tác vụ. Claude Opus 4.8 đạt 29,5% ở mức 120.000 token. Claude Fable 5 vẫn dẫn đầu với 39,5% ở mức nỗ lực tối đa. Z.ai lập luận rằng một tiêu chuẩn đánh giá nội bộ sẽ giảm thiểu rủi ro nhiễm dữ liệu (contamination risk).
Trên các bộ tiêu chuẩn công khai, GLM-5.3 vẫn xếp sau GPT-5.6 Sol và Fable 5 ở một số bài đánh giá lập trình khó hơn. Tất cả các số liệu đều do nhà cung cấp báo cáo, với bộ công cụ (harness), độ dài ngữ cảnh và các thiết lập lấy mẫu được ghi chú trong thông báo.
Kết quả về an ninh mạng
Z.ai đánh dấu đây là kết quả không nằm trong kế hoạch. Họ đã thêm dữ liệu khám phá lỗ hổng với kỳ vọng cải thiện khả năng suy luận về các lỗi đơn lẻ. Thay vào đó, năng lực của mô hình tiếp tục tăng lên khi quá trình huấn luyện được mở rộng. Mô hình bắt đầu hình thành các kế hoạch mạch lạc xuyên suốt toàn bộ chuỗi khai thác.
CyberGym, nơi kiểm tra khả năng khám phá và xác thực từ mã nguồn white-box, tăng từ 77,2% lên 84,5%. Con số này vượt qua Mythos 5 với 83,8% và GPT-5.6 Sol với 83,6%. ExploitBench, yêu cầu khả năng suy luận nguyên nhân gốc rễ và một mã khai thác hoạt động được, tăng từ 24,4% lên 54,4%. Mythos 5 đạt 78,0%. Trên ExploitGym, GLM-5.3 hoàn thành 105 tác vụ trong hai giờ và 130 tác vụ trong sáu giờ. GLM-5.2 hoàn thành 29 và 39 tác vụ. Mythos 5 hoàn thành 181 và 247 tác vụ.
Mô hình này rất nhất quán. Càng đi sâu vào chuỗi khai thác trong một bài đánh giá, mức độ cải thiện so với GLM-5.2 càng lớn. Khoảng cách với các mô hình tiên phong (frontier models) đóng cũng ngày càng nới rộng.
Công cụ giải thích tương tác
Những điểm chính cần lưu ý
Hãy xem blog kỹ thuật Z.ai GLM-5.3, thông báo của Zai_org, Z.ai Security Disclosure Ledger và zai-org/GLM-5 trên GitHub. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Product Release hoặc Webinar, v.v. của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy (machine learning) và học sâu (deep learning) vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.