KrASIA
85

Mô hình

GLM-5.3 của Z.ai: Bứt phá khả năng lập trình và bảo mật, tiệm cận đẳng cấp Anthropic

(giờ Việt Nam)

Tóm tắt AI

Dựa trên nền tảng GLM-5.2, phiên bản GLM-5.3 mang lại hiệu suất vượt trội trong các bài kiểm tra về lập trình và an ninh mạng, thu hẹp đáng kể khoảng cách với các mô hình hàng đầu của Anthropic.

Bản dịch AI

Z.ai says GLM-5.3 nears Anthropic in cyber defense as coding gains accelerate

Công ty trí tuệ nhân tạo Trung Quốc Z.ai vừa ra mắt GLM-5.3, một mô hình chủ lực mới mà họ cho biết có khả năng ngang bằng hoặc vượt trội hơn một số mô hình hàng đầu của Mỹ trong việc xác định các lỗ hổng phần mềm, đồng thời thu hẹp khoảng cách với Anthropic trong các tác vụ lập trình dài hạn.

Sự so sánh đó có một giới hạn quan trọng. Trên CyberGym, nền tảng kiểm tra khả năng kiểm tra mã nguồn, tìm kiếm và xác minh lỗ hổng của mô hình, Z.ai cho biết GLM-5.3 đạt 84,5%. Con số này nhỉnh hơn một chút so với Mythos 5 của Anthropic (83,8%) và GPT-5.6 Sol của OpenAI (83,6%). Tuy nhiên, Mythos 5 vẫn vượt xa khi tác vụ chuyển từ tìm kiếm lỗ hổng sang xây dựng mã khai thác (exploit) thực tế.

Z.ai cho biết GLM-5.3 đạt 54,4% trên ExploitBench, so với 78,0% của Mythos 5. Trong một bài kiểm tra tính giờ khác, GLM-5.3 hoàn thành 105 tác vụ phát triển tấn công trong hai giờ và 130 tác vụ trong sáu giờ. Mythos 5 lần lượt hoàn thành 181 và 247 tác vụ.

GLM-5.3 sử dụng cùng một mô hình nền tảng với phiên bản tiền nhiệm GLM-5.2, và Z.ai cho rằng sự cải thiện này hoàn toàn nhờ vào quá trình hậu huấn luyện (post-training), tức là công việc được thực hiện sau khi mô hình nền tảng hoàn tất giai đoạn tiền huấn luyện chính.

Điều này khiến GLM-5.3 không hẳn là một bước nhảy vọt sang mô hình nền tảng lớn hơn, mà giống một bài kiểm tra về việc Z.ai có thể cải thiện mô hình hiện có đến mức nào bằng cách huấn luyện nó trong các môi trường kỹ thuật phần mềm dài hơn và thực tế hơn.

Ngoài ra, đã có những bằng chứng độc lập ban đầu cho thấy các bước tiến về lập trình không chỉ giới hạn trong các bài kiểm tra của riêng Z.ai. FrontierSWE, nền tảng kiểm tra các mô hình trên những dự án kỹ thuật phần mềm khó, hiện xếp GLM-5.3 ở vị trí thứ hai trong cấu hình Claude Code được thử nghiệm, đứng sau Claude Fable 5. GLM-5.2 xếp thứ năm. GLM-5.3 ghi nhận thứ hạng trung bình là 4,50 và điểm thống trị 78%, so với 2,88 và 88% của Fable 5.

Kết quả này không biến GLM-5.3 thành một mô hình mạnh hơn Fable 5 trên mọi phương diện. Thay vào đó, nó cho thấy Z.ai đang trở nên cạnh tranh hơn với các hệ thống tiên phong độc quyền trong lĩnh vực kỹ thuật phần mềm, các tác vụ đại lý (agent) dài hạn và một số công việc lập trình liên quan đến bảo mật.

Mô tả của chính Z.ai đã làm rõ trọng tâm này. Trong blog ra mắt, họ nhấn mạnh GLM-5.3 là mô hình dành cho “lập trình tiên phong với các khả năng an ninh mạng mới nổi”, trong khi đồng sáng lập Tang Jie mô tả trên X rằng nó được “xây dựng để lập trình” và “sẵn sàng cho phòng thủ an ninh mạng”. Tang cho biết những cải tiến này đến từ quá trình hậu huấn luyện trên cùng một nền tảng 743 tỷ tham số.

Công ty cho biết quá trình huấn luyện của GLM-5.3 không chỉ dừng lại ở các bài tập lập trình đơn lẻ. Các môi trường huấn luyện của nó bao gồm các quy trình làm việc yêu cầu mô hình phải xác định vấn đề, cân nhắc các giải pháp khả thi, thực hiện thay đổi, kiểm tra kết quả và bàn giao công việc hoàn thiện. Theo Z.ai, một số tác vụ được thiết kế để mô phỏng khối lượng công việc vài ngày của một kỹ sư cấp cao và yêu cầu quyền truy cập vào các cụm máy tính, hệ thống lưu trữ, tài liệu nội bộ và thư viện mã.

Trọng tâm này được xây dựng dựa trên GLM-5.2, phiên bản mà Z.ai đã phát hành vào tháng 6 cho các tác vụ dài hạn. GLM-5.2 đã mở rộng cửa sổ ngữ cảnh của mô hình lên một triệu token và được thiết kế để theo dõi các mục tiêu và yêu cầu kỹ thuật trong suốt các dự án dài hơi. GLM-5.3 vẫn giữ nguyên cửa sổ ngữ cảnh đó và hỗ trợ đầu ra tối đa 128.000 token trong khi vẫn là một mô hình tập trung vào văn bản.

Những cải tiến được thể hiện rõ qua kết quả các bài kiểm tra của Z.ai. Điểm số Terminal-Bench 3.0 của mô hình tăng từ 4,6 ở GLM-5.2 lên 28,3 ở GLM-5.3. DeepSWE v1.1 tăng từ 46,2 lên 66,9, trong khi Agents’ Last Exam cải thiện từ 23,8 lên 28,5. Trên Code Bench của riêng Z.ai, công ty tuyên bố hiệu suất lập trình đã cải thiện 50% so với GLM-5.2.

Sự cải thiện thậm chí còn lớn hơn trong lĩnh vực an ninh mạng. Điểm ExploitBench của GLM-5.3 đã tăng hơn gấp đôi từ 24,4% của GLM-5.2 lên 54,4%, mặc dù mô hình nền tảng không thay đổi. Z.ai thừa nhận rằng GLM-5.3 hiện giỏi hơn ở các giai đoạn đầu của việc tìm kiếm lỗ hổng, bao gồm đánh giá mã, khám phá và xác minh, so với việc khai thác sâu hơn hoặc thực hiện các hoạt động tấn công và phòng thủ toàn diện.

Điều đó có thể giải thích lý do tại sao công ty mô tả các khả năng an ninh mạng của mình là “mới nổi”. GLM-5.3 không được huấn luyện như một mô hình chuyên biệt về an ninh mạng. Z.ai cho biết những khả năng này xuất hiện khi họ mở rộng học tăng cường và huấn luyện mô hình trong các môi trường phát triển phần mềm dài hơn và đa dạng hơn.

Do đó, an ninh mạng vừa đóng vai trò là một điểm bán hàng mới, vừa là bài kiểm tra cho ý tưởng rộng lớn hơn của Z.ai: nếu một mô hình được huấn luyện để hoạt động giống như một kỹ sư phần mềm tự hành, thì những kỹ năng mà nó sử dụng để hiểu, gỡ lỗi và thay đổi mã phức tạp cũng có thể giúp nó tìm ra các điểm yếu trong mã đó.

Z.ai vẫn chưa phát hành trọng số mô hình (model weights) để các nhà phát triển có thể tải xuống và chạy GLM-5.3 một cách độc lập. Công ty cho biết họ sẽ trì hoãn việc phát hành công khai khoảng hai tuần để thực hiện thêm các kiểm tra bảo mật và tăng cường các biện pháp bảo vệ. Các chức năng an ninh mạng nhạy cảm nhất của mô hình ban đầu sẽ chỉ giới hạn cho các đối tác được chọn và người dùng đã xác minh theo chương trình “truy cập tin cậy”.

Các nhà đầu tư đã không phản ứng với đợt ra mắt này bằng một đợt tăng giá ngay lập tức. Cổ phiếu niêm yết tại Hồng Kông của Z.ai đóng cửa giảm 3,6% vào ngày 14 tháng 8, ngày GLM-5.3 được công bố. Điều này trái ngược với sự nhiệt tình của thị trường dành cho GLM-5.2 vào đầu mùa hè.

Đến cuối tháng 6, cổ phiếu của Z.ai đã tăng hơn 2.000% kể từ khi niêm yết vào tháng 1, khi GLM-5.2 thu hút sự chú ý nhờ tiến gần hơn đến các mô hình hàng đầu của Mỹ trong các tác vụ lập trình và đại lý.

GLM-5.3 đánh dấu sự tiến bộ trong một tập hợp các khả năng hẹp hơn. Nó không cho thấy Z.ai đã vượt qua Anthropic hay OpenAI trong lĩnh vực AI tiên phong nói chung. Thay vào đó, nó cho thấy khoảng cách đang thu hẹp trong các lĩnh vực như lập trình và an ninh mạng, và những bước tiến đáng kể không phải lúc nào cũng đòi hỏi một đợt tiền huấn luyện lớn khác.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ KrASIA. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.