Artificial Intelligence News
85

Thủ thuật

Giải mã GLM-5.3 của Zhipu: Những tín hiệu quan trọng đằng sau các con số

(giờ Việt Nam)

Tóm tắt AI

Zhipu thừa nhận đang tập trung cải thiện lỗ hổng về an ninh mạng thay vì chỉ chạy đua điểm số benchmark. Đây là chiến lược thực tế của một trong những phòng thí nghiệm AI hàng đầu Trung Quốc nhằm bắt kịp các tiêu chuẩn quốc tế.

Bản dịch AI

Reading Zhipu’s GLM-5.3 results past the headline number

Ghi chú phát hành GLM-5.3 của Zhipu có chứa một câu mà hầu hết các bài đưa tin đều bỏ qua. Khi mô tả kết quả về an ninh mạng của chính mình, công ty có trụ sở tại Bắc Kinh này viết rằng năng lực “đang phát triển nhanh nhất chính tại những nơi chúng ta còn tụt hậu xa nhất.”

Zhipu, còn được biết đến với tên gọi Z.ai, là một trong số ít các phòng thí nghiệm Trung Quốc đang phát hành các mô hình cạnh tranh với các mô hình tiên phong của Mỹ. Vào ngày 14 tháng 8, họ đã ra mắt GLM-5.3, một mô hình tập trung vào lập trình, và công bố một ghi chú kỹ thuật nêu rõ hiệu suất của mô hình này so với các đối thủ. Ghi chú đó là nguồn gốc cho mọi thông tin được báo cáo ở đây.

Tuyên bố gây chú ý nằm ở khía cạnh bảo mật. Bên cạnh các kết quả về lập trình, Zhipu cho biết GLM-5.3 đã trở nên giỏi một cách bất ngờ trong việc tìm kiếm các lỗ hổng phần mềm, đạt 84,5% trên một bộ tiêu chuẩn đánh giá (benchmark) có tên CyberGym, so với 83,8% của Mythos 5 từ Anthropic và 83,6% của GPT-5.6 Sol từ OpenAI. Các tiêu đề báo chí sau đó đã đưa tin rằng một mô hình của Trung Quốc hiện đã vượt mặt các mô hình của Mỹ trong việc săn tìm lỗi bảo mật.

Lý do khiến thông tin này gây tiếng vang lớn hơn các kết quả benchmark thông thường nằm ở bản chất của việc phát hiện lỗ hổng. Một mô hình có thể đọc mã nguồn và xác định các lỗi có thể khai thác là công cụ hữu ích cho cả người bảo vệ đang kiểm định phần mềm của chính họ lẫn bất kỳ ai đang làm điều tương tự với phần mềm của người khác. Vì lý do đó, các công trình tương đương của Anthropic đều bị hạn chế quyền truy cập, trong khi Zhipu dự định công bố trọng số (weights) của GLM-5.3 để bất kỳ ai cũng có thể tải xuống.

Bản phát hành của chính Zhipu có phần chừng mực hơn so với các bài báo đưa tin về nó. Con số trên CyberGym là có thật và nằm trong tài liệu. Tuy nhiên, đó cũng là kết quả hẹp nhất trong ba kết quả về an ninh mạng mà công ty công bố, và Zhipu cũng thẳng thắn thừa nhận rằng hai kết quả còn lại thì ngược lại.

Ba bộ tiêu chuẩn, ba bức tranh khác biệt

CyberGym bắt đầu từ mã nguồn mà mô hình có thể đọc và kiểm tra xem nó có thể tìm ra lỗ hổng và xác nhận lỗi đó là thật hay không. Đó là kết quả đã gây chú ý, với biên độ chênh lệch chỉ là bảy phần mười của một điểm phần trăm.

ExploitBench đặt ra một yêu cầu khó hơn, đòi hỏi mô hình phải suy luận về một lỗ hổng thực tế và cách thức khai thác nó. GLM-5.3 đạt 54,4%, cao hơn gấp đôi so với mức 24,4% của phiên bản tiền nhiệm. Mythos 5 đạt 78,0% và GPT-5.6 Sol đạt 76,5%.

ExploitGym đếm số lượng tác vụ khai thác mà một mô hình hoàn thành trong một khoảng thời gian cố định. GLM-5.3 hoàn thành 105 tác vụ trong hai giờ và 130 tác vụ trong sáu giờ. Mythos 5 hoàn thành 181 và 247 tác vụ tương ứng.

Hai kết quả đó ít được nhắc đến, nhưng chúng lại là những kết quả mô tả rõ khoảng cách thực tế. Tìm ra một lỗi và xây dựng một mã khai thác hoạt động được từ lỗi đó là hai công việc khác nhau. Cách hiểu của Zhipu là càng tiến xa trong chuỗi quy trình đó, mô hình của họ càng tụt hậu, và công ty đã nêu rõ điều này trong bản phát hành thay vì để người khác tự khám phá.

Bar chart comparing five AI models across three cybersecurity benchmarks. GLM-5.3 leads on CyberGym at 84.5 but trails Mythos 5 on ExploitBench and ExploitGym.

Mô hình nào của Anthropic, và tại sao nó liên tục thay đổi

Một phần sự nhầm lẫn trong các bài đưa tin đến từ việc Zhipu so sánh ba mô hình Anthropic khác nhau ở ba nơi khác nhau. Bảng benchmark chính đặt GLM-5.3 đối đầu với Opus 4.8. Các biểu đồ hiệu suất sử dụng Fable 5. Phần an ninh mạng sử dụng Mythos 5. Bất kỳ ai đọc lướt qua đều sẽ rút ra một kết luận so sánh đơn nhất vốn không tồn tại.

Về lập trình, bức tranh này mang tính hỗn hợp thay vì áp đảo. GLM-5.3 dẫn trước Opus 4.8 ở một số bài kiểm tra nhưng lại tụt hậu ở những bài khác, và Zhipu thừa nhận rõ ràng rằng mô hình của họ vẫn đứng sau Claude Fable 5 trên chính bộ benchmark lập trình nội bộ của công ty.

Các bài kiểm tra đã được thực hiện như thế nào

Các chú thích về phương pháp luận chứa đựng thông tin mà các bản tóm tắt đã bỏ qua. Zhipu đã đánh giá GLM-5.3 trên CyberGym, ExploitGym, ExploitBench, Terminal Bench và một số tác vụ khác bên trong Claude Code 2.1.207, tác nhân lập trình của Anthropic.

Điều đó không có gì là sai trái. Sử dụng một bộ công cụ chung cho các mô hình là cách để đảm bảo sự công bằng, và Zhipu đã ghi lại các thiết lập mà họ sử dụng. Dù vậy, điều đáng chú ý là các tuyên bố về năng lực tiên phong của một mô hình mã nguồn mở (open-weights) từ Trung Quốc lại được đo lường thông qua phần mềm tác nhân của Mỹ. Điều này cho thấy vị thế của lớp công cụ trong cuộc cạnh tranh này, điều mà các điểm số mô hình không thể hiện được.

Hai chi tiết nữa cần được lưu ý trước khi coi kết quả CyberGym là đã ngã ngũ. Điểm số này là kết quả của một lần chạy duy nhất, được báo cáo dưới dạng pass@1 trên 1.507 tác vụ, không có số liệu về độ biến thiên. Khoảng cách bảy phần mười điểm giữa hai lần chạy đơn lẻ không phải là căn cứ để khẳng định chắc chắn. Ngoài ra, ngân sách thời gian của ExploitGym đã được chuẩn hóa bằng cách sử dụng tốc độ thông lượng từ Artificial Analysis, với các hệ số điều chỉnh được liệt kê cho GLM-5.3, Kimi K3 và Qwen3.8 Max, nhưng lại không có cho Mythos 5.

Số lượng lỗ hổng và con số còn thiếu

Ngoài các bộ benchmark, Zhipu cho biết họ đã hợp tác với các đội ngũ bảo mật tại Trung Quốc để chạy các mô hình của mình trên các mã nguồn thực tế, xác định được 2.436 lỗ hổng trên 269 dự án mã nguồn mở. Phân loại mức độ nghiêm trọng gồm 107 lỗi nghiêm trọng, 990 lỗi cao, 1.286 lỗi trung bình và 53 lỗi thấp. Lỗi lâu đời nhất có từ năm 1981, và trung bình một lỗ hổng đã tồn tại trong mã nguồn 26,6 năm trước khi được tìm thấy.

Summary panel from Zhipu's release showing 2,436 findings tracked, 53 publicly disclosed, 2,383 under embargo and 1,097 labelled critical and high.

Có một sự khác biệt cần lưu ý cẩn thận. Bảng tóm tắt của Zhipu dán nhãn 1.097 phát hiện là nghiêm trọng và cao, khớp với bảng mức độ nghiêm trọng. Tuy nhiên, phần nội dung văn bản của cùng bản phát hành đó lại mô tả 1.097 lỗi này là từ trung bình đến cao. Một số trang tin đã sao chép lại phiên bản thứ hai này.

Con số này cũng có được sau quá trình mà Zhipu mô tả là đánh giá chuyên gia, sàng lọc và loại bỏ trùng lặp, vì vậy kết quả đầu ra thô của mô hình không phải là thứ được báo cáo. Trong số 2.436 phát hiện, 53 lỗi đã được công khai, và 2.383 lỗi vẫn đang trong tình trạng bảo mật (embargo). Bản phát hành không cho biết có bao nhiêu lỗi trước đây chưa từng được biết đến, và cũng không cho biết có bao nhiêu lỗi đã được xác nhận độc lập. Đó là hai con số có thể biến một tuyên bố về số lượng thành một tuyên bố về năng lực thực sự.

Điều gì quan trọng hơn bảng benchmark

Hai điều trong bản phát hành có hệ quả lâu dài hơn biên độ của CyberGym.

Thứ nhất là hiệu suất. Zhipu báo cáo GLM-5.3 đạt 31,4% trên bộ benchmark lập trình nội bộ của họ với khoảng 50.000 token đầu ra mỗi tác vụ, so với Opus 4.8 đạt 29,5% khi sử dụng 120.000 token. Hiệu quả công việc tốt hơn một chút với chưa đầy một nửa số token là một lập luận về chi phí, và chi phí quyết định liệu các đội ngũ bảo mật không có ngân sách lớn có thể chạy các công cụ này hay không.

Thứ hai là sự phân phối. Zhipu cho biết các trọng số sẽ được công bố sau khi quá trình đánh giá an toàn và củng cố hoàn tất. Điều đó vẫn chưa xảy ra, và cho đến khi nó thành hiện thực, tuyên bố về mô hình mở (open-weights) vẫn chỉ là một cam kết chứ chưa phải là sự thật. Nếu cam kết này được thực hiện, một mô hình có năng lực phát hiện lỗ hổng đã được chứng minh sẽ trở thành thứ mà bất kỳ đội ngũ nào cũng có thể tải xuống và chạy cục bộ, kể cả ở những thị trường sẽ không bao giờ có quyền truy cập vào các mô hình của Mỹ bị kiểm soát xuất khẩu.

Các trọng số dự kiến sẽ được công bố vào cuối tháng 8.

Xem thêm: Anthropic bước vào Nhà Trắng và Mythos chính là lý do Washington cho phép điều đó

Banner for the AI & Big Data Expo event series.

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy tham khảo AI & Big Data Expo diễn ra tại Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác bao gồm Cyber Security & Cloud Expo. Nhấp vào đây để biết thêm thông tin.

AI News được vận hành bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới tại đây.

ZhipuGLM-5.3AI Trung QuốcAn ninh mạngPhân tích AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Artificial Intelligence News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.