IT Home
85

Mô hình

Zhipu AI ra mắt GLM-5.3: Mô hình mã nguồn mở mạnh nhất về lập trình, hiệu suất tăng 50%

(giờ Việt Nam)

Tóm tắt AI

Zhipu AI vừa trình làng GLM-5.3, phiên bản nâng cấp tập trung vào khả năng lập trình với hiệu suất tăng 50% so với bản tiền nhiệm, dẫn đầu các bảng xếp hạng mã nguồn mở như Terminal Bench 3.0.

Bản dịch AI

Theo tin từ IT ngày 14 tháng 8, Zhipu hôm nay đã chính thức ra mắt GLM-5.3. So với GLM-5.2, mô hình nền tảng (base model) không thay đổi, nhưng thông qua quá trình hậu huấn luyện (post-training) Scaling, giới hạn thông minh của mô hình đã được nâng cao đáng kể: môi trường tác vụ dài hạn tăng gấp hàng chục lần, các loại hình môi trường phong phú đa dạng hơn và thời gian hậu huấn luyện siêu dài.

So với thế hệ trước, các khả năng mới của GLM-5.3 bao gồm:

Khả năng lập trình mạnh mẽ hơn. GLM-5.3 là mô hình mã nguồn mở có khả năng lập trình mạnh nhất, tăng 50% so với GLM-5.2 trong các bài đánh giá trải nghiệm thực tế nội bộ, đồng thời giành vị trí số 1 trong các mô hình mã nguồn mở tại các bài kiểm tra chuẩn công khai bao gồm Terminal Bench 3.0 và Agents' Last Exam (CLI).

Khả năng an ninh mạng. Trong các tác vụ bảo mật như kiểm tra mã nguồn hộp trắng (white-box code review) và phát hiện lỗ hổng, hiệu suất của GLM-5.3 ngang bằng với Mythos 5, cho thấy tiềm năng mạnh mẽ trong các kịch bản phòng thủ an ninh mạng.

Hậu huấn luyện Scaling. Tất cả những cải tiến nêu trên đều đến từ quá trình hậu huấn luyện. Dựa trên IndexShare, SAO và thế hệ khung Slime mới liên tục phát triển, Zhipu đã thúc đẩy học tăng cường (reinforcement learning) một cách hiệu quả trên cùng một mô hình nền tảng với GLM-5.2, cho thấy Zhipu có lẽ vẫn còn cách rất xa giới hạn thông minh của mô hình nền tảng này.

Mã nguồn mở. Zhipu sẽ công khai trọng số mô hình (model weights) sau hai tuần kể từ khi ra mắt, sau khi hoàn tất các đánh giá bảo mật và củng cố mô hình.

Zhipu cho biết, trong nhiều bài kiểm tra chuẩn phổ biến, GLM-5.3 hiện là mô hình mã nguồn mở có thứ hạng cao nhất, với khả năng lập trình và tác tử (agent) tiệm cận Claude Fable 5, đồng thời trải nghiệm lập trình vượt trội hơn các mô hình nội địa khác.

Trong Terminal-Bench 3.0, bài kiểm tra đo lường khả năng hoàn thành các tác vụ phức tạp của mô hình trong môi trường thiết bị đầu cuối thực tế, điểm số của GLM-5.3 đã tăng từ 4.6 lên 28.3;

Trong DeepSWE v1.1, bài kiểm tra tập trung vào kỹ thuật phần mềm dài hạn và khả năng sửa đổi mã nguồn liên tục, điểm số tăng từ 46.2 lên 66.9;

Trong Agents' Last Exam, bài kiểm tra bao phủ nhiều kịch bản chuyên nghiệp thực tế, nhấn mạnh vào sự hợp tác đa công cụ và tác vụ dài hạn, điểm số tăng từ 23.8 lên 28.5;

Trong GDPval-AA v2, bài kiểm tra bao phủ 44 ngành nghề và đánh giá công việc tri thức giá trị cao thực tế, mô hình đạt 1.769 điểm, thể hiện khả năng thực thi tác vụ chuyên môn nảy sinh từ năng lực lập trình.

图片

Z.ai Code Bench do Zhipu tự phát triển giúp đánh giá trải nghiệm tổng thể của mô hình trong các kịch bản lập trình thực tế. Mô hình sẽ được đặt vào môi trường phát triển cục bộ phức tạp và thực hiện các tác vụ end-to-end ở các cấp độ tư duy khác nhau, sát với trải nghiệm thực tế của lập trình viên khi sử dụng Coding Agent.

Kết quả kiểm tra cho thấy GLM-5.3 đạt được sự cân bằng tốt hơn giữa hiệu quả và tỷ lệ sử dụng Token. Ở cấp độ High, GLM-5.3 đạt độ chính xác 31.4%, vượt qua mức 29.5% của Claude Opus 4.8 ở cấp độ cao nhất. Mỗi tác vụ của GLM-5.3 xuất ra trung bình khoảng 50.000 tokens, trong khi Opus 4.8 cần khoảng 120.000 tokens, điều này có nghĩa là GLM-5.3 có thể hoàn thành tác vụ với lộ trình thực thi ngắn hơn.

图片

Kể từ hôm nay, công cụ lập trình ZCode và công cụ hiệu suất AutoClaw của Zhipu chính thức ra mắt, đồng thời mở gói GLM Coding Plan cho toàn bộ người dùng và mở đăng ký.

Các nền tảng lập trình như TraeWork / TraeCode / Coze, WorkBuddy / CodeBuddy, Qoder / QwenWork, CatPaw, JoyCode, OpenCode đã mở quyền truy cập trải nghiệm sớm.

API sẽ sớm ra mắt, trọng số mô hình đầy đủ sẽ được công khai mã nguồn trong vòng hai tuần tới. Trước đó, cần hoàn tất các bước củng cố bảo mật cần thiết để hạn chế tối đa khả năng tấn công tiềm ẩn, đồng thời bảo lưu giá trị phòng thủ của mô hình.

IT được biết từ thông báo của Zhipu, vào lúc 13:00 hôm nay, hạn mức của GLM Coding Plan đã được đặt lại, tất cả người dùng có thể thấy hạn mức sử dụng đã được làm đầy trong phần "Thống kê sử dụng" trên trang cá nhân.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.