Mô hình
Đột phá từ Zhipu AI: Đường lối phát triển mô hình tự tiến hóa RSI chính thức lộ diện
(giờ Việt Nam)
Tóm tắt AI
Giáo sư Đường Kiệt vừa công bố thành quả đầu tiên của dự án RSI, đánh dấu cột mốc quan trọng khi các mô hình GLM bắt đầu có khả năng tự tham gia vào quá trình xây dựng và tối ưu hóa chính mình.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
2026-09-17 16:28:23 Nguồn: QbitAI
GLM đã bắt đầu tham gia vào việc xây dựng GLM.
GLM, đã bắt đầu tham gia vào việc xây dựng GLM.
Giáo sư Khoa Khoa học Máy tính Đại học Thanh Hoa, đồng thời là nhà sáng lập Zhipu, ông Tang Jie, vừa chia sẻ một trường hợp thực tế về giai đoạn đầu của RSI mà họ quan sát được từ nội bộ:
Infra Agent được vận hành bởi GLM-5.3 đã tham gia từ đầu vào việc xây dựng và tối ưu hóa một hệ thống suy luận cấp sản xuất trên cụm máy chủ gồm hơn 100.000 chip nội địa.
Chưa đầy hai tuần, lưu lượng truy cập (throughput) đầu cuối đã tăng trực tiếp lên gấp 3,2 lần so với mức cơ sở ban đầu.

Điều quan trọng là, đằng sau thành quả này không chỉ đơn thuần là "AI viết code".
Từ các vấn đề về độ chính xác của toán tử (operator precision), nút thắt cổ chai trong việc xử lý đồng thời đa tầng Python/C++, cho đến tối ưu hóa hiệu năng Kernel, Agent đã có thể tự đọc phản hồi từ hệ thống, đưa ra giả thuyết, sửa đổi mã nguồn, chạy thử nghiệm và tiếp tục lặp lại dựa trên kết quả thu được.
Ví dụ, nó đã định vị được tình trạng tắc nghẽn đồng thời do Python GIL gây ra trong kịch bản KV Transfer, giúp giảm mức tổn thất hiệu năng từ hơn 20% (so với Prefill đơn lẻ) xuống còn dưới 1%; đồng thời đạt được mức tăng hiệu năng 1,71 lần trên toán tử KDA Decode thông qua việc tái cấu trúc tính toán.
Nói cách khác, một vòng lặp khép kín mang tính "búp bê Nga" đã xuất hiện:
GLM tối ưu hóa hệ thống vận hành GLM, và hệ thống đã được tối ưu hóa này lại tiếp tục gánh vác các thế hệ GLM mới.
Tang Jie đã tóm tắt điều này trong một câu:
Mô hình tối ưu hóa hệ thống, hệ thống gánh vác mô hình.
Tất nhiên, điều này vẫn còn rất xa so với khái niệm thực sự về việc "AI tự thiết kế và huấn luyện người kế nhiệm của chính mình một cách hoàn toàn tự chủ".
Việc đặt mục tiêu, vạch ra ranh giới và đánh giá rủi ro hiện vẫn do các kỹ sư con người đảm nhiệm.
Bản thân Zhipu cũng khẳng định rõ ràng rằng họ chưa đạt đến trình độ RSI.
Nhưng lý do khiến bài chia sẻ này đáng để xem xét kỹ lưỡng chính là ở đây:
Lần đầu tiên, RSI đã có một hình hài mang tính kỹ thuật cao, thậm chí đã được đưa vào môi trường sản xuất, vượt xa những thảo luận trừu tượng về việc "một ngày nào đó AI sẽ tự mạnh lên".
Dưới đây là nội dung gốc của blog kỹ thuật do Tang Jie chia sẻ, mời các bạn cùng theo dõi.
"Khoảnh khắc cảm thấy chấn động gần đây nhất"
Trong quá trình nghiên cứu và phát triển GLM, mô hình thường xuyên bộc lộ những khả năng khiến chúng tôi ngạc nhiên, thậm chí là cảm thấy bất an.
Tháng 10 năm 2025, chúng tôi bắt đầu khởi động nghiên cứu tăng cường khả năng bảo mật.
Nhận định lúc bấy giờ rất đơn giản:
Khả năng bảo mật là sự mở rộng tự nhiên của khả năng viết code; một mô hình có thể đọc hiểu mã nguồn phức tạp thì đương nhiên cũng có thể hiểu được các lỗ hổng trong mã nguồn đó.
Chúng tôi đã không lường trước được diễn biến sau đó; chưa đầy một năm, các đối tác bảo mật đã sử dụng GLM để phát hiện hàng nghìn lỗ hổng trong các kho mã nguồn thực tế.
Mô hình bắt đầu thay đổi cục diện an ninh mạng, đồng thời mang đến những nguy cơ chưa từng tồn tại trước đây.
Để đảm bảo khả năng này được sử dụng một cách có trách nhiệm, chúng tôi buộc phải thiết kế các kế hoạch truy cập đáng tin cậy cho nó.
Khoảnh khắc cảm thấy chấn động gần đây nhất đến từ một thay đổi căn bản hơn:
GLM bắt đầu tham gia ngày càng nhiều vào việc xây dựng chính trí tuệ nhân tạo.
Chúng tôi chứng kiến mô hình hoàn thành một công việc hạ tầng mà trước đây cần một đội ngũ Infra kỳ cựu phải mất nhiều tuần mới làm xong, và nhận ra rằng công việc này sẽ trực tiếp thay đổi cách huấn luyện các thế hệ mô hình tiếp theo. Chúng tôi càng tin tưởng hơn rằng: người kế nhiệm của chúng tôi chính là AI do chính tay chúng tôi tạo ra.
Thú thật, trước phiên bản GLM-4.7, việc chúng tôi sử dụng GLM để viết code nội bộ ít nhiều vẫn mang tính chất "bị ép buộc", dù sao nó cũng là "đứa con cưng" của mình.
Khi đó, PMF (Product-Market Fit) của mảng Coding vẫn chưa đến; còn hôm nay, GLM-5.3 đã trở thành người bạn đồng hành Coding không thể thiếu mỗi ngày của mọi người, từng bước tiến tới việc thay thế chúng tôi.
Nếu xu hướng này tiếp tục, với đủ tài nguyên tính toán và thời gian, đích đến của nó là một hệ thống có khả năng tự thiết kế và huấn luyện người kế nhiệm của chính mình một cách hoàn toàn tự chủ, đây được gọi là Tự cải thiện đệ quy (Recursive Self-Improvement, RSI).
Mặc dù chúng tôi vẫn chưa đi đến đó, nhưng hình thái sơ khai của nó đã xuất hiện.
Bài viết này ghi lại chính là một trong những trường hợp sơ khai đó.
Sử dụng phản hồi dày đặc để điều khiển Infra Agent tối ưu hóa hệ thống suy luận
Từ việc giúp mô hình chạy thành công trên phần cứng mới, cho đến việc xây dựng một dịch vụ suy luận hiệu năng cao có khả năng gánh vác lưu lượng sản xuất ổn định, là một công trình hệ thống khổng lồ.
Việc ra mắt GLM-5.3-Flash cũng đã trải qua quá trình tương tự như vậy.





Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.