Mô hình
7 nghiên cứu sinh đào tạo mô hình 7B từ con số 0 chỉ trong 3 tháng: Công khai toàn bộ mã nguồn và dữ liệu
(giờ Việt Nam)
Tóm tắt AI
Một nhóm nghiên cứu sinh đã huy động hàng trăm AI Agent để tự động hóa quy trình phát triển, đánh dấu bước tiến mới trong việc dùng AI để tạo ra AI.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
2026-09-15 10:17:34 Nguồn: QbitAI
Hàng trăm Agent tham gia nghiên cứu phát triển, AI bắt đầu tự tạo ra AI
Yun Zhong, đưa tin từ Aofeisi
QbitAI | Tài khoản chính thức QbitAI
7 nghiên cứu sinh tiến sĩ tại Học viện Trung Quan Thôn (ZGCM), Bắc Kinh đã dành trọn một kỳ nghỉ hè để huấn luyện từ đầu một mô hình lớn 7B – ZGCM-1.
Sau đó, họ đã công khai toàn bộ dữ liệu huấn luyện và công thức ở các giai đoạn, trọng số mô hình, mã nguồn huấn luyện, các checkpoint trung gian và nhật ký, cho phép bất kỳ nhà nghiên cứu quan tâm nào cũng có thể truy xuất và tái hiện toàn bộ quy trình.
Trong nhiều bài đánh giá tổng quát, ZGCM-1 đạt hiệu suất tương đương với các mô hình cùng quy mô như Qwen3-8B; trong một số bài đánh giá về suy luận toán học và tìm kiếm, nó cũng có thể so sánh với các mô hình quy mô lớn hơn như Qwen3-235B-A22B hay GLM-5.1.
Nhưng điều khiến người ta tò mò hơn cả điểm số cuối cùng chính là: toàn bộ quy trình kỹ thuật từ dữ liệu, huấn luyện, cụm máy chủ đến đánh giá, vốn thường cần sự phối hợp của hàng trăm người tại các tập đoàn lớn, làm sao bảy người có thể thực hiện được?
Họ đã tự xây dựng cho mình một đội ngũ gồm hàng trăm Agent, chia nhau xử lý dữ liệu, chạy thử nghiệm, xem nhật ký và thực hiện đánh giá, trực tiếp thực hành mô hình nghiên cứu phát triển "AI4AI".
Sau khi huấn luyện xong mô hình, nhóm còn thực hiện đánh giá hiệu suất thực tế của các Agent trong toàn bộ quy trình phát triển, với hy vọng dựa trên thực tiễn huấn luyện mô hình lớn hoàn chỉnh lần này để đưa ra những kết luận kỹ thuật xác thực về hiện trạng RSI.
Còn về lý do bắt đầu công việc này, phải kể từ một bữa lẩu.
△ Tổng quan năng lực mô hình ZGCM-1 và lộ trình kỹ thuật chính

Đọc nhiều báo cáo kỹ thuật, vẫn muốn tự mình huấn luyện một lần
Bảy người ban đầu tập hợp lại vì sở thích: hai người thuộc lĩnh vực trí tuệ nhân tạo, hai người thuộc lĩnh vực mạng, ba người còn lại lần lượt đến từ ngành hóa học, sinh học và an ninh mạng.
Bình thường, họ chủ yếu thực hiện tinh chỉnh (fine-tuning) trên các mô hình có sẵn. Dù đã đọc không ít báo cáo kỹ thuật, nhưng nhiều vấn đề họ vẫn chưa hiểu rõ: dữ liệu rốt cuộc chọn thế nào, khi huấn luyện gặp sự cố thì kiểm tra ra sao, và phương pháp được viết trong báo cáo cuối cùng đã phải trải qua bao nhiêu lần thất bại mới đúc kết được? Một câu "chúng tôi đã làm sạch dữ liệu", khi áp dụng vào kỹ thuật thực tế, rốt cuộc đòi hỏi bao nhiêu khối lượng công việc?
Khi ăn lẩu, mọi người đã trò chuyện về những băn khoăn này và nảy ra một ý tưởng: vì chỉ đọc báo cáo thì luôn có những điểm không hiểu rõ, vậy tại sao không tự mình huấn luyện từ đầu một lần?
Lúc đó, họ thậm chí còn muốn dùng một mô hình 7B để thách thức các mô hình như Sonnet. Vì tham số không chứa được nhiều kiến thức như vậy, họ để mô hình suy nghĩ lâu hơn, học cách tìm kiếm và sử dụng công cụ.
Về việc có thể đi được bao xa, không ai dám chắc chắn. Họ muốn bắt tay vào làm trước, đồng thời lưu lại quá trình để những nhà nghiên cứu tò mò tương tự ở các trường đại học khác có tài liệu tham khảo.
Các thầy cô nửa tin nửa ngờ, nhưng vẫn quyết định để họ thử sức và cấp cho một phần tài nguyên tính toán.
Những ngày tiếp theo, cả nhóm thức đêm chạy đua để tái hiện các dự án hiện có, nhanh chóng lặp lại một mô hình nhỏ. Nhóm đã khá thuận lợi trong việc chạy thông suốt quy trình hoàn chỉnh, giúp các thầy cô nhìn thấy khả năng đầu tư tiếp, nhờ đó nhóm nhận được nhiều tài nguyên hơn và ý tưởng trên bàn ăn bắt đầu trở thành dự án kỹ thuật cần thúc đẩy mỗi ngày.
Sau khi thực sự bắt đầu huấn luyện mô hình 7B, họ mới phát hiện ra còn rất nhiều thứ chưa thực sự hiểu rõ. Một số khái niệm từng thấy trong bài báo, nhưng khi cần sửa mã nguồn hay giải thích các hiện tượng thực nghiệm, họ lại bị khựng lại.
Thế là mọi người để các Agent bắt đầu nghiên cứu và giải thích từ những nguyên lý cơ bản, sau đó quay lại xác thực trong mã nguồn và thực nghiệm. Những kiến thức vốn khô khan bắt đầu tương ứng với các triển khai cụ thể, cũng như giải thích lý do tại sao một lần huấn luyện lại không thể tiếp tục.
Bảy người không làm xuể, liền xây dựng đội ngũ hàng trăm Agent
Cũng có lúc cảm thấy không thể làm nổi, họ triển khai toàn bộ dự án: dữ liệu, thuật toán, huấn luyện, cụm máy chủ, đánh giá... mỗi hạng mục đều tương ứng với một nhóm chuyên trách tại các tập đoàn lớn.
Bảy người vừa phải thúc đẩy nhiệm vụ, vừa phải liên tục bổ sung kiến thức, các loại vấn đề cũng nối tiếp nhau ập đến.
Dữ liệu đặc biệt là như vậy: hàng nghìn tỷ token đến từ các nguồn khác nhau, chất lượng không đồng đều, việc làm sạch, khử trùng lặp, kiểm tra định dạng, đối chiếu phân phối, làm xong một vòng lại phải tiếp tục kiểm tra.
Khi tất cả những khâu này cùng đè nặng lên bảy người, khối lượng công việc đã vượt xa khả năng chịu đựng của họ.
Vì vậy, họ bắt đầu tự xây dựng cho mình một đội ngũ Agent.
Vài người điều phối hàng trăm Agent, dần dần phân chia thành các nhóm Agent con chuyên làm dữ liệu, chạy thực nghiệm và đánh giá. Họ còn xây dựng một hệ thống đăng tải nhiệm vụ và báo cáo tương tự như diễn đàn, giúp nhiệm vụ có người nhận, tiến độ có nơi theo dõi, kết quả có thể được kiểm tra và đánh giá công việc của các Agent khác nhau.
Các nhà nghiên cứu chịu trách nhiệm đề xuất mục tiêu, thiết lập ràng buộc và đưa ra các phán đoán quan trọng, còn các Agent tiếp tục thúc đẩy công việc cụ thể.
Ví dụ trong xử lý dữ liệu, đội ngũ Agent mà nhóm xây dựng có thể dựa trên yêu cầu chất lượng do con người đưa ra để viết kịch lệnh làm sạch, kiểm tra xem phân phối dữ liệu có đạt chuẩn hay không, và tự động điều chỉnh quy tắc cũng như ngưỡng dựa trên kết quả, tạo thành một vòng lặp khép kín.
Trong khâu thực nghiệm, chúng cũng có đầy đủ khả năng từ gửi nhiệm vụ, giám sát nhật ký đến định vị lỗi và điều chỉnh cấu hình, thậm chí có thể chủ động phát hiện các nút thắt cổ chai về lưu trữ và truyền tải dữ liệu, tối ưu hóa quy trình I/O của khung huấn luyện, từ đó nâng cao tốc độ huấn luyện.
Đồng thời, để tối ưu hóa hiệu quả lặp và giao tiếp giữa các Agent, nhóm đã thông qua nền tảng ZGent tự phát triển để tích lũy các thảo luận cuộc họp, quyết định nghiên cứu và kế hoạch thành ngữ cảnh chia sẻ, sau đó biến các kịch lệnh, quy trình làm việc và kinh nghiệm gỡ lỗi đã được xác thực thành các Skill có thể tái sử dụng. Các Agent gia nhập sau đó có thể tiếp nối kinh nghiệm trước đó để làm việc.
Trong cuộc sống hàng ngày của mọi người, cũng có thêm những việc như làm rõ vấn đề, tổ chức nhiệm vụ tốt hơn, rồi quay lại kiểm tra kết quả.
△ Con người và Agent cùng tham gia nghiên cứu phát triển, các quyết định cuộc họp và kinh nghiệm thực nghiệm được tái sử dụng liên tục trong các nhiệm vụ tiếp theo

Sau đó, mọi người dần nhận ra rằng cách làm tận dụng AI để nghiên cứu phát triển AI này chính là "AI4AI" đang rất thịnh hành gần đây.
Tuy nhiên, nếu truy vấn xem AI rốt cuộc đã có thể độc lập làm được bao nhiêu việc, thì chỉ dựa vào ấn tượng "đã giúp đỡ rất nhiều" là chưa đủ.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.