Mô hình
China Telecom ra mắt mô hình ngôn ngữ Xing4.0-29B-A4B: Đột phá huấn luyện trên nền tảng Ascend
(giờ Việt Nam)
Tóm tắt AI
China Telecom vừa công bố Xing4.0-29B-A4B, mô hình 29 tỷ tham số đầu tiên tại Trung Quốc được huấn luyện hoàn toàn trên siêu máy tính Ascend Atlas 900 A3 và khung MindSpore, đồng thời chính thức mở mã nguồn.
Bản dịch AI
Theo tin từ IT ngày 20 tháng 9, Công ty TNHH Công nghệ Trí tuệ Nhân tạo China Telecom đã chính thức ra mắt thế hệ mô hình lớn mới Xing4.0-29B-A4B vào ngày 17 tháng 9. Mô hình này tập trung vào các khả năng như hiểu nhiệm vụ phức tạp, lập kế hoạch nhiệm vụ, gọi công cụ và tự thực thi, đồng thời hỗ trợ xử lý ngữ cảnh dài, có thể ứng dụng trong các lĩnh vực như phát triển mã nguồn, phân tích dữ liệu, tự động hóa văn phòng và dịch vụ đời sống.

Huawei Trung Quốc chính thức thông báo vào tối qua rằng, Xing4.0-29B-A4B có tổng tham số là 29B, với tham số kích hoạt chỉ 4B. Đây là mô hình lớn hàng chục tỷ tham số đầu tiên tại Trung Quốc được huấn luyện dựa trên siêu nút làm mát bằng chất lỏng Ascend Atlas 900 A3 SuperPoD và khung huấn luyện MindSpore, được tối ưu hóa chuyên sâu cho các nhiệm vụ kỹ thuật phức tạp.
Mô hình sử dụng thiết kế kiến trúc thế hệ mới, giúp nâng cao hơn nữa khả năng xử lý nhiệm vụ dài hạn và thực thi đa bước, cho phép tự động lập kế hoạch lộ trình nhiệm vụ, gọi công cụ và hoàn thành các nhiệm vụ phức tạp dựa trên mục tiêu mà người dùng đặt ra.
Phía Huawei cho biết, việc tạo mã nguồn cấp trung đến cao cấp và thực thi tác nhân (agent) của mô hình là một bài kiểm tra toàn diện về khả năng hiểu ngữ cảnh dài hạn, lập luận lập kế hoạch phức tạp và phối hợp gọi công cụ. Đội ngũ Huawei đã phối hợp chặt chẽ với đội ngũ China Telecom để thực hiện các bước đột phá mang tính hệ thống từ hệ thống dữ liệu, kiến trúc mô hình, kỹ thuật huấn luyện cho đến học tăng cường.
Nền tảng dữ liệu: Xây dựng hệ thống dữ liệu bao gồm hàng chục nghìn tỷ token xoay quanh toàn bộ vòng đời tiền huấn luyện và hậu huấn luyện. Giai đoạn tiền huấn luyện đã hoàn thành việc làm sạch dữ liệu đa nguồn không đồng nhất ở quy mô PB, đồng thời đưa vào lượng lớn quỹ đạo hành vi của tác nhân và đồ thị tri thức có cấu trúc. Giai đoạn hậu huấn luyện thiết lập các container sandbox có độ đồng thời cao, xây dựng dữ liệu tổng hợp cho các nhiệm vụ dài hạn đầu cuối và thiết lập cơ chế kiểm tra tự động để đảm bảo tính chính xác của dữ liệu.
Thiết kế kiến trúc: Được thiết kế chuyên biệt cho các nhiệm vụ Agent dài hạn; sử dụng cơ chế nén bộ nhớ đệm KV bằng chú ý biến tiềm ẩn đa đầu (MLA); dự đoán đa Token (MT) để tăng cường tính mạch lạc của văn bản tạo ra; ràng buộc đa tạp mHC (mHC manifold constraint) để giải quyết vấn đề mất ổn định số học trong huấn luyện; cùng bộ tối ưu hóa Muon và QK-Clip để đảm bảo sự ổn định khi huấn luyện. Quá trình huấn luyện áp dụng chiến lược tiến triển theo từng giai đoạn, mở rộng dần từ độ dài chuỗi 4K lên 32K/128K/256K, xây dựng hệ thống năng lực dài hạn một cách bài bản.
Tối ưu hóa kỹ thuật: Xing4.0-29B-A4B đạt mức tăng hiệu suất huấn luyện 96% trên cụm siêu nút Ascend nhờ tối ưu hóa phối hợp phần cứng và phần mềm đa tầng, gần như tăng gấp đôi hiệu suất: Dựa trên khả năng thích ứng toàn diện của MindSpore với kết nối đa dư mHC và cơ chế chuỗi dài DSA, đối với MoE hạt mịn (64 định tuyến / Top4 kích hoạt), thông qua cân bằng tải chuyên gia, Grouped GEMM, chồng lấp tính toán truyền thông và hợp nhất đồ thị DVM, thông lượng đã tăng 32%; việc tính toán lại có chọn lọc ở cấp độ lớp và toán tử giúp tăng thêm 19%; toán tử hợp nhất Ascend C mHC tự phát triển giúp giải quyết tình trạng phân mảnh Sinkhorn, cải thiện hiệu suất tính toán 30%, giúp tổng thông lượng mạng tăng thêm 25%.
Học tăng cường đa chuyên gia: Dựa trên hệ sinh thái Ascend để hoàn thiện việc thích ứng khung học tăng cường Slime, thực hiện huấn luyện học tăng cường đa chuyên gia hướng tới Agent, Coding và Reasoning. Thông qua công nghệ MOPD, mô hình đạt được sự tích hợp hiệu quả các năng lực đa chuyên gia, từ đó nâng cao hơn nữa hiệu suất trong các nhiệm vụ lập luận phức tạp và tác nhân.
Hiện tại, Ascend đã hỗ trợ hơn 40 mô hình hàng đầu trong ngành hoàn thành huấn luyện nguyên bản, đồng thời là nhà cung cấp duy nhất tại Trung Quốc hỗ trợ thương mại hóa tiền huấn luyện quy mô lớn và triển khai thành công các mô hình lớn đạt chuẩn SOTA.
IT cung cấp địa chỉ mã nguồn mở như sau:
GitHub: https://github.com/XingChen-AGI/Xing4.0-29B-A4B
HuggingFace: https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B
ModelScope: https://modelscope.cn/models/XingChen-AGI/Xing4.0-29B-A4B
Gitee: https://gitee.com/xingchen-agi/xing4.0-29b-a4b
Modelers: https://modelers.cn/models/XingChen-AGI/Xing4.0-29B-A4B
Tuyên bố quảng cáo: Các liên kết chuyển hướng bên ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin và tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.