TechNode
85

Nghiên cứu

Đội ngũ AI của WeChat công bố mô hình WeLM với quy mô lên tới 617 tỷ tham số

(giờ Việt Nam)

Tóm tắt AI

Tencent giới thiệu phương pháp Hidden Decoding giúp mở rộng mô hình WeLM lên 617 tỷ tham số mà không cần tăng kích thước cấu trúc Transformer cốt lõi, tối ưu hóa hiệu suất tính toán.

Bản dịch AI

WeChat AI Team Details WeLM Models Scaling to 617B Parameters

Đội ngũ AI WeChat của Tencent vừa trình bày chi tiết một phương pháp mở rộng quy mô mới cho dòng mô hình WeLM của họ. Nhóm đã huấn luyện các mô hình WeLM-HD4-80B và WeLM-HD4-80B bằng một phương pháp có tên là Hidden Decoding (Giải mã ẩn), giúp mở rộng mỗi token thành nhiều luồng tính toán nội bộ mà không làm tăng kích thước của cấu trúc Transformer cốt lõi.

Mô hình 80B kích hoạt 3 tỷ tham số, trong khi mô hình 617B kích hoạt 23 tỷ tham số. Trong các bài kiểm tra của nhóm, cả hai mô hình đều vượt trội hơn các mô hình cơ sở tự hồi quy (autoregressive baselines) tương ứng trên chín tiêu chuẩn đánh giá chung. Chi phí huấn luyện được báo cáo gấp 5,1 lần so với mô hình cơ sở đối với phiên bản 80B và gấp 4,4 lần đối với phiên bản 617B. [Blog chính thức của WeLM]

Honor Sets Aug. 12 Launch for Its Robot Phone in ChinaInsta360 Ace Pro 3 specs reportedly leak with 1-inch sensor and 8K videoThe AI race is moving into data centers as Alibaba Cloud cuts delivery time to 100 daysBeyond mobility: Unitree’s GD01 signals the next phase of China’s robotics battle
WeChat AIWeLMMô hình ngôn ngữTencentDeep Learning
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ TechNode. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.