Mô hình
Chuyên gia Alibaba hé lộ: Các phiên bản Qwen tương lai sẽ đạt quy mô 5-10 nghìn tỷ tham số
(giờ Việt Nam)
Tóm tắt AI
Sau phiên bản Qwen4.5, Alibaba dự kiến sẽ nâng cấp các mô hình ngôn ngữ lớn tiếp theo lên quy mô từ 5 đến 10 nghìn tỷ tham số để tăng cường sức mạnh xử lý.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
22-09-2026 11:48:05 Nguồn: QbitAI
Trong tương lai, các phiên bản như Qwen4.5, Qwen5 sẽ được mở rộng lên quy mô 5-10T tham số.
Ngày 22 tháng 9, tại Hội nghị Vân Tê (Yunqi Conference), Alibaba đã công bố hàng loạt tiến bộ về mô hình ngôn ngữ lớn (LLM). Công nghệ tự cải tiến đệ quy (RSI) của mô hình lớn đã bước đầu được đưa vào các khâu huấn luyện, suy luận và phối hợp chip-mô hình. Qwen4 dựa trên kiến trúc thế hệ mới hiện đang trong quá trình huấn luyện, và trong tương lai, các phiên bản như Qwen4.5, Qwen5 sẽ được mở rộng lên quy mô 5-10T tham số. Đồng thời, các phiên bản mới của mô hình tạo video, mô hình giọng nói, mô hình hình ảnh, mô hình thế giới, mô hình âm nhạc và mô hình toàn phương thức (full-modal) cũng đã được ra mắt trong ngày hoặc trong thời gian gần đây.
Theo đuổi trí tuệ cao hơn, Qwen tăng tốc tự tiến hóa
Các mô hình lớn đang tiến tới khả năng tự lặp lại. Tại Hội nghị Vân Tê năm nay, Alibaba đã trình diễn hệ thống các kết quả khám phá mới nhất về khả năng tự tiến hóa của mô hình lớn Qwen.
Trong việc tự huấn luyện mô hình, Qwen3.8-Max đã tự thiết lập quy trình huấn luyện, xây dựng dữ liệu huấn luyện, tự thiết kế các thử nghiệm và xác định lỗi. Trong điều kiện hoàn toàn "không có sự tham gia" của con người, mô hình đã liên tục lặp lại trong hơn 1 tháng và hoàn thành 33 vòng lặp hiệu quả. Dựa trên sự tối ưu hóa kết hợp từ RSI, hậu huấn luyện và hàng loạt công nghệ khác, phiên bản mới của Qwen3.8-Max đã tăng điểm số trên Artificial Analysis từ 40 lên 45 điểm, đứng cùng nhóm dẫn đầu với các mô hình mạnh nhất của Claude và GPT, vượt qua tất cả các mô hình nội địa khác như GLM5.3, Kimi-K3.
Về tối ưu hóa suy luận, Qwen3.8-Max đã tự thích ứng và tối ưu hóa khung suy luận cho mô hình Qwen3.8-Flash (kiến trúc thế hệ tiếp theo) trên dòng GPU mới của T-Head (Bình Đầu Ca) mà nó chưa từng tiếp xúc trước đó, giúp tăng 96% lưu lượng suy luận trên mỗi thực thể.
Trong thiết kế phối hợp giữa chip và mô hình, chỉ dựa trên một bản đặc tả mô-đun bus thực tế, Qwen3.8-Max đã tự triển khai toàn bộ quy trình từ front-end, kiểm thử đến back-end. Sau khi tự vận hành hơn 60 giờ và gọi các công cụ EDA hơn 10.000 lần, mô hình đã hoàn thành việc tối ưu hóa hiện thực vật lý, giúp giảm 42% diện tích.

Chú thích ảnh: Lưu Đại Nhất Hằng, người phụ trách dự án Qwen LLM, cho biết Scaling là con đường then chốt để tiến tới ASI, quy mô tham số của Qwen4.5 và Qwen5 dự kiến đạt mức 5 đến 10T.
Tại hội nghị, Alibaba đã trình diễn hàng loạt đổi mới công nghệ trong các lĩnh vực cốt lõi của mô hình lớn. Về tối ưu hóa kiến trúc, Qwen3.8-Flash đã mở mã nguồn kiến trúc mô hình Qwen thế hệ tiếp theo. Thông qua các đổi mới công nghệ cốt lõi như cơ chế chú ý (attention mechanism) và cơ chế truyền tải thông tin trong mô hình, nó đạt được hiệu suất mô hình tiên tiến trong khi chi phí huấn luyện giảm gần 90%. Đồng thời, dựa trên số lượng tham số kích hoạt cực thấp, nó đẩy hiệu suất tính toán suy luận lên một ngưỡng Pareto mới, trở thành mô hình có tỷ lệ hiệu năng/giá thành dẫn đầu ngành. Về mở rộng phương thức, mô hình toàn phương thức Qwen3.8-Omni đã chính thức ra mắt, đưa các phương thức khác nhau như âm thanh và video vào một khung hiểu thống nhất, mở ra phân vùng tư duy hoàn toàn mới cho mô hình lớn. Về mở rộng tham số, tham số càng lớn càng mang lại hiệu suất mạnh mẽ hơn, trong tương lai tổng số tham số của mô hình Qwen sẽ mở rộng lên quy mô 5 nghìn tỷ hoặc thậm chí 10 nghìn tỷ. Những đổi mới công nghệ này sẽ trở thành nền tảng cho thế hệ mô hình Qwen mới. Theo giới thiệu, mô hình Qwen4 đang được huấn luyện với kiến trúc hoàn toàn mới, còn Qwen4.5 và Qwen5 đều đang được triển khai ổn định.
Trong khi không ngừng khám phá giới hạn hiệu suất của mô hình lớn, Alibaba còn chia sẻ lợi ích công nghệ AI tiên tiến với các nhà phát triển và doanh nghiệp toàn cầu thông qua việc mở mã nguồn các mô hình lớn "toàn phương thức" và "toàn kích thước". Trong cộng đồng mã nguồn mở AI lớn nhất thế giới Hugging Face, mô hình Qwen3.8-27B đã vượt qua các mô hình đình đám trong lịch sử như DeepSeek-R1, Meta-Llama3.1 để trở thành mô hình lớn mã nguồn mở được yêu thích nhất (Most Likes) trong lịch sử nền tảng này. Dữ liệu công khai cho thấy, Alibaba đã mở mã nguồn hơn 460 mô hình lớn Qwen, lượt tải xuống các mô hình mã nguồn mở Qwen đã vượt mốc 3 tỷ, với hơn 300.000 mô hình phái sinh, giữ vững vị thế là gia đình mô hình mã nguồn mở số 1 thế giới.
Nâng cấp mô hình tạo nội dung nghe nhìn, mô hình tạo video hoàn toàn mới dự kiến ra mắt vào tháng 11
Trong lĩnh vực tạo nội dung thị giác đầy sáng tạo, Alibaba đang thông qua việc liên tục lặp lại và nâng cấp các mô hình tạo thị giác để giúp AI tạo ra những tác phẩm tốt hơn, mang lại trải nghiệm tốt hơn cho người dùng.
Mô hình tạo hình ảnh Qwen-Image-3.1 đã ra mắt, được tối ưu hóa và nâng cấp hoàn toàn cho các kịch bản thương mại thực tế như thương mại điện tử, sáng tạo và thiết kế. Nó nén thời gian thiết kế thị giác từ hàng giờ xuống mức giây, với chất lượng sánh ngang nhà thiết kế chuyên nghiệp và hỗ trợ chỉnh sửa hình ảnh chính xác.
Mô hình tạo âm nhạc Happy Shrimp phiên bản 1.1 đã được phát hành, cải thiện hơn nữa ở bốn khía cạnh chuyên môn: biểu cảm âm nhạc, chất lượng giọng hát, hát đa ngôn ngữ và hiểu lệnh. Nó hỗ trợ hơn 100 phong cách âm nhạc và hơn 10 ngôn ngữ phổ biến, bao phủ hai kịch bản tạo nội dung là bài hát có lời và nhạc không lời.
Phiên bản mới nhất của mô hình thế giới HappyOyster 2.0 Preview đã ra mắt. Thông qua việc nâng cấp toàn diện kiến trúc mô hình, phương pháp huấn luyện và hệ thống dữ liệu, nó đã cải thiện đáng kể các khả năng cốt lõi như tương tác thông minh thời gian thực, khả năng ghi nhớ, phản hồi thời gian thực và tuân thủ các quy luật vật lý, đưa mô hình thế giới thực sự từ phòng thí nghiệm ra ứng dụng thực tế.

Chú thích ảnh: Trịnh Ba, Phó chủ tịch công nghệ ATH của Alibaba, Giám đốc khoa học của Tập đoàn Taotian, đã đề cập tại Hội nghị Vân Tê rằng trong vòng ba năm tới sẽ xuất hiện một mô hình thống nhất toàn phương thức nguyên bản, trải nghiệm sẽ không còn bị giới hạn bởi ranh giới của các phương thức.
Mô hình tạo video thế hệ tiếp theo hoàn toàn mới cũng sẽ được phát hành vào tháng 11, hướng tới sự phát triển dài hơn, dễ kiểm soát hơn, hoàn thiện hơn và thông minh hơn: Trong thời gian dài hơn, mô hình mới vẫn duy trì được tính nhất quán, người sáng tạo có thể kiểm soát chính xác nhân vật, bối cảnh và góc quay; đồng thời, mô hình có khả năng tư duy sáng tạo cấp đạo diễn, từ việc tạo một cảnh quay đơn lẻ tiến tới hiểu được toàn bộ câu chuyện.
Phát hành mô hình giọng nói thế hệ tiếp theo, Qwen được ứng dụng trên nhiều thiết bị đầu cuối thông minh
Hiện nay, giọng nói đang phát triển thành cổng tương tác tự nhiên hơn giữa AI và con người, mô hình Qwen cũng đã được ứng dụng trong các lĩnh vực phần cứng như điện thoại di động, kính AI, robot để bàn.
Gia đình mô hình giọng nói Qwen-Audio-3.1 được nâng cấp hoàn toàn, bao gồm ba dòng chính: chuyển đổi giọng nói thành văn bản (ASR), tổng hợp giọng nói (TTS) và tương tác giọng nói thời gian thực (Realtime).
Mô hình hiểu âm thanh dựa trên kiến trúc thế hệ tiếp theo Qwen-Audio-3.1-ASR-Next đã được phát hành, có khả năng hiểu cảm xúc nhân vật, âm nhạc, âm thanh môi trường và âm thanh cơ khí, hoàn thành việc mô tả âm thanh, định vị sự kiện, hỏi đáp và suy luận âm thanh, giúp các câu hỏi như "cảm xúc của người trong đoạn ghi âm này như thế nào" có thể được hiểu và trả lời chính xác.
Đồng thời, mô hình sáng tạo âm thanh Qwen-Audio-3.1-TTS-Next cũng đã ra mắt. Sử dụng kiến trúc hoàn toàn mới, nó có thể tạo ra âm thanh hoàn chỉnh kết hợp đối thoại và âm thanh môi trường dựa trên một kịch bản, giúp tăng đáng kể hiệu quả sáng tạo chuyên nghiệp cho sách nói, phim truyền hình và podcast.
Khả năng tương tác thời gian thực của Qwen-Audio-3.1-Realtime tiếp tục được nâng cao, có thể vừa nghe, vừa suy nghĩ, vừa nói, đồng thời tăng cường khả năng tương tác đa ngôn ngữ, đóng vai và thấu cảm. Hiện tại, dòng mô hình này đã được ứng dụng trong Qianwen Office và Qoder, đồng thời được tích hợp vào các sản phẩm phần cứng như trợ lý di động QwenNote A2, robot để bàn QwenNote Eva và kính AI Qianwen.
Ngoài ra, mô hình phiên dịch đồng thời Qwen3.8-LiveTranslate lần đầu tiên xuất hiện. Độ trễ trung bình của phiên dịch đồng thời do con người thực hiện là hơn 4 giây, nhưng mô hình này có thể nén độ trễ xuống dưới 2,5 giây. Được biết, mô hình mới đã được tích hợp vào kính AI Qianwen, QwenNote A2, tai nghe DingTalk và các thiết bị phần cứng AI khác.
Mô hình lớn của Alibaba đang tăng tốc tiến tới các thiết bị đầu cuối. Giải pháp toàn diện cho điện thoại AI Qwen Intelligence đã được phát hành, được tối ưu hóa chuyên sâu cho các kịch bản điện thoại di động, cung cấp cho các đối tác nền tảng công nghệ Agent dựa trên mô hình lớn Qianwen, giúp điện thoại có thể hoàn thành các tác vụ phức tạp xuyên ứng dụng một cách đáng tin cậy hơn.

Bản đồ toàn cảnh mô hình lớn AI của Alibaba
Bài viết này do Alibaba cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.
Bản quyền thuộc về tác giả, không được phép sao chép hoặc sử dụng dưới bất kỳ hình thức nào khi chưa được ủy quyền, những trường hợp vi phạm sẽ bị xử lý theo pháp luật.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.