QbitAI
85

Mô hình

Alibaba hé lộ bước tiến mới: Đang huấn luyện Qwen4 và mô hình video thế hệ tiếp theo

(giờ Việt Nam)

Tóm tắt AI

Tại Hội nghị Vân Tê 2026, Alibaba đã công bố những cập nhật quan trọng về hệ sinh thái mô hình đa phương thức, xác nhận Qwen4 và mô hình video thế hệ mới đang trong quá trình huấn luyện.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

22/09/2026 11:42:43 Nguồn: QbitAI

Ngày 22 tháng 9, Hội nghị Vân Tê (Yunqi Conference) 2026 chính thức khai mạc, Alibaba công bố những tiến bộ mới nhất về mô hình ngôn ngữ lớn.

Ngày 22 tháng 9, Hội nghị Vân Tê 2026 chính thức khai mạc, Alibaba công bố những tiến bộ mới nhất về mô hình ngôn ngữ lớn. Trong lĩnh vực mô hình ngôn ngữ lớn (LLM), Qwen3.8-Max thể hiện sức mạnh vượt trội trong lĩnh vực lập trình (Coding) và văn phòng (Cowork). Sau khi ra mắt, mô hình này đã giành vị trí số 1 trên bảng xếp hạng Artificial Analysis Agentic và vị trí số 1 về lập trình front-end trên CodeArena. Qwen4, dựa trên kiến trúc thế hệ mới, đã được đưa vào huấn luyện; các phiên bản tương lai như Qwen4.5, Qwen5 dự kiến sẽ mở rộng tham số lên từ 5 đến 10 nghìn tỷ. Trong lĩnh vực đa phương thức, hiệu năng của Qwen-Image-3.1 được kỳ vọng sẽ tiệm cận dòng GPT-Image mạnh nhất, vươn lên dẫn đầu thế giới. Qwen-Audio-3.1 xếp trong nhóm dẫn đầu quốc tế và đứng đầu tại Trung Quốc ở cả ba đường đua cốt lõi là ASR, TTS và Realtime, vượt qua các mô hình hàng đầu thế giới như Gemini 3.1 TTS. Mô hình thế giới HappyOyster-2.0-Preview lần đầu ra mắt, thúc đẩy mô hình thế giới từ phòng thí nghiệm tiến tới khả năng ứng dụng thực tế. Mô hình tạo video Wan3.0 đã giành vị trí số 1 trên cả hai bảng xếp hạng tạo video từ văn bản và chỉnh sửa video của Artificial Analysis. Đồng thời, thế hệ mô hình video tiếp theo cũng đang được huấn luyện với khả năng tạo, kiểm soát và thấu hiểu mạnh mẽ hơn, thúc đẩy AI chuyển mình từ công cụ thành trí tuệ sáng tạo.

Trên bảng xếp hạng mô hình lớn toàn cầu mới nhất của Artificial Analysis, Qwen3.8-Max đã tăng từ 40 lên 45 điểm.

Alibaba là công ty công nghệ Trung Quốc đầu tiên triển khai các mô hình lớn AI. Từ năm 2019, Alibaba đã bắt đầu nghiên cứu về mô hình lớn AI, lần lượt tung ra dòng mô hình ngôn ngữ lớn Qwen (Thông Vấn) và các dòng mô hình đa phương thức như Wan (Vạn Tượng) và HappyHorse. Bước sang năm 2026, tốc độ phát hành mô hình lớn của Alibaba tăng tốc toàn diện. Chỉ trong hơn 1 tháng gần đây, riêng dòng Qwen3.8 đã cập nhật và lặp lại 4 mô hình khác nhau cùng các phiên bản quan trọng, với hiệu năng và hiệu quả chi phí đều đạt mức tiên tiến toàn cầu, trở thành một trong những mô hình Trung Quốc được các doanh nghiệp và cộng đồng nhà phát triển AI toàn cầu quan tâm nhất hiện nay. Tại Hội nghị Vân Tê 2026, Alibaba công bố rằng quá trình tự tiến hóa (RSI) của mô hình lớn đã bước đầu đi vào các khâu huấn luyện mô hình, suy luận và phối hợp chip-mô hình. Việc khám phá công nghệ tiên phong này đã đẩy nhanh quá trình lặp lại và nâng cấp của dòng mô hình Qwen.

Quá trình lặp lại mô hình truyền thống thường là một quy trình một chiều: các nhà nghiên cứu phát hiện vấn đề từ đánh giá hoặc phản hồi của người dùng, chuẩn bị một lô dữ liệu, hoàn thành một lần huấn luyện, sau đó phát hành mô hình mới. Công việc này lặp đi lặp lại, và vòng lặp tiếp theo vẫn phải bắt đầu từ phân tích thủ công. Hiện nay, Qwen3.8-Max có thể tự xây dựng quy trình huấn luyện, cấu trúc dữ liệu huấn luyện, tự thiết kế thí nghiệm và xác định lỗi. Trong điều kiện hoàn toàn "không có sự tham gia" của con người, mô hình đã liên tục lặp lại trong hơn 1 tháng, hoàn thành 33 vòng lặp hiệu quả. Dựa trên các đổi mới công nghệ như RSI và hậu huấn luyện (post-training), phiên bản mới của Qwen3.8-Max đã tăng 12,5% điểm số trên Artificial Analysis lên 45 điểm, thuộc nhóm tiên phong cùng với các mô hình hàng đầu như Claude và GPT. Ngoài ra, quá trình khám phá RSI của Qwen còn không ngừng mở rộng: hỗ trợ tối ưu hóa suy luận tự chủ ở phía trên và phối hợp đổi mới chip-mô hình ở phía dưới. Về tối ưu hóa suy luận, Qwen3.8 đã tự thích ứng và tối ưu hóa khung suy luận SGlang cho mô hình Qwen3.8-Flash kiến trúc thế hệ mới trên dòng GPU mới của T-Head (Bình Đầu Ca) chưa từng được biết đến, giúp tăng lưu lượng suy luận trên mỗi đơn vị lên 96%. Trong thiết kế phối hợp chip-mô hình, chỉ dựa trên một bản quy chuẩn mô-đun bus thực tế, Qwen3.8 đã tự triển khai toàn bộ quy trình từ front-end, xác minh đến back-end. Sau hơn 60 giờ vận hành tự chủ và gọi các công cụ EDA hơn 10.000 lần, mô hình đã hoàn thành tối ưu hóa thực thi vật lý với diện tích giảm 42%, số lượng cell tiêu chuẩn giảm 29% và mức tiêu thụ điện năng giảm 59,5%.

Theo đuổi trí tuệ cao hơn và đẩy nhanh quá trình tự tiến hóa là mục tiêu "sao Bắc Đẩu" quan trọng nhất của Qwen. Tại Hội nghị Vân Tê năm nay, Alibaba đã công bố những tiến bộ kỹ thuật của dòng mô hình ngôn ngữ lớn. Về tối ưu hóa kiến trúc, Qwen3.8-Flash (xem chi tiết trên blog kỹ thuật) đã mở mã nguồn kiến trúc mô hình lớn Qwen thế hệ tiếp theo. Thông qua các đổi mới cốt lõi như cơ chế chú ý (attention) và cơ chế truyền tin nội bộ mô hình, nó đạt được hiệu năng tiên tiến đồng thời giảm chi phí huấn luyện gần 90%. Dựa trên số lượng tham số kích hoạt cực thấp, nó đẩy hiệu suất tính toán suy luận lên một "biên Pareto" hoàn toàn mới, trở thành mô hình có hiệu quả chi phí "sát thủ" trong ngành. Về mở rộng phương thức (xem chi tiết trên blog kỹ thuật), mô hình toàn phương thức Qwen3.8-Omni-Flash chính thức ra mắt, đưa video, âm thanh, hình ảnh và văn bản vào một khung thấu hiểu thống nhất, mở ra phân vùng tư duy hoàn toàn mới cho mô hình lớn. Về mở rộng tham số, tham số càng lớn vẫn mang lại hiệu năng càng mạnh; trong tương lai, tổng số tham số của mô hình lớn Qwen sẽ mở rộng lên quy mô 5 nghìn tỷ hoặc thậm chí 10 nghìn tỷ. Những đổi mới kỹ thuật này sẽ trở thành nền tảng cho thế hệ mô hình lớn Qwen mới. Theo giới thiệu, mô hình Qwen4 đang được huấn luyện với kiến trúc hoàn toàn mới, Qwen4.5 và Qwen5 cũng đang được triển khai ổn định.

Theo đuổi hiệu quả chi phí tối thượng và thúc đẩy phổ cập AI là một mục tiêu "sao Bắc Đẩu" khác của Qwen. Trong dòng mô hình Qwen3.8, Qwen3.8-Max được Arena đánh giá là một trong những mô hình lập trình tiên phong có hiệu quả chi phí cao nhất. So với Qwen3.7, số lượng Token gọi tăng gấp 12 lần, đi vào các kịch bản thực tế như phát triển full-stack, vận hành tự động, văn bản pháp lý, phân tích đầu tư, thiết kế kỹ thuật, nghiên cứu khoa học. Qwen3.8-Flash thông qua đổi mới cấu trúc đã mở ra kỷ nguyên mới với chi phí đầu vào bộ nhớ đệm (cache hit) thấp tới 0,1 nhân dân tệ mỗi triệu Tokens. Qwen3.8-27B được các nhà phát triển toàn cầu ca ngợi là "Opus4.6 bản địa", nén mật độ thông minh đến mức cực hạn mà máy tính trang bị card đồ họa tiêu dùng cũng có thể chạy được, đưa trí tuệ và hiệu quả chi phí lên một tầm cao mới. Trên thực tế, các doanh nghiệp và nhà phát triển trên toàn thế giới đang sử dụng mô hình lớn của Alibaba để khám phá các ứng dụng AI. Ví dụ, kỳ lân AI Thung lũng Silicon Perplexity đã xây dựng Agent bản địa dựa trên Qwen3.8. CEO Brian Chesky của công ty internet nổi tiếng Airbnb cho biết công ty đang "phụ thuộc rất nhiều vào mô hình Qwen của Alibaba" và thẳng thắn nói rằng "tốt hơn và rẻ hơn OpenAI". "Tiểu Hồng Thư phiên bản Mỹ" Pinterest cũng sử dụng Qwen để xây dựng trợ lý mua sắm AI và chatbot riêng. CEO Bill Ready của họ thẳng thắn cho biết chi phí sử dụng Qwen chưa đến 8% so với các mô hình đóng cùng loại của Anthropic, OpenAI. Reuters cũng dựa trên Qwen để phát triển mô hình riêng nhằm giảm sự phụ thuộc vào các mô hình đóng như Claude và giảm chi phí sử dụng dài hạn.

Dòng mô hình Qwen3.8 đều mở mã nguồn cho toàn cầu. Chỉ trong một tháng ngắn ngủi, các mô hình liên quan đến Qwen3.8 đã được tải xuống hơn 56 triệu lần, với hơn 1.900 mô hình phái sinh. Trong đó, Qwen3.8-27B đã vượt qua các mô hình phổ biến như DeepSeek-R1, Meta-Llama3.1 để trở thành mô hình lớn được yêu thích nhất trong lịch sử Hugging Face trên toàn cầu. Tính đến nay, Alibaba đã mở mã nguồn hơn 460 mô hình lớn Qwen, tổng số lượt tải xuống các mô hình Qwen vượt quá 3 tỷ, với hơn 300.000 mô hình phái sinh. Báo cáo chính thức của Hugging Face chỉ ra rằng Qwen đã trở thành mô hình nền tảng cho cộng đồng AI mã nguồn mở toàn cầu. Các công ty nổi tiếng bao gồm DeepSeek, NVIDIA, AWS, Microsoft... đều dựa trên Qwen để phát triển các mô hình phái sinh, thực hiện các hoạt động khám phá ứng dụng AI.

Nếu mô hình ngôn ngữ lớn là bộ não của máy móc, với mục đích trở nên thông minh hơn, mạnh mẽ hơn, thúc đẩy hiện thực hóa trí tuệ nhân tạo tổng quát (AGI) và thậm chí là trí tuệ nhân tạo siêu cấp (ASI); thì mô hình đa phương thức chính là trung tâm tương tác giữa máy móc với con người và thế giới, với mục đích cảm nhận, thấu hiểu và thậm chí tạo ra những điều mới mẻ, giúp máy móc tiến vào thế giới vật lý thực một cách đáng tin cậy và ổn định. Tại Hội nghị Vân Tê lần này, Alibaba đã nâng cấp mạnh mẽ nhiều mô hình đa phương thức, dần dần tiến tới sự phát triển tích hợp giữa thấu hiểu và tạo lập toàn phương thức từ tạo lập đơn phương thức.

Trong lĩnh vực tạo video, năm 2025, Wan2.6 lần đầu tiên hỗ trợ tạo video dựa trên tham chiếu tại Trung Quốc, với thời lượng 15 giây và phân cảnh thông minh. Bước sang năm 2026, mô hình video của Alibaba tiếp tục khám phá ở vị trí tiên phong nhất. Wan2.7 và HappyHorse1.0 ra mắt vào tháng 4 đã đạt bước nhảy vọt về chất lượng điện ảnh và biểu cảm thị giác. Wan3.0 chính thức ra mắt vào tháng 8 hỗ trợ tạo video 30 giây một lần, đầu vào có cấu trúc như tài liệu/bảng tính/trang web, đồng bộ âm thanh và hình ảnh gốc, xếp vị trí số 1 toàn cầu trên cả hai bảng xếp hạng tạo video từ văn bản và chỉnh sửa video của Artificial Analysis. Thế hệ mô hình video mới tiếp theo cũng sẽ được phát hành vào tháng 11, hướng tới sự phát triển dài hơn, dễ kiểm soát hơn, hoàn thiện hơn và thông minh hơn: trong thời gian dài hơn, mô hình mới vẫn có thể duy trì tính nhất quán, người sáng tạo có thể kiểm soát chính xác nhân vật, bối cảnh và ống kính; đồng thời, mô hình có thể sở hữu tư duy sáng tạo cấp đạo diễn, từ việc tạo một cảnh quay đơn lẻ tiến tới thấu hiểu tường thuật hoàn chỉnh.

Về mô hình giọng nói, Alibaba đã phát hành dòng mô hình lớn giọng nói Qwen-Audio-3.1, nâng cấp toàn diện ba loại mô hình: chuyển đổi giọng nói (ASR), tổng hợp giọng nói (TTS) và tương tác giọng nói thời gian thực (Realtime). Trong đó, khả năng tương tác thời gian thực của Qwen-Audio-3.1-Realtime được nâng cao hơn nữa, có thể vừa nghe, vừa suy nghĩ, vừa nói, đồng thời tăng cường khả năng tương tác đa ngôn ngữ, đóng vai và thấu cảm. Hiện tại, dòng mô hình này đã được ứng dụng trong Qwen Cowork và Qoder, đồng thời kết nối với các sản phẩm phần cứng như trợ lý di động QwenNote A2, robot để bàn QwenNote Eva và kính AI Qwen. Đồng thời, Alibaba ra mắt hai mô hình hoàn toàn mới dựa trên kiến trúc thế hệ tiếp theo: mô hình sáng tạo âm thanh Qwen-Audio-3.1-TTS-Next, người dùng chỉ cần cung cấp một đoạn văn là có thể tạo ra nội dung âm thanh hoàn chỉnh kết hợp đối thoại nhân vật và âm thanh môi trường, đáp ứng nhu cầu sáng tạo chuyên nghiệp như sách nói, phim truyền hình, podcast, trò chơi, quảng cáo; mô hình thấu hiểu âm thanh Qwen-Audio-3.1-ASR-Next, có khả năng hiểu cảm xúc nhân vật, âm nhạc, âm thanh môi trường và âm thanh cơ khí, hoàn thành mô tả âm thanh, định vị sự kiện, hỏi đáp và suy luận âm thanh, giúp những câu hỏi như "cảm xúc của người trong đoạn ghi âm này như thế nào" có thể được hiểu và trả lời chính xác.

Về mô hình tạo hình ảnh, Qwen-Image-3.1 đã ra mắt. Nó được tối ưu hóa và nâng cấp hoàn toàn cho các kịch bản thương mại thực tế như thương mại điện tử, thiết kế, nén thời gian thiết kế thị giác từ vài giờ xuống mức giây, đạt tiêu chuẩn sánh ngang với các nhà thiết kế chuyên nghiệp và hỗ trợ chỉnh sửa hình ảnh chính xác. Đồng thời, Qwen-Image-2.1 với phần tạo thị giác chỉ có 7B tham số đã được mở mã nguồn toàn diện (xem chi tiết trên blog kỹ thuật). Đây là mô hình tạo ảnh mã nguồn mở có khả năng cân bằng nhất và hiệu quả chi phí cao nhất trong dòng Qwen-Image hiện nay. Trong đánh giá công khai Qwen-Image-Bench, nó đã vượt qua hầu hết các mô hình đóng, đứng đầu về mã nguồn mở, tốc độ suy luận cũng tăng đáng kể; đồng thời hỗ trợ tạo ảnh trong suốt, dựa vào prompt để tự động quyết định xuất ảnh thường hay ảnh trong suốt, còn có thể tách ảnh chụp RGB thực tế thành lớp RGBA. Ngoài ra, mô hình hỗ trợ chỉnh sửa đa ảnh tối đa 10 ảnh tham chiếu, chỉnh sửa cục bộ bằng ba cách: khoanh vùng/bôi xóa/mặt nạ, đồng thời tăng cường độ trung thực khi chỉnh sửa chân dung và sản phẩm, khả năng render văn bản và biểu hiện ánh sáng nhân vật cũng được tăng cường rõ rệt so với thế hệ trước.

Phiên bản Happy Shrimp 1.1 của mô hình âm nhạc đã được phát hành, cải thiện hơn nữa ở hai hướng kỹ thuật là mô hình hóa thẩm mỹ âm nhạc kết hợp học tăng cường và tích hợp tri thức thế giới với tri thức lĩnh vực âm nhạc. Nó đã đạt được những đột phá trong bốn khía cạnh chuyên môn: biểu hiện âm nhạc, chất lượng giọng hát, hát đa ngôn ngữ và hiểu lệnh, hỗ trợ hơn một trăm phong cách âm nhạc và hơn mười ngôn ngữ chính, bao phủ hai kịch bản tạo lập là bài hát có lời và nhạc thuần túy.

Mô hình thông dịch đồng thời Qwen3.8-LiveTranslate chính thức ra mắt (xem chi tiết trên blog kỹ thuật). Mô hình mới sử dụng kiến trúc Interleave, đổi mới tái cấu trúc quy trình thông dịch đồng thời thời gian thực, độ chính xác, độ trôi chảy và độ súc tích được cải thiện toàn diện. Độ trễ trung bình trên mỗi từ (LAAL) giảm từ 2,8 giây xuống 2,3 giây, trong khi độ trễ trung bình của thông dịch viên con người là 4 giây. Qwen3.8-LiveTranslate bổ sung ba khả năng: tách người nói thời gian thực, mỗi câu đều rõ ràng chủ thể, sao chép âm sắc ổn định hơn; hiển thị đồng thời văn bản gốc và văn bản dịch trên cùng một khung hình; đối mặt với ngữ cảnh dài có thể tự chủ giảm thiểu hoặc loại bỏ sự mơ hồ một cách chất lượng cao, liên kết ngữ cảnh trước để hiểu hiện tại, dịch tên người và thuật ngữ chính xác hơn. Dựa trên hàng loạt đổi mới kỹ thuật, Qwen3.8-LiveTranslate không chỉ dịch nhanh mà còn nghe rõ hơn, dịch chuẩn hơn, thể hiện tốt hơn trong các kịch bản thực tế.

Phiên bản mới nhất của mô hình thế giới HappyOyster 2.0 Preview đã ra mắt. Thông qua việc nâng cấp toàn diện về kiến trúc mô hình, phương pháp huấn luyện và hệ thống dữ liệu, nó đã cải thiện đáng kể các khả năng cốt lõi như tương tác thời gian thực thông minh, khả năng ghi nhớ, phản hồi thời gian thực, tuân thủ quy luật vật lý, giúp mô hình thế giới thực sự bước từ phòng thí nghiệm ra ứng dụng thực tế.

Tại Hội nghị Vân Tê năm nay, Alibaba đã trình diễn toàn diện những đột phá từ mô hình ngôn ngữ lớn đến mô hình đa phương thức. Đằng sau thành quả nghiên cứu và phát triển ổn định, bền bỉ này là kết quả của việc Alibaba đầu tư lâu dài vào lĩnh vực AI và điện toán đám mây, tích lũy dày dạn. Trong mười bảy năm qua, Alibaba là công ty AI toàn diện duy nhất tại Trung Quốc có khả năng tích hợp theo chiều dọc cả phần cứng và phần mềm. Sự đầu tư của Alibaba Cloud vào tích lũy công nghệ đám mây và nghiên cứu phát triển mô hình lớn cũng là đầy đủ nhất, hiện là nền tảng duy nhất tại Trung Quốc có năng lực đẳng cấp thế giới về cả cơ sở hạ tầng và nghiên cứu phát triển mô hình. Token Foundry do Alibaba thành lập hiện là AI Lab có mật độ nhân tài AI cao nhất và sản lượng AI phong phú nhất tại Trung Quốc, bao trùm lĩnh vực mô hình ngôn ngữ và các mô hình đa phương thức phong phú nhất. Đồng thời, Alibaba còn sở hữu các kịch bản ứng dụng AI quan trọng nhất trong kỷ nguyên AI, bao gồm các công cụ Agent như Qwen Cowork, Qoder... cung cấp công cụ năng suất AI cho mọi ngành nghề. Alibaba đã trở thành một trong những doanh nghiệp cơ sở hạ tầng AI và công ty ứng dụng AI quan trọng nhất tại Trung Quốc.

Bài viết này do Alibaba cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.

Bản quyền thuộc về tác giả, không được phép sao chép và sử dụng dưới mọi hình thức khi chưa được ủy quyền, kẻ vi phạm sẽ bị xử lý theo pháp luật.

量子位的朋友们
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.