IT Home
92

Mô hình

Alibaba ra mắt Qwen3.8-Omni-Flash: Mô hình đa phương thức toàn diện, hỗ trợ 1 triệu token với chi phí cực rẻ

(giờ Việt Nam)

Tóm tắt AI

Alibaba giới thiệu Qwen3.8-Omni-Flash, mô hình đa phương thức xử lý đồng thời văn bản, hình ảnh, âm thanh và video với cửa sổ ngữ cảnh 1 triệu token. Hiệu suất vượt trội hơn 26% so với thế hệ trước, với khả năng xử lý âm thanh được đánh giá cao hơn cả Gemini 3.8 Flash.

Bản dịch AI

Theo tin từ IT ngày 18 tháng 9, Alibaba Qwen đã chính thức ra mắt thế hệ mô hình đa phương thức nguyên bản (native omni-modal) mới mang tên Qwen3.8-Omni-Flash, hiện đã có mặt trên nền tảng Qwen AI. Mô hình này có khả năng xử lý đồng thời các đầu vào văn bản, hình ảnh, âm thanh và video, đồng thời hỗ trợ cửa sổ ngữ cảnh lên tới 1M.

图片

Mô hình đa phương thức (omni-modal) là mô hình có khả năng xử lý đồng thời nhiều dạng đầu vào như văn bản, hình ảnh, âm thanh và video. Theo công bố chính thức, trong khi vẫn duy trì năng lực của các mô hình văn bản cùng kích thước, khả năng đa phương thức của mô hình này đã được cải thiện đáng kể so với thế hệ trước.

Qwen3.8-Omni-Flash 与其在生产环境中的应用

Trên tổng cộng 30 bài đánh giá, Qwen3.8-Omni-Flash đạt điểm trung bình tăng hơn 26% so với thế hệ tiền nhiệm Qwen3.5-Omni-Plus. Trong các tác vụ về Agent âm thanh/video, lập trình (Coding) và các tác vụ dài, mô hình đạt mức tăng 36,5 điểm trên WildClawBench-MM, 22,3 điểm trên AgenticVBench và đạt 69,6 điểm trên UniClawBench.

图片

Về năng lực cơ bản, LongAudioSpan tăng 8,3 điểm, OmniVideoBench tăng 9,6 điểm, CSR/ISR của OmniCap-IF lần lượt tăng 8,5 và 14,1 điểm. Chỉ số DER/cpWER của AliMeeting giảm từ 88,11/89,61 xuống còn 3,35/17,18.

Theo công bố, năng lực âm thanh và video của mô hình tiệm cận với Gemini 3.8 Flash, trong đó khả năng xử lý âm thanh nhìn chung vượt trội hơn. Giá API cho đầu vào âm thanh mỗi giờ giảm hơn 98%, và giá cho đầu vào âm thanh/video mỗi giờ giảm hơn 93%.

Để hỗ trợ âm thanh và video dài, phía Alibaba đã mở rộng Qwen-MM-Plugins và mã nguồn mở Qwen-Live Harness. Trong đó, Qwen-MM-Plugins hướng tới việc nhận diện theo yêu cầu, gọi công cụ và thực thi cho các quy trình làm việc dài hạn, còn Qwen-Live Harness hướng tới tương tác đa phương thức liên tục và thời gian thực.

Về khả năng hiểu âm thanh và video dài, mô hình hỗ trợ mô tả theo yêu cầu, Agent chủ động thu thập bằng chứng, thúc đẩy tiến độ cuộc họp và lập báo cáo nghiên cứu chuyên sâu về video. Tính năng chú thích (Caption) âm thanh/video có thể kiểm soát cho phép chỉ định đối tượng mô tả, phạm vi thời gian, độ chi tiết thông tin và định dạng đầu ra.

Trong khả năng hiểu âm thanh/video dài theo hướng Agent (Agentic), độ chính xác của OmniVideoBench tăng từ 63,4 lên 67,8, mức tiêu thụ Token giảm từ 145.736 xuống 79.117, tương đương mức giảm khoảng 45,7%.

Trong bối cảnh cuộc họp, mô hình hỗ trợ đầu vào âm thanh và video dài tối đa một giờ, có thể thực hiện phân tách người nói, chuyển đổi nội dung thành văn bản và xác định danh tính, tạo biên bản cuộc họp, danh sách việc cần làm và phân tích rủi ro dự án. Kết hợp với việc gọi công cụ, mô hình còn có thể gửi email, sắp xếp công việc hoặc lập trình.

Về sản xuất âm thanh và video, Music2MV có thể hiểu cấu trúc bài hát, nhịp điệu và cảm xúc, xuất ra lời bài hát theo từng câu kèm dấu thời gian. Tính năng dịch phim ngắn có thể thực hiện nhận diện nhân vật, dịch theo ngôn ngữ nói, sao chép giọng nói nhân vật, phối lại âm thanh và kiểm tra chất lượng thành phẩm.

Trong việc thuyết minh phim dài, người dùng chỉ cần cung cấp video và một câu yêu cầu, Agent có thể hoàn thành việc hiểu đa phương thức, tóm tắt tình tiết chính, lập kế hoạch thuyết minh, lồng tiếng, chèn nhạc, biên tập, dựng hình và kiểm tra chất lượng thành phẩm.

Trong các thí nghiệm tối ưu hóa mô hình, Qwen3.8-Omni-Flash đã thử nghiệm cải thiện khả năng nhận diện tiếng Tứ Xuyên của Qwen2.5-Omni-3B trong vòng 12 giờ. Mô hình tự chọn tập đánh giá, xây dựng 3.413 dữ liệu huấn luyện qua 4 vòng thí nghiệm, giúp tỷ lệ lỗi ký tự giảm từ 25,79% xuống 15,30%, giảm tương đối khoảng 40,7%.

Về nén thông tin, Qwen-MM-Plugins đã mở nguồn Video2Note, có khả năng chuyển đổi nội dung video dài hàng giờ thành ghi chú PDF kết hợp hình ảnh và văn bản. Omni Skill Creator có thể trích xuất quy trình vận hành tiêu chuẩn từ các video hướng dẫn thao tác và chuyển đổi chúng thành các kỹ năng (Skill) cho Agent có thể tái sử dụng.

Phiên bản thời gian thực Qwen3.8-Omni-Flash-Realtime có thể thực hiện nhận diện và phản hồi ngay khi luồng âm thanh/video được nhập vào, đồng thời kết hợp ngữ cảnh thời gian thực để gọi công cụ. IT lưu ý rằng mô hình này còn hỗ trợ luyện nói thời gian thực, kết hợp mô hình hóa phát âm và ngữ nghĩa, giúp hiểu được các cách diễn đạt không chuẩn do ảnh hưởng của giọng địa phương.

Theo công bố, đây là mô hình lớn đa phương thức đầu tiên hỗ trợ "định vị âm thanh" (nghe tiếng đoán vị trí), kết hợp thông tin âm thanh không gian và hình ảnh để xác định hướng và khoảng cách của nguồn âm. Mô hình cũng có thể thông qua việc nạp Skill (Skill injection) để thiết lập danh tính, phong cách biểu đạt, kiến thức nghiệp vụ và quy tắc tương tác.

Trong bài đánh giá Agentic Omni Understanding, phía Alibaba đã so sánh hiệu suất của Qwen3.8-Omni-Flash với chế độ Static của Gemini 3.8 Flash và chế độ Agent kết nối với Qwen Code trên các nền tảng OmniVideoBench, Video-MME-v2 và LVOmniBench.

Đồng thời, Alibaba cũng công bố thông tin về hiệu suất thực tế về lưu lượng (throughput) và độ trễ của API Qwen3.8-Omni-Flash-Realtime trong các kịch bản đầu vào khác nhau, cùng với kết quả kiểm tra hiệu năng đầy đủ.

图片
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.