MarkTechPost
92

Mô hình

Alibaba ra mắt Qwen3.8-Omni-Flash: Mô hình đa phương thức toàn diện với cửa sổ ngữ cảnh 1 triệu token

(giờ Việt Nam)

Tóm tắt AI

Đội ngũ Qwen của Alibaba vừa giới thiệu Qwen3.8-Omni-Flash, mô hình đa phương thức đầu tiên được tối ưu hóa cho tác vụ AI Agent, hỗ trợ xử lý đồng thời văn bản, hình ảnh, âm thanh và video với cửa sổ ngữ cảnh lên tới 1 triệu token.

Bản dịch AI

Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use

Đội ngũ Qwen của Alibaba vừa ra mắt Qwen3.8-Omni-Flash. Họ gọi đây là mô hình đa phương thức (omni-modal) đầu tiên được xây dựng dựa trên các khả năng tác nhân (agentic capabilities). Mô hình chấp nhận đầu vào là văn bản, hình ảnh, âm thanh và video, sau đó trả về kết quả dưới dạng văn bản. Khả năng hiểu âm thanh-video, lập luận và sử dụng công cụ đều được tích hợp trong một mô hình duy nhất. Quy trình làm việc được công bố rất đơn giản: hiểu nội dung, lập kế hoạch tác vụ, thực thi bằng công cụ và đưa ra kết quả.

Mô hình này có thể triển khai được không? Có, dưới dạng API được lưu trữ (hosted API) ngay từ hôm nay. Nó đã có mặt trên QwenCloud, Alibaba Cloud Model Studio và Qwen Studio. Hiện chưa có thông báo về việc mở mã nguồn trọng số (open weights) tại thời điểm ra mắt, vì vậy việc tự lưu trữ (self-hosting) chưa phải là một lựa chọn.

Qwen3.8-Omni-Flash là gì?

Qwen3.8-Omni-Flash được xây dựng trên kiến trúc Qwen3.8-Flash-Next. Mô hình nền tảng này đã được phát hành với mã nguồn trọng số mở vào tháng 8 năm 2026.

Cửa sổ ngữ cảnh (context window) là 1 triệu token. QwenCloud liệt kê mức đầu vào tối đa là 991.000 token và đầu ra tối đa là 131.000 token. Độ dài lập luận tối đa là 262.000 token.

Đầu ra chỉ là văn bản. Tài liệu của Model Studio hướng dẫn các nhà phát triển sử dụng Qwen3.5-Omni khi họ cần tạo giọng nói. Chế độ "Thinking" (tư duy) được bật mặc định với tham số reasoning_effort đặt ở mức xhigh. Việc đặt tham số này về none sẽ vô hiệu hóa tính năng tư duy.

API tuân thủ cả giao thức DashScope và OpenAI. Nó hoạt động với Chat Completions và Responses API. Các tính năng như gọi hàm (function calling), tìm kiếm web, đầu ra có cấu trúc (structured outputs), bộ nhớ đệm ngữ cảnh (context caching) và gọi hàng loạt (batch calls) đều được hỗ trợ.

Nhận thức tác nhân (Agentic Perception) cho video dài

Hầu hết các mô hình video đều đọc tệp từ đầu đến cuối. Điều này vẫn đúng ngay cả khi câu trả lời chỉ nằm trong 3 phút của đoạn phim.

Đội ngũ nghiên cứu Qwen mô tả một hướng đi khác. Tác nhân bắt đầu từ câu hỏi, sau đó quyết định xem cần xem và nghe những gì. Tiếp theo, nó thu thập bằng chứng qua nhiều vòng từ khái quát đến chi tiết. Tài nguyên tính toán và token được tập trung vào các phân đoạn quan trọng.

Đội ngũ nghiên cứu báo cáo kết quả trên OmniVideoBench. Độ chính xác tăng từ 63,4 lên 67,8. Lượng token sử dụng giảm từ 145.736 xuống 79.117, tương đương mức giảm khoảng 45,7%.

Các điểm chuẩn (Benchmarks) được báo cáo

Tất cả các số liệu ở đây đều đến từ Qwen. Các kết quả độc lập chưa có sẵn tại thời điểm xuất bản.

Đội ngũ nghiên cứu tuyên bố rằng hiệu suất nghe nhìn (audio-visual) gần bằng với Gemini 3.8 Flash. Họ cũng khẳng định hiệu suất âm thanh tổng thể vượt trội hơn Gemini 3.8 Flash. Bài đăng trên X tóm tắt những cải tiến của tác nhân là tăng trung bình +19,5 điểm trên WildClawBench-MM và UniClawBench.

🚀 Chào mừng Qwen3.8-Omni-Flash, mô hình đa phương thức đầu tiên của Qwen được xây dựng dựa trên các khả năng tác nhân!

Khả năng hiểu âm thanh-video tự nhiên, lập luận và sử dụng công cụ được kết hợp trong một mô hình: hiểu nội dung, lập kế hoạch tác vụ, thực thi bằng công cụ và đưa ra kết quả.

Điểm nổi bật: 🥳-… pic.twitter.com/iJypeohw7y

Giá cả và giới hạn đầu vào

QwenCloud niêm yết giá 0,15 USD cho mỗi 1 triệu token đầu vào và 0,47 USD cho mỗi 1 triệu token đầu ra. Các lượt truy cập bộ nhớ đệm ngầm (implicit cache hits) có giá 0,016 USD cho mỗi 1 triệu token.

Đội ngũ nghiên cứu báo cáo mức cắt giảm chi phí lớn so với Qwen3.5-Omni-Plus. Chi phí đầu vào âm thanh giảm hơn 98% mỗi giờ. Chi phí đầu vào nghe nhìn giảm hơn 93% mỗi giờ. Bài đăng trên X cho biết mức giảm đầu vào video là khoảng 89%.

Các giới hạn chính từ tài liệu Model Studio:

Việc gọi mô hình chỉ cần vài dòng mã với OpenAI SDK:

Công cụ mã nguồn mở: Qwen-MM-Plugins và Qwen-Live Harness

Vì mô hình trả về văn bản, nên các công cụ sẽ đảm nhận việc xử lý đa phương tiện. Đội ngũ Qwen đang mở mã nguồn 2 dự án để hỗ trợ việc này.

Qwen-MM-Plugins đang hoạt động theo giấy phép Apache-2.0. Khẩu hiệu của nó là ‘Biến bất kỳ tác nhân nào thành đa phương thức tự nhiên’. Mỗi khả năng được cài đặt như một Skill (kỹ năng) cộng với một máy chủ MCP tùy chọn. Trình cài đặt có hướng dẫn hỗ trợ Claude Code, CodeBuddy, Codex, Qoder, OpenClaw, Qwen Code và Gemini CLI.

Các khả năng Omni tương ứng với các bản demo ra mắt:

Một plugin cốt lõi cho phép mô hình chính đọc hình ảnh và khung hình video cục bộ một cách tự nhiên. Tệp README lưu ý một hạn chế hiện tại: hầu hết các harness chưa thể truyền âm thanh trực tiếp vào mô hình chính. Hiện tại, âm thanh được định tuyến thông qua API.

Giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem chi tiết kỹ thuật, trang mô hình QwenCloud, tài liệu API và kho lưu trữ GitHub. Mọi công lao thuộc về các nhà nghiên cứu của dự án này. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter, đừng quên tham gia cộng đồng ML SubReddit với hơn 150 nghìn thành viên và đăng ký nhận bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá kho lưu trữ GitHub, trang Hugging Face, sản phẩm mới, hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost AI Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.