← Về bảng nóng
SỰ KIỆNĐã lắng xuống

Ra mắt Qwen3.8-Omni-Flash: Mô hình đa phương thức thuần túy tập trung vào khả năng tác tử âm thanh và video

Tổng quan sự kiện

Toàn cảnh do AI tổng thuật

Alibaba Qwen vừa ra mắt thế hệ mô hình đa phương thức nguyên bản mới là Qwen3.8-Omni-Flash. Theo công bố, đây là mô hình đa phương thức đầu tiên của Qwen được xây dựng tập trung vào năng lực tác nhân (agent), có khả năng xử lý đồng thời đầu vào văn bản, hình ảnh, âm thanh và video, hỗ trợ cửa sổ ngữ cảnh 1M token. Mô hình hiện đã có mặt trên nền tảng Qwen AI, QwenCloud, Alibaba Cloud Model Studio và Qwen Studio. Qwen cho biết điểm số trung bình trên 29 bài kiểm tra của mô hình này cao hơn thế hệ trước Qwen3.5-Omni-Plus hơn 25%. Năng lực xử lý âm thanh và video tiệm cận với Gemini 3.8 Flash, trong khi khả năng xử lý âm thanh tổng thể vượt trội hơn. Giá API cho đầu vào âm thanh giảm hơn 98%, đầu vào âm thanh/video giảm hơn 93% và chi phí đầu vào video giảm khoảng 89%. MarkTechPost lưu ý rằng tất cả các số liệu về điểm số và giá cả đều do Qwen cung cấp, chưa có kết quả kiểm chứng độc lập và mô hình chưa được công khai trọng số, chỉ cung cấp qua API lưu trữ.

Cùng đợt ra mắt, Qwen cũng giới thiệu các công cụ hỗ trợ và mô hình thời gian thực. Qwen mở mã nguồn Qwen-MM-Plugins, cung cấp khả năng hiểu hình ảnh, âm thanh, video và tài liệu cho các khung tác nhân như Codex, Claude Code, Qwen Code, Gemini CLI, Qoder, CodeBuddy, OpenClaw... Đồng thời bổ sung Video2Note (chuyển đổi video dài hàng giờ thành ghi chú PDF có hình ảnh) và Omni Skill Creator (trích xuất quy trình vận hành tiêu chuẩn từ các bản demo thao tác để chuyển thành kỹ năng tác nhân có thể tái sử dụng). MarkTechPost cho biết bộ công cụ này được phát hành theo giấy phép Apache-2.0, đồng thời lưu ý rằng hầu hết các khung hiện chưa thể nhập trực tiếp âm thanh vào mô hình chính mà phải thông qua định tuyến API. Qwen-Live Harness, đóng vai trò là môi trường chạy mã nguồn mở cho API Qwen3.8-Omni-Flash-Realtime, hỗ trợ ủy quyền tác vụ, tương tác chủ động, quản lý bộ nhớ dài hạn và ngữ cảnh, có thể cài đặt chỉ bằng một câu lệnh. Qwen3.8-Omni-Flash-Realtime hỗ trợ nhận diện và phản hồi trong khi tiếp nhận luồng âm thanh/video thời gian thực, kết hợp gọi công cụ dựa trên ngữ cảnh thời gian thực thông qua WebSocket và WebRTC. Đây được coi là mô hình lớn đa phương thức đầu tiên hỗ trợ "định vị âm thanh", có khả năng kết hợp thông tin không gian âm thanh và hình ảnh để xác định hướng và khoảng cách nguồn âm, đồng thời có thể tiêm các thiết lập về danh tính, phong cách biểu đạt, kiến thức nghiệp vụ và quy tắc tương tác thông qua Skill.

Qwen cũng công bố một thử nghiệm tối ưu hóa mô hình: Qwen3.8-Omni-Flash đã tự tối ưu hóa khả năng nhận diện giọng nói phương ngữ Tứ Xuyên cho Qwen2.5-Omni-3B trong 12 giờ. Mô hình tự chọn tập đánh giá WenetSpeech-Chuan và thiết lập đường cơ sở, sau 4 vòng thử nghiệm đã xây dựng được 3.413 dữ liệu huấn luyện, giúp tỷ lệ lỗi ký tự giảm từ 25,79% xuống 15,30%, tương đương mức giảm tương đối khoảng 40,7%. Qwen cho biết thử nghiệm này mở ra hướng đi mới cho việc dùng mô hình lớn thúc đẩy nghiên cứu phát triển, từ đó tạo ra các mô hình nhỏ phục vụ nhu cầu nghiệp vụ.

Về các báo cáo từ bên thứ ba, IT cho biết Alibaba Qwen đã chính thức ra mắt mô hình này vào ngày 18 tháng 9. Báo cáo dẫn lời Qwen cho biết điểm số trung bình trên 30 bài kiểm tra đã tăng hơn 26%, chỉ số DER/cpWER của AliMeeting giảm từ 88,11/89,61 xuống còn 3,35/17,18. Người dùng X có tên karminski cho biết tỷ lệ lỗi nhận diện giọng nói trong các cuộc họp có nhiều người nói chồng chéo đã giảm từ 88% ở thế hệ trước xuống còn 3%, đồng thời giá đầu vào âm thanh giảm từ 18 nhân dân tệ xuống 0,8 nhân dân tệ cho mỗi triệu token. Testing Catalog và The Decoder đều đưa tin mô hình sở hữu cửa sổ ngữ cảnh 1M token, năng lực hiểu âm thanh và video tiệm cận Gemini 3.8 Flash. The Decoder cho biết giá API của mô hình là 0,15 USD cho mỗi triệu token đầu vào và 0,47 USD cho đầu ra, thấp hơn so với Gemini 3.8 Flash.

Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T7 · 19/09 · 22:10.

Diễn biến mới nhất

Công bố kết quả thử nghiệm tối ưu hóa mô hình: Qwen3.8-Omni-Flash đã tự tối ưu hóa khả năng nhận diện phương ngữ Tứ Xuyên cho Qwen2.5-Omni-3B trong vòng 12 giờ. Sau 4 vòng thử nghiệm với 3.413 dữ liệu huấn luyện được xây dựng, tỷ lệ lỗi ký tự đã giảm từ 25,79% xuống còn 15,30%.

Chính chủ · 3 bài

Nghe trực tiếp từ bên liên quan

Lọc toàn bộ bài chính chủ trong dòng thời gian →

Dòng thời gian đưa tin

Đang hiện 11 bài · tất cả · mới trước

T7 · 19/09

  1. Qwen3.8-Omni-Flash ra mắt, giá rẻ hơn Gemini Flash với hiệu năng đa phương thức tương đương

    The Decoder: AI News

    Qwen vừa công bố Qwen3.8-Omni-Flash, mô hình đa phương thức đầu tiên được thiết kế cho các tác nhân AI (AI agents). Mô hình này có khả năng xử lý kết hợp cả âm thanh và video, tự động sử dụng các công cụ, đồng thời hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token.

    Đọc bản tiếng Việt →Đọc bài gốc ↗

T6 · 18/09

  1. Bản tin AI ngày 18/9: Ra mắt dự án Claude Code, Qwen3.8-Omni-Flash và nhiều thông tin khác

    X: Testing Catalog (@testingcatalog)

    Alibaba phát hành Qwen3.8-Omni-Flash, mô hình tác tử toàn năng (omni-modal) đầu tiên với cửa sổ ngữ cảnh 1 triệu token, hỗ trợ xử lý âm thanh, video và gọi công cụ (tool calling) nguyên bản. Chi phí đầu vào video giảm khoảng 89% so với phiên bản 3.5-Omni-Plus. Dự án Claude Code của Anthropic hiện đã có thể khởi chạy từ một cuộc hội thoại đơn lẻ, cho phép Claude chạy song song các luồng trên đám mây và lưu giữ bộ nhớ dùng chung; Claude Chat và Cowork được hợp nhất thành Claude thống nhất, đang dần được triển khai tới người dùng gói Pro và Max.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. Alibaba Qwen ra mắt Qwen3.8-Omni-Flash: Mô hình tác tử đa phương thức với cửa sổ ngữ cảnh 1 triệu token

    MarkTechPost

    Đội ngũ Qwen của Alibaba vừa công bố Qwen3.8-Omni-Flash, được giới thiệu là mô hình đa phương thức đầu tiên được xây dựng chuyên biệt cho năng lực tác tử (agent). Mô hình này có khả năng tiếp nhận đầu vào là văn bản, hình ảnh, âm thanh và video, đồng thời hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. Alibaba ra mắt mô hình đa phương thức toàn diện Qwen3.8-Omni-Flash, hỗ trợ hiểu âm thanh và video

    X: Testing Catalog (@testingcatalog)

    Alibaba ra mắt mô hình đa phương thức toàn diện Qwen3.8-Omni-Flash, hỗ trợ hiểu âm thanh và video. Mô hình này được trang bị cửa sổ ngữ cảnh 1M-token, với hiệu suất trên WildClawBench-MM và UniClawBench tiệm cận Gemini 3.8 Flash.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  4. Ra mắt Qwen3.8-Omni-Flash: Mô hình đa phương thức thuần túy tập trung vào khả năng tác tử âm thanh và video

    Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)

    Đội ngũ Qwen vừa phát hành mô hình đa phương thức thuần túy Qwen3.8-Omni-Flash, hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video cùng cửa sổ ngữ cảnh 1 triệu token. Trong 29 bài kiểm tra đánh giá, mô hình đạt điểm trung bình tăng hơn 25% so với Qwen3.5-Omni-Plus, đồng thời chi phí cho đầu vào âm thanh giảm hơn 98% mỗi giờ.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  5. Alibaba ra mắt Qwen3.8-Omni-Flash: Mô hình đa phương thức toàn diện đầu tiên tập trung vào năng lực tác nhân thông minh (agent)

    X: Alibaba Cloud (@alibaba_cloud)Chính chủ

    Alibaba Cloud công bố Qwen3.8-Omni-Flash, mô hình đa phương thức toàn diện đầu tiên được xây dựng xoay quanh khả năng của tác nhân thông minh, tích hợp khả năng hiểu âm thanh, video, suy luận và gọi công cụ vào trong cùng một mô hình.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  6. Alibaba ra mắt mô hình đa phương thức toàn diện Qwen3.8-Omni-Flash, hỗ trợ cửa sổ ngữ cảnh 1 triệu token, với chi phí xử lý đầu vào hình ảnh, văn bản, âm thanh và video là 0,8 nhân dân tệ cho mỗi triệu token

    IT Home

    Alibaba Qwen vừa ra mắt thế hệ mô hình đa phương thức thuần túy mới Qwen3.8-Omni-Flash, có khả năng xử lý đồng thời đầu vào văn bản, hình ảnh, âm thanh và video, hỗ trợ cửa sổ ngữ cảnh 1 triệu token. Trên 30 bài kiểm tra đánh giá, mô hình đạt điểm trung bình tăng hơn 26% so với thế hệ tiền nhiệm Qwen3.5-Omni-Plus. Theo công bố chính thức, năng lực xử lý âm thanh và video của mô hình này tiệm cận với Gemini 3.8 Flash, trong đó khả năng xử lý âm thanh tổng thể đã vượt qua Gemini 3.8 Flash.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  7. Alibaba ra mắt mô hình toàn năng Qwen3.8-Omni-Flash và mã nguồn mở Qwen-Live Harness

    Hacker News: AI bài nổi bật

    Đội ngũ Qwen phát hành mô hình toàn năng nguyên bản thế hệ mới Qwen3.8-Omni-Flash, hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và cửa sổ ngữ cảnh 1M token. Mục tiêu cốt lõi là thúc đẩy khả năng toàn năng từ việc hiểu nội dung sang lập kế hoạch nhiệm vụ, gọi công cụ và bàn giao kết quả sáng tạo.

    Đọc bài gốc ↗
  8. Qwen phát hành mô hình toàn năng Qwen3.8-Omni-Flash

    X: Tongyi Qwen / Qwen (@Alibaba_Qwen)Chính chủ

    Qwen phát hành Qwen3.8-Omni-Flash, mô hình toàn năng đầu tiên của Qwen được xây dựng lấy khả năng tác nhân làm cốt lõi, hỗ trợ hiểu, suy luận và gọi công cụ bằng âm thanh và video nguyên bản.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  9. Qwen ra mắt Qwen3.8-Omni-Flash, đồng thời giới thiệu hai khung hỗ trợ là Qwen-Live-Harness và Qwen-MM-Plugins

    X: karminski (@karminski3)

    Qwen ra mắt Qwen3.8-Omni-Flash với điểm số trung bình tăng 25% so với Qwen3.5-omni-flash. Tỷ lệ lỗi nhận diện giọng nói trong các cuộc họp có nhiều người nói chồng chéo đã giảm từ 88% xuống còn 3%. Mô hình hỗ trợ xử lý trực tiếp đầu vào âm thanh và video liên tục với thời lượng lên đến 1 giờ. Giá đầu vào âm thanh giảm từ 18 nhân dân tệ xuống còn 0,8 nhân dân tệ cho mỗi triệu token. Ngoài ra, hãng cũng giới thiệu phiên bản độ trễ cực thấp Qwen3.8-Omni-Flash-Realtime (xử lý 20 giây âm thanh chỉ trong khoảng 981ms).

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  10. Qwen ra mắt mô hình đa phương thức gốc Qwen3.8-Omni-Flash, tập trung vào việc thực thi các tác vụ thông minh liên quan đến âm thanh và video

    Qwen: Blog Retrieval (API)Chính chủ

    Qwen công bố mô hình đa phương thức gốc thế hệ mới Qwen3.8-Omni-Flash, hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video cùng cửa sổ ngữ cảnh 1M token. Điểm số trung bình qua 29 bài kiểm tra đánh giá tăng hơn 25% so với Qwen3.5-Omni-Plus. Chi phí đầu vào âm thanh mỗi giờ giảm hơn 98%, trong khi chi phí đầu vào âm thanh và video mỗi giờ giảm hơn 93%.

    Đọc bài gốc ↗
← Về bảng nóng

Hồ sơ sự kiện được gom từ nhiều nguồn đưa tin độc lập rồi dịch, tóm tắt sang tiếng Việt. Bản quyền từng bài viết thuộc về cơ quan báo chí gốc. Nguồn dữ liệu: hồ sơ gốc trên AI HOT

Ra mắt Qwen3.8-Omni-Flash: Mô hình đa phương thức thuần túy tập trung vào khả năng tác tử âm thanh và video — Hồ sơ sự kiện | AIHOT.vn