Đa phương thức
CHỦ ĐỀ · TRANG 4

Đa phương thức

Khả năng xử lý ngoài văn bản: Hiểu thị giác, đồ họa, âm thanh và video của các mô hình thế hệ mới.

726 bài thu thập75 tinh chọncập nhật đến 27/09 23:50

  1. WeChat: DeepSeekT6 · 21/08 · 16:12

    DeepSeek ra mắt mô hình thị giác đa phương thức V4-Flash-Vision-Exp

    DeepSeek vừa trình làng V4-Flash-Vision-Exp, mô hình đa phương thức có khả năng xử lý hình ảnh mạnh mẽ ngang ngửa Opus-4.8. Người dùng có thể truy cập qua API với cơ chế tính phí theo token và tận dụng Files API mới để tối ưu hóa việc tải lên hình ảnh.

  2. WeChat: MiniMaxT5 · 20/08 · 07:36

    MiniMax Design ra mắt: Bước tiến từ xử lý pixel đến thấu hiểu ý đồ và ngữ nghĩa

    MiniMax Design là nền tảng tích hợp mô hình đa phương thức H3, giúp tự động hóa quy trình sản xuất nội dung từ khâu xử lý tư liệu đến dựng phim hoàn chỉnh thông qua các tác nhân AI thông minh.

  3. Hugging Face Daily PapersT4 · 19/08 · 15:15

    PixRestore: Bước đột phá trong phục hồi ảnh bằng mô hình Diffusion Transformer không dùng VAE

    PixRestore là mô hình Diffusion Transformer hoạt động trực tiếp trên không gian pixel, loại bỏ sự phụ thuộc vào VAE để bảo toàn chi tiết ảnh sắc nét và khắc phục các lỗi sai lệch nội dung thường gặp ở các mô hình T2I.

  4. Hugging Face Daily PapersT4 · 19/08 · 02:15

    IVT: Bước tiến mới giúp AI 'tư duy hình ảnh nội tại' để dự đoán video chủ động

    IVT là phương pháp huấn luyện giúp mô hình AI dự đoán các khung hình tương lai mà không cần tạo ảnh trung gian, giúp tăng tốc độ xử lý video mà vẫn giữ được khả năng suy luận logic.

  5. Ant Group inclusionAI: GitHub kho mã mớiT3 · 18/08 · 12:34

    Ant Group ra mắt ConceptEdit: Công cụ mã nguồn mở tạo dữ liệu chỉnh sửa ảnh bằng AI

    ConceptEdit là quy trình tự động tạo tập dữ liệu chỉnh sửa ảnh quy mô lớn thông qua ba bước: tạo lệnh bằng VLM, thực thi chỉnh sửa với FLUX và đánh giá bằng VQA, giúp tối ưu hóa việc huấn luyện các mô hình chỉnh sửa hình ảnh.

  6. JiQiZhiXinT3 · 18/08 · 11:00

    ECCV 2026: OVOW - Biến video đơn lẻ thành thế giới 4D có thể mô phỏng vật lý

    OVOW là bước đột phá giúp chuyển đổi video đơn lẻ thành các mô hình 4D dạng Mesh có thể tương tác, hỗ trợ đắc lực cho việc huấn luyện robot trong môi trường mô phỏng thực tế mà không cần dựng hình thủ công.

  7. JiQiZhiXinT2 · 17/08 · 23:00

    CurrentWorld-0: Mô hình thế giới vật lý đa phương thức đầu tiên hỗ trợ đa thực thể và đa góc nhìn

    CurrentWorld-0 là trình mô phỏng thế giới tương tác đột phá, học quy luật vật lý từ dữ liệu thực tế thay vì công thức thủ công, cho phép mô phỏng chính xác các vật thể mềm, chất lỏng và hành vi robot phức tạp.

  8. JiQiZhiXinT2 · 17/08 · 13:00

    ECCV 2026: Vinci2 đưa trợ lý AI góc nhìn thứ nhất từ 'hỏi đáp thụ động' sang 'chủ động hỗ trợ'

    Vinci2 giải quyết bài toán khó khi nào AI nên chủ động lên tiếng bằng cách kết hợp ra quyết định và tạo nội dung dựa trên dòng video liên tục và bộ nhớ dài hạn, giúp trợ lý AI hiểu ngữ cảnh và thói quen người dùng tốt hơn.

  9. JiQiZhiXinT7 · 15/08 · 15:00

    ECCV 2026: UniMotion - Bước tiến mới đưa chuyển động liên tục vào mô hình đa phương thức

    UniMotion là khung mô hình thống nhất đầu tiên tích hợp chuyển động liên tục cùng văn bản và hình ảnh, giải quyết hiệu quả các bài toán từ hiểu, tạo lập đến chỉnh sửa chuyển động con người một cách tự nhiên và chính xác.

  10. HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)T7 · 15/08 · 07:00

    MOSS-VL: Dòng mô hình ngôn ngữ thị giác mã nguồn mở đột phá với khả năng tương tác thời gian thực

    MOSS-VL là dòng mô hình ngôn ngữ thị giác tiên phong tích hợp khả năng vừa quan sát vừa phản hồi theo thời gian thực. Nhờ cơ chế chú ý chéo, mô hình đạt hiệu suất vượt trội trên các bài kiểm tra luồng dữ liệu, dẫn đầu các giải pháp mã nguồn mở hiện nay.

  11. QwenT6 · 14/08 · 22:22

    Alibaba chính thức mã nguồn mở dòng mô hình Qwen3.8 mạnh mẽ

    Alibaba ra mắt dòng Qwen3.8 với phiên bản 27B đa phương thức, vượt trội hơn Qwen3.7-Plus dù tham số nhỏ hơn, hỗ trợ ngữ cảnh lên tới 1 triệu token và phát hành theo giấy phép Apache 2.0.

  12. WeChat: Xiaohongshu Tech (dots.llm)T6 · 14/08 · 18:31

    Tiểu Hồng Thư ra mắt dots3-note Preview: Mô hình 280B tối ưu cho tác vụ Agent và đa phương thức

    Tiểu Hồng Thư vừa công bố mã nguồn mở dots3-note Preview, mô hình nhẹ nhất trong dòng dots3 với 280B tham số (16B kích hoạt). Sản phẩm hỗ trợ cửa sổ ngữ cảnh 512K, xử lý đa phương thức (văn bản, hình ảnh, âm thanh) và tối ưu hóa cho suy luận phức tạp.

  13. JiQiZhiXinT6 · 14/08 · 14:45

    Tiểu Hồng Thư chính thức mã nguồn mở dots3-note: Phiên bản kế thừa từ mô hình đạt điểm tuyệt đối IMO

    Tiểu Hồng Thư vừa ra mắt phiên bản mã nguồn mở dots3-note preview, sở hữu 280B tham số và khả năng xử lý đa phương thức, tập trung tối ưu cho các tác vụ dài hạn phức tạp như lập kế hoạch thực tế.

  14. Hugging Face Daily PapersT5 · 13/08 · 11:15

    AtlasVLA: Bước tiến mới trong mô hình VLA với khả năng ghi nhớ trạng thái thế giới bền vững

    AtlasVLA giải quyết hạn chế của các mô hình VLA truyền thống bằng cách tích hợp bộ nhớ không gian 4D và trạng thái làm việc cá nhân, giúp robot duy trì nhận thức về môi trường và tiến độ công việc ngay cả khi vật thể nằm ngoài tầm nhìn.

  15. OpenRouterT4 · 12/08 · 19:02

    Meta ra mắt Muse Glimmer: Mô hình AI mã nguồn mở 30B đã có mặt trên OpenRouter

    Meta AI vừa phát hành Muse Glimmer, mô hình 30B đa phương thức (văn bản và hình ảnh) với giấy phép Apache 2.0. Được tối ưu cho các tác nhân AI cục bộ, mô hình này hiện đã sẵn sàng để trải nghiệm trên nền tảng OpenRouter.

Đa phương thức — Chủ Đề AI · Trang 4 | AIHOT.vn