04/09

Thứ Sáu · 3 tin
SiliconFlow@SiliconFlowAI
Mô hìnhĐiểm AI 63/100

DeepSeek-V4-Flash-Vision-Exp ra mắt trên SiliconFlow: Hỗ trợ thị giác và cửa sổ ngữ cảnh 1 triệu token

DeepSeek V4 Flash just got vision. 👀 DeepSeek-V4-Flash-Vision-Exp is now live on SiliconFlow - and …

DịchMô hình DeepSeek-V4-Flash-Vision-Exp đã có mặt trên SiliconFlow và OpenRouter, kết hợp khả năng hiểu hình ảnh với cửa sổ ngữ cảnh 1 triệu token. Đây là lựa chọn tối ưu cho các tác vụ đa phương thức và AI Agent với chi phí vận hành cạnh tranh.

03/09

Thứ Năm · 4 tin
Hugging Face: Blog
Mô hìnhĐiểm AI 53/100

H Company ra mắt NeoMME: Bộ mã hóa đa phương thức đa ngôn ngữ mã nguồn mở

H Company giới thiệu NeoMME, bộ mã hóa đa phương thức với hai phiên bản 260M và 800M, sử dụng kiến trúc Transformer thuần túy và kỹ thuật khuếch tán rời rạc để xử lý đồng thời văn bản và hình ảnh mà không cần mô hình thị giác tiền huấn luyện.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

NeoMME: Bộ mã hóa đa phương thức đa ngôn ngữ tối ưu cho suy luận và tinh chỉnh

NeoMME là kiến trúc bộ mã hóa Transformer hai chiều nhỏ gọn, hỗ trợ đa ngôn ngữ và hình ảnh, giúp tối ưu hóa hiệu suất cho các tác vụ truy xuất tài liệu mà không cần dùng đến các mô hình ngôn ngữ tạo sinh cồng kềnh.

Thêm 1 nguồn khác đưa tinHugging Face: Blog
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Cùng sự kiệnSnapBench: Bộ tiêu chuẩn đánh giá khả năng truy xuất đa phương thức cho tương tác di động

SnapBench là bộ tiêu chuẩn đầu tiên đánh giá độ bền của các mô hình AI khi người dùng chụp ảnh và đặt câu hỏi trên thiết bị di động, giải quyết các vấn đề về ảnh mờ hoặc lỗi nhập liệu văn bản thông qua 1.145 truy vấn thực tế.

Cùng sự kiện, bài đại diện «MULTI3IR: Bộ tiêu chuẩn mới đánh giá khả năng truy xuất thông tin đa chiều và đa phương thức»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

MULTI3IR: Bộ tiêu chuẩn mới đánh giá khả năng truy xuất thông tin đa chiều và đa phương thức

Multi^3IR là bộ tiêu chuẩn đánh giá khả năng truy xuất thông tin cho các truy vấn mở, đa góc nhìn trên nhiều lĩnh vực. Nghiên cứu cũng giới thiệu SPIN, phương pháp tối ưu hóa giúp giảm độ lệch đơn chiều và cải thiện độ chính xác cho các mô hình truy xuất hiện nay.

02/09

Thứ Tư · 5 tin
Xiaobei@frxiaobei
Mô hìnhĐiểm AI 61/100

Cùng sự kiệnWorld Labs ra mắt Atlas: Mô hình thế giới đa phương thức đột phá

World Labs vừa giới thiệu Atlas, mô hình thế giới đa phương thức đầu tiên được huấn luyện từ đầu, có khả năng tái tạo không gian 3D, điều khiển camera chính xác và mô phỏng thời gian thực, mở ra ứng dụng tiềm năng từ kỹ xảo điện ảnh đến robot học.

Cùng sự kiện, bài đại diện «Fei-Fei Li ra mắt Atlas: Kỷ nguyên mới của mô hình thế giới đa phương thức»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnUI-Venus-2: Bước tiến mới cho tác nhân AI điều khiển giao diện người dùng đa nền tảng

UI-Venus-2 là tác nhân AI đa phương thức thế hệ mới, có khả năng tự động hóa tác vụ trên cả di động, web và máy tính nhờ khung làm việc suy luận-hành động khép kín, giúp thu hẹp khoảng cách từ thử nghiệm đến ứng dụng thực tế.


Vì sao đáng đọc: Đây là nghiên cứu quan trọng về tác nhân AI (GUI agents), giải quyết bài toán thực tế về tính ứng dụng đa nền tảng, rất đáng chú ý cho cộng đồng phát triển AI.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Nghiên cứu cơ chế phối hợp giữa hiểu và tạo trong mô hình đa phương thức nguyên bản

Nghiên cứu chỉ ra rằng việc tách biệt nhiệm vụ giúp tránh sự suy giảm hiệu năng khi mô hình đa phương thức vừa hiểu vừa tạo ảnh, đồng thời khẳng định mô hình end-to-end vượt trội hơn so với các hệ thống phân tách truyền thống.

QbitAI
Mô hìnhĐiểm AI 95/100

Tinh chọnFei-Fei Li công bố mô hình thế giới đa phương thức đầu tiên trên thế giới

Mô hình mới có khả năng tái tạo thế giới 3D chỉ từ một hình ảnh duy nhất, đồng thời hỗ trợ tạo môi trường huấn luyện thực tế cho robot.


Vì sao đáng đọc: Đây là bước tiến đột phá từ chuyên gia hàng đầu Fei-Fei Li, có tác động trực tiếp đến lĩnh vực robot và mô hình thế giới, tính ứng dụng cực cao.
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 55/100

World Labs ra mắt Atlas: Mô hình thế giới đa phương thức hỗ trợ điều khiển camera và tái tạo 3D

Omni models are the next frontier. Simply put it, this is the most exciting release I've seen this …

DịchWorld Labs giới thiệu Atlas, mô hình thế giới đa phương thức đầu tiên có khả năng tạo hình ảnh, video với độ chính xác cấp pixel và tái tạo không gian 3D, mở ra kỷ nguyên mới cho các mô hình AI toàn diện.

01/09

Thứ Ba · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

MMMMM: Hệ thống phân loại toàn diện về thông tin sai lệch đa phương thức

Nghiên cứu giới thiệu bộ dữ liệu đa ngôn ngữ và hệ thống phân loại mới nhằm nhận diện các chiến thuật lừa đảo trong thông tin sai lệch đa phương thức trên mạng xã hội, hỗ trợ tự động hóa việc phân tích quy mô lớn.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SafeAtlas-VL: Bước tiến mới trong kiểm duyệt an toàn đa phương thức với thang đo 5 cấp độ

SafeAtlas-VL giới thiệu bộ dữ liệu 1,5 triệu mẫu giúp đánh giá an toàn đa phương thức chi tiết theo thang đo 5 cấp thay vì nhị phân, bao phủ 15 danh mục rủi ro từ hình ảnh đến ý định người dùng.

31/08

Thứ Hai · 2 tin
IT Home
Mô hìnhĐiểm AI 76/100

Tinh chọnDeepSeek ra mắt mô hình đa phương thức mã nguồn mở V4-Flash-Vision-Exp, hiệu năng tiệm cận Opus-4.8

DeepSeek vừa phát hành mô hình đa phương thức đầu tiên DeepSeek-V4-Flash-Vision-Exp trên Hugging Face theo giấy phép MIT, cung cấp đầy đủ mã nguồn và tài liệu triển khai cho cộng đồng.

Diễn biến sự kiện · 1 bài →Thêm 1 nguồn khác đưa tinPandaily

Vì sao đáng đọc: Đây là bước tiến quan trọng của DeepSeek trong lĩnh vực đa phương thức, thu hút sự quan tâm lớn từ cộng đồng mã nguồn mở nhờ hiệu năng cạnh tranh với các mô hình hàng đầu.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Định vị mọi thứ trong video: Giải pháp giải mã song song cho bài toán STVG hiệu quả

Nghiên cứu giới thiệu Parallel Tube Decoding (PTD), phương pháp giúp định vị đối tượng trong video nhanh chóng bằng cách giải mã song song thay vì tuần tự, loại bỏ độ trễ và lỗi tích lũy so với các mô hình ngôn ngữ đa phương thức hiện nay.

28/08

Thứ Sáu · 5 tin
ModelBest OpenBMB@OpenBMB
Mô hìnhĐiểm AI 49/100

MiniCPM-o 4.5 đã hỗ trợ chạy mượt mà trên chip Apple Silicon nhờ TyloQuant MFQ

MiniCPM-o 4.5 now runs efficiently on Apple Silicon with TyloQuant MFQ! 🥰 The team at @Tylogi_ai h…

DịchMô hình MiniCPM-o 4.5 hiện đã có thể chạy cục bộ trên chip Apple Silicon thông qua kỹ thuật lượng tử hóa TyloQuant MFQ, giúp tối ưu bộ nhớ mà vẫn giữ nguyên khả năng xử lý đa phương thức và tương tác thời gian thực.

Alibaba Cloud@alibaba_cloud
Mô hìnhĐiểm AI 62/100

Alibaba ra mắt Wan 3.0 trên DeepInfra: Mô hình tạo video và âm thanh đồng nhất

Wan 3.0 is now on @DeepInfra! 🚀 Video + audio in one model, with 30-second generation and multimoda…

DịchAlibaba chính thức đưa mô hình Wan 3.0 lên nền tảng DeepInfra, cho phép tạo video 1080p dài 30 giây kèm âm thanh đồng bộ. Công cụ hỗ trợ đa phương thức từ hình ảnh đến website, đảm bảo tính nhất quán cho nhân vật với chi phí 0,2 USD/giây.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnECCV 2026 Oral: MAVIN - Bước tiến mới giúp AI 'đạo diễn' video đa góc quay theo kịch bản

MAVIN là mô hình tiên phong cho phép AI tạo video đa góc quay với khả năng kiểm soát chặt chẽ về thời gian, đồng bộ âm thanh và nhất quán nhân vật, giải quyết bài toán khó trong việc kể chuyện bằng video dài.


Vì sao đáng đọc: Đây là nghiên cứu đột phá được chọn làm Oral tại ECCV 2026, giải quyết trực tiếp điểm yếu của các mô hình video hiện nay là khả năng duy trì tính nhất quán trong kịch bản phức tạp.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

CaRGo-T: Cải thiện khả năng hiểu hài hước đa phương thức bằng đồ thị suy luận nhân quả

CaRGo-T là khung suy luận mới sử dụng cấu trúc đồ thị để biểu diễn các mối quan hệ nhân quả và ngữ cảnh phức tạp trong nội dung hài hước, giúp các mô hình thị giác-ngôn ngữ hiểu sâu sắc hơn thay vì chỉ suy luận tuyến tính.

27/08

Thứ Năm · 13 tin
Logan Kilpatrick@OfficialLoganK
Mô hìnhĐiểm AI 54/100

Cùng sự kiệnGoogle ra mắt Gemini 1.5 Flash Omni: Bước tiến mới trong tạo video và xử lý đa phương thức

Excited to bring Gemini Omni Flash 1.1 to the world, this is an update to our anything in, anything …

DịchGemini 1.5 Flash Omni vừa được cập nhật khả năng tạo video mạnh mẽ, hỗ trợ mở rộng video lên đến 10 giây mỗi lần, nâng cấp độ phân giải 4K và sử dụng video tham chiếu để tạo nội dung nhất quán.

Cùng sự kiện, tinh chọn hiển thị «Google ra mắt Gemini 1.1 Flash: Bước tiến mới trong khả năng kiểm soát video AI»
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnECCV 2026 | OmniColor: Khung làm việc thống nhất cho tô màu tranh vẽ nét đa phương thức

OmniColor là giải pháp đột phá từ ĐH Bách khoa Hồng Kông, cho phép tô màu tranh vẽ nét dựa trên sự kết hợp linh hoạt giữa văn bản, gợi ý màu sắc, hình ảnh tham chiếu và khung hình lịch sử, giải quyết triệt để vấn đề xung đột điều kiện trong quy trình sản xuất hoạt hình chuyên nghiệp.


Vì sao đáng đọc: Nghiên cứu giải quyết bài toán thực tế trong sản xuất nội dung sáng tạo với cách tiếp cận đa phương thức thông minh, có tính ứng dụng cao và được công bố tại hội nghị AI hàng đầu.
X.PIN@thexpin
Mô hìnhĐiểm AI 56/100

Cùng sự kiệnZhipu AI ra mắt GLM-5.3-Flash: Bước tiến lớn của mô hình đa phương thức trên chip nội địa

Zhipu open-sourced GLM-5.3-Flash on Aug. 26, the GLM-5 series' first native multimodal model. Its on…

DịchZhipu AI vừa phát hành mã nguồn mở GLM-5.3-Flash, mô hình đa phương thức đầu tiên chạy hoàn toàn trên 100.000 chip nội địa Trung Quốc với hiệu suất ngang ngửa Claude Opus nhưng chi phí cực thấp.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»
AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 55/100

WeMM-Embedding: Mô hình đa phương thức mã nguồn mở từ WeChat với hiệu suất vượt trội

WeChat vừa ra mắt WeMM-Embedding, mô hình đa phương thức tối ưu cho tìm kiếm hỗn hợp và nhận diện hình ảnh. Với phiên bản 2B mạnh mẽ, mô hình này cho phép chạy mượt mà trên card đồ họa phổ thông, hỗ trợ đắc lực cho các ứng dụng như tìm kiếm thông minh, bộ nhớ dài hạn cho AI Agent và gắn nhãn nội dung.

TechNode
Mô hìnhĐiểm AI 85/100

Cùng sự kiệnZhipu công bố GLM-5.3-Flash: Hé lộ danh tính thực sự của mô hình ẩn danh Ox Alpha

Zhipu chính thức ra mắt GLM-5.3-Flash với 320 tỷ tham số, xác nhận đây chính là mô hình Ox Alpha từng gây xôn xao. Đây là mô hình đa phương thức gốc đầu tiên trong dòng GLM-5, hỗ trợ xử lý linh hoạt văn bản, hình ảnh và video.

Cùng sự kiện, bài đại diện «Zhipu AI xác nhận mô hình 'Niu Lai' chính là GLM-5.3-Flash, vận hành trên 100.000 chip nội địa»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 75/100

Real-TurnTurk: Bộ dữ liệu đa phương thức cho dự đoán lượt hội thoại tiếng Thổ Nhĩ Kỳ

Nghiên cứu giới thiệu bộ dữ liệu hội thoại tự nhiên bằng tiếng Thổ Nhĩ Kỳ, kết hợp video, âm thanh và văn bản để tối ưu hóa việc dự đoán lượt nói trong giao tiếp thông qua thuật toán di truyền.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

VBVR-Pro: Bộ công cụ suy luận thị giác nguyên bản có khả năng mở rộng và kiểm chứng

VBVR-Pro là nền tảng kiểm thử khép kín sử dụng tạo sinh hình ảnh làm phương tiện suy luận, giúp việc suy luận thị giác trở nên có thể huấn luyện và kiểm chứng. Hệ thống vượt trội hơn các mô hình VLM truyền thống nhờ cơ chế đánh giá dựa trên quy tắc xác định.

OpenRouter@OpenRouter
Mô hìnhĐiểm AI 50/100

Cùng sự kiệnMô hình đa phương thức Qwen3.8 Flash của Alibaba chính thức có mặt trên OpenRouter

Qwen3.8 Flash from @Alibaba_Qwen is now live on OpenRouter. A multimodal reasoning model for coding…

DịchAlibaba vừa ra mắt Qwen3.8 Flash trên nền tảng OpenRouter, một mô hình đa phương thức mạnh mẽ hỗ trợ lập trình, phân tích tài liệu, xử lý hình ảnh và video dài.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»
MarkTechPost
Mô hìnhĐiểm AI 68/100

Cùng sự kiệnZ.ai ra mắt GLM-5.3-Flash: Mô hình MoE đa phương thức 320B, hỗ trợ cửa sổ ngữ cảnh 1 triệu token

Z.ai trình làng GLM-5.3-Flash, mô hình đa phương thức gốc với 320 tỷ tham số, hỗ trợ xử lý hình ảnh, video và cửa sổ ngữ cảnh lên tới 1 triệu token, hiện đã mở mã nguồn theo giấy phép MIT.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»
MiniMax@MiniMax_AI
NgànhĐiểm AI 26/100

MiniMax trình làng mô hình đa phương thức H3 tại hội nghị RaySummit

MiniMax H3 is at @anyscalecompute's #RaySummit today in SF. @VictorSuOrtiz will break down our 33B …

DịchMiniMax giới thiệu mô hình mã nguồn mở H3 (33B) tại RaySummit, cho phép tích hợp văn bản, hình ảnh, video và âm thanh vào một ngữ cảnh duy nhất. Các chuyên gia sẽ hướng dẫn cộng đồng cách tinh chỉnh và triển khai mô hình này trên hạ tầng của các đối tác lớn.

26/08

Thứ Tư · 12 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 49/100

Cùng sự kiệnQwen3.8-Flash: Mô hình MoE đa phương thức hiệu năng cao, hé lộ kiến trúc Qwen4

What's better than an open-weight multimodal model release? Well, the technical report. I just love…

DịchAlibaba ra mắt Qwen3.8-Flash, mô hình MoE đa phương thức với 125B tham số (kích hoạt 6B mỗi token), hỗ trợ ngữ cảnh lên tới 1 triệu token và là phiên bản xem trước của kiến trúc Qwen4.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»
MarkTechPost
Mô hìnhĐiểm AI 70/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-Flash-Next: Mô hình MoE đa phương thức 125B với hiệu suất cực cao

Đội ngũ Qwen của Alibaba vừa giới thiệu Qwen3.8-Flash-Next, mô hình MoE đa phương thức 125B chỉ kích hoạt 6B tham số mỗi token, đóng vai trò là bản xem trước cho kiến trúc Qwen4 thế hệ mới.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»
WeChat: Zhipu AI (GLM)
Mô hìnhĐiểm AI 83/100

Cùng sự kiệnra mắt GLM-5.3-Flash: Mô hình đa phương thức 320B với chi phí chỉ bằng 1/40 Claude Opus

vừa công bố GLM-5.3-Flash, mô hình đa phương thức đầu tiên thuộc dòng GLM-5 với 320 tỷ tham số. Sản phẩm đạt hiệu suất ngang ngửa Claude Opus 4.8 nhưng có giá thành cực kỳ cạnh tranh, hiện đã mở API cho các nhà phát triển.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»
OpenRouter@OpenRouter
Mô hìnhĐiểm AI 59/100

Cùng sự kiệnOpenRouter ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ từ Z-AI

Ox Alpha revealed: @Zai_org's GLM-5.3-Flash, the first native multimodal model in the GLM-5 series. …

DịchOpenRouter vừa giới thiệu GLM-5.3-Flash, mô hình đa phương thức gốc đầu tiên thuộc dòng GLM-5. Với hiệu suất ấn tượng, mô hình này đã xử lý hơn 20 nghìn tỷ token chỉ trong 6 ngày, trở thành mô hình lớn nhất từng xuất hiện trên nền tảng này.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»
Zhipu AI Z.ai@Zai_org
Mô hìnhĐiểm AI 80/100

Cùng sự kiệnZhipu AI ra mắt GLM-5.3-Flash: Mô hình 320B mã nguồn mở theo giấy phép MIT

Introducing GLM-5.3-Flash - Leading capabilities at a highly competitive price - Natively multimoda…

DịchZhipu AI vừa phát hành GLM-5.3-Flash, mô hình đa phương thức mạnh mẽ với 320 tỷ tham số, hỗ trợ cửa sổ ngữ cảnh 1 triệu token và hoàn toàn tương thích với chip AI nội địa.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»
LMSYS: Blog (nhóm Chatbot Arena)
Mô hìnhĐiểm AI 70/100

Cùng sự kiệnQwen ra mắt mã nguồn mở Qwen3.8-Flash-Next, hỗ trợ Day-0 từ SGLang

Đội ngũ Qwen vừa phát hành mô hình đa phương thức MoE Qwen3.8-Flash-Next, phiên bản xem trước của kiến trúc Qwen4 với 125B tham số và cơ chế định tuyến chuyên gia tối ưu hóa hiệu suất.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»
Kim@kimmonismus
Mô hìnhĐiểm AI 54/100

Cùng sự kiệnRa mắt Qwen3.8-Flash-Next: Mô hình 6B tham số vượt mặt Claude Opus 4.6

Qwen 3.8 Flash-Next official released: A 6B-active open model just beat Claude Opus 4.6 Max across 8…

DịchQwen3.8-Flash-Next là mô hình đa phương thức mã nguồn mở dạng MoE, chỉ kích hoạt 6B tham số mỗi token nhưng đạt hiệu suất vượt trội. Mô hình hỗ trợ cửa sổ ngữ cảnh 256K, có thể mở rộng lên tới 1M.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (57 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Đa phương thức” — Trang 3 | AIHOT.vn