ConceptFormer là khung học tập mới giúp truy xuất tài liệu hình ảnh bằng cách mô hình hóa các khái niệm ẩn, kết nối trực tiếp bằng chứng thị giác với độ liên quan ngữ nghĩa mà không cần mô tả văn bản trung gian.
SPARGen là khung làm việc đa phương thức thống nhất, giải quyết các bài toán tái dựng 3D, tương ứng mật độ và suy luận không gian bằng cách chuyển đổi chúng thành các tác vụ tạo sinh có điều kiện, giúp tối ưu hóa khả năng biểu diễn không gian.
UniMotion là khung mô hình thống nhất đầu tiên tích hợp chuyển động liên tục cùng văn bản và hình ảnh, giải quyết hiệu quả các bài toán từ hiểu, tạo lập đến chỉnh sửa chuyển động con người một cách tự nhiên và chính xác.
Vì sao đáng đọc: Nghiên cứu đột phá được chấp nhận tại ECCV 2026, giải quyết lỗ hổng quan trọng trong việc xử lý chuyển động liên tục của con người trong các mô hình đa phương thức hiện nay.
Xiaohongshu (RedNote) -often called China's Facebook, with 350 million users and over a decade of lif…
DịchXiaohongshu vừa mã nguồn mở dots3-note, mô hình MoE 280B với cửa sổ ngữ cảnh 512K, hỗ trợ đa phương thức và tối ưu hóa cho các tác vụ dài hạn trong đời sống thông qua phương pháp huấn luyện TEMPO.
Alibaba dropped the weights for Qwen3.8-27B as a 27B open-weight multimodal model built for local de…
DịchAlibaba vừa phát hành Qwen3.8-27B, mô hình đa phương thức 27 tỷ tham số theo giấy phép Apache 2.0, hỗ trợ tốt các framework như Transformers, vLLM và triển khai lượng tử hóa cục bộ.
So yeah, you can now run Opus 4.6 max locally. Just let that sink in.
DịchQwen ra mắt mô hình đa phương thức 27B với khả năng lập trình và điều khiển máy tính vượt trội Claude Opus 4.6 Max. Hỗ trợ cửa sổ ngữ cảnh lên tới 1M token và giấy phép Apache 2.0 cho phép tự triển khai cục bộ.
Alibaba trình làng Qwen3.8-27B, mô hình đa phương thức mạnh mẽ với 27 tỷ tham số, hỗ trợ ngữ cảnh 262K và có thể mở rộng lên 1M token. Model này vượt trội trong lập trình và xử lý công việc văn phòng, đồng thời được phát hành theo giấy phép Apache 2.0.
Qwen-3.8 27b released! Significant jump! Qwen just released Qwen3.8-27B, a compact open-weight mult…
DịchAlibaba trình làng Qwen3.8-27B, mô hình đa phương thức mã nguồn mở với khả năng lập trình và điều khiển máy tính vượt trội, thách thức cả Claude Opus 4.6 Max dù chỉ sở hữu 27 tỷ tham số.
Tiểu Hồng Thư vừa công bố mã nguồn mở dots3-note Preview, mô hình nhẹ nhất trong dòng dots3 với 280B tham số (16B kích hoạt). Sản phẩm hỗ trợ cửa sổ ngữ cảnh 512K, xử lý đa phương thức (văn bản, hình ảnh, âm thanh) và tối ưu hóa cho suy luận phức tạp.
Vì sao đáng đọc: Đây là bước tiến đáng chú ý từ một nền tảng lớn như Tiểu Hồng Thư, mô hình có thông số kỹ thuật ấn tượng cho các tác vụ Agent và đa phương thức, rất phù hợp với xu hướng AI hiện nay.
Try Grok 4.6 image & video understanding, it's a major upgrade!
DịchElon Musk khẳng định Grok 4.6 mang lại bước tiến vượt bậc trong việc xử lý hình ảnh và video, giúp tăng năng suất làm việc gấp hàng chục lần và vượt qua các đối thủ như Gemini 3.5 hay Gemma 4.
The Meta/Oxford study finds, a multimodal model may need surprisingly little image-generation data i…
DịchNghiên cứu chỉ ra rằng việc cân bằng tỷ lệ dữ liệu ngôn ngữ và hình ảnh giúp mô hình đa phương thức đạt hiệu suất cao hơn dù giảm 5 lần dữ liệu tạo ảnh. Đồng thời, việc đưa hình ảnh vào quá muộn dễ gây ra tình trạng 'lười thị giác', khiến mô hình quá phụ thuộc vào ngôn ngữ.
OmniScientist là AI khoa học đầu tiên xử lý trực tiếp dữ liệu thô đa phương thức (hình ảnh, âm thanh, 3D, bảng biểu) để tự động hoàn thiện quy trình nghiên cứu từ dữ liệu đến bài báo khoa học hoàn chỉnh trên nhiều lĩnh vực.
Intern-S2-Preview là dòng mô hình nền tảng đa phương thức chuyên dụng cho nghiên cứu khoa học, hỗ trợ suy luận phức tạp và xử lý chuỗi thời gian dài với hiệu suất vượt trội trên nhiều tiêu chuẩn đánh giá.
Nghiên cứu chỉ ra rằng các thao tác thị giác như cắt/phóng ảnh trong LLM đa phương thức thường không cải thiện hiệu suất đáng kể mà lại gây tốn kém tài nguyên. Tác giả đề xuất mô hình đồ thị nhân quả để kiểm chứng liệu các công cụ này có thực sự hỗ trợ tư duy hay chỉ là sự ngẫu nhiên.
NeuPAT là phương pháp mới giúp bảo vệ các neuron quan trọng trong LLM khi huấn luyện đa phương thức, ngăn chặn tình trạng suy giảm khả năng ngôn ngữ vốn có bằng cách phân bổ mức độ cập nhật linh hoạt cho từng neuron.
FLUX 3 is now live in Luma. @bfl_ai 's first general model for image, video, audio, and action-pred…
DịchLuma AI vừa ra mắt FLUX 3, mô hình đa phương thức đầu tiên từ Black Forest Labs hỗ trợ xử lý đồng thời hình ảnh, video, âm thanh và dự đoán chuyển động. Người dùng hiện đã có thể trải nghiệm tính năng tạo video kèm âm thanh gốc ngay trên nền tảng.
Phương pháp cắt tỉa lõi GMC mới cho phép mô hình Zidong Taichu tối ưu hóa hiệu suất đáng kể mà không cần huấn luyện lại, sẵn sàng sử dụng ngay lập tức.
Join us with the Qwen and Qwen Cloud teams for Episode 2 of Qwen Live, as we explore how multimodal …
DịchTham gia Qwen Live để khám phá cách Qwen-Image 3.0 và Qwen3.8-Max chuyển mình từ bản demo sang môi trường sản xuất, cùng lộ trình tối ưu hóa cho các tác nhân AI (AI Agents).