LongCat-2.5-Preview is now free on OpenCode for two weeks - 1M Context - Multi-modal - Zero Data Re…
DịchLongCat-2.5-Preview hiện đã có mặt trên nền tảng OpenCode, cho phép người dùng trải nghiệm miễn phí trong hai tuần với khả năng xử lý 1 triệu token context và tính năng đa phương thức.
Tại Hội nghị Vân Tê 2026, Alibaba đã công bố những cập nhật quan trọng về hệ sinh thái mô hình đa phương thức, xác nhận Qwen4 và mô hình video thế hệ mới đang trong quá trình huấn luyện.
MintAct là dòng mô hình ngôn ngữ-thị giác đa quy mô, có khả năng điều hướng và sử dụng công cụ trên cả di động, máy tính và web với hiệu suất tương đương các chuyên gia riêng biệt.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc tạo ra tác nhân AI đa năng, giải quyết bài toán khó về tính đồng nhất giữa các nền tảng khác nhau với hạ tầng RL quy mô lớn.
Thanks @vllm_project for the day-0 support! 🙌 Generate, edit, transparent output - one model, ready…
DịchQwen-Image-2.1 kết hợp kiến trúc 7.1B DiT và Qwen3-VL-8B, cho phép tạo, chỉnh sửa và xuất ảnh trong suốt trong cùng một mô hình. Người dùng có thể triển khai ngay với sự hỗ trợ từ vLLM-Omni.
🚀 Meet Qwen3.8-Omni-Flash, Qwen's first omni-modal model built around agentic capabilities! Native…
DịchAlibaba Cloud vừa giới thiệu Qwen3.8-Omni-Flash, mô hình toàn năng đầu tiên được thiết kế chuyên biệt cho AI Agent, tích hợp khả năng hiểu âm thanh, video, suy luận logic và điều khiển công cụ trong một hệ thống duy nhất.
🚀 Meet Qwen3.8-Omni-Flash, Qwen's first omni-modal model built around agentic capabilities! Native…
DịchAlibaba vừa giới thiệu Qwen3.8-Omni-Flash, mô hình toàn năng đầu tiên của dòng Qwen được tối ưu hóa cho khả năng tác tử (agent), hỗ trợ xử lý âm thanh, video, suy luận và sử dụng công cụ trực tiếp.
Diễn biến sự kiện · 11 bài →Thêm 9 nguồn khác đưa tinThe Decoder: AI NewsX: Testing Catalog (@testingcatalog)PandailyTechNodeMarkTechPostHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Alibaba Cloud (@alibaba_cloud)IT HomeX: karminski (@karminski3)
ZDTaichu 5.0-9B thiết lập tiêu chuẩn mới cho các mô hình dưới 10B, dẫn đầu 8/9 bảng xếp hạng về trí tuệ nhân tạo không gian và vượt mặt nhiều đối thủ lớn nhờ công nghệ suy luận vòng lặp thích ứng.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực mô hình nhỏ (SLM) với khả năng ứng dụng thực tế cao trong robot và AI hiện thân, đồng thời cung cấp lộ trình kỹ thuật minh bạch.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
PANORAMA là mô hình VLM mới giúp định vị và mô tả chi tiết cả vật thể lẫn bối cảnh ở cấp độ pixel. Nghiên cứu còn giới thiệu bộ dữ liệu PanoCaps và các chỉ số đánh giá mới, thiết lập tiêu chuẩn hiệu năng vượt trội trong các tác vụ thị giác máy tính.
Significantly more capacity for Union Alpha is coming online tomorrow morning Thanks for bearing wi…
DịchOpenRouter thông báo mở rộng đáng kể dung lượng cho Union Alpha vào sáng mai để khắc phục tình trạng giật lag. Đây là mô hình đa phương thức miễn phí với cửa sổ ngữ cảnh 256K, hỗ trợ gọi công cụ và tối ưu cho lập trình.
Union Alpha is the brand-new anonymous "stealth" multimodal model that dropped today on OpenRouter a…
DịchUnion Alpha, mô hình đa phương thức tập trung vào lập trình và tác vụ thông minh, vừa ra mắt miễn phí trên OpenRouter. Điểm nổi bật là khả năng tối ưu hóa token vượt trội, chỉ tiêu tốn 1/3 dung lượng so với Ox Alpha trong các tác vụ render 3D.
LynnReal-Omni là mô hình khuếch tán Transformer 32B đa năng, tích hợp toàn diện các tác vụ từ tạo video, chỉnh sửa, điều khiển cấu trúc đến phục hồi và sản xuất video dài.
Ant Group và inclusionAI vừa mã nguồn mở Ling-3.0-flash-VL, mô hình MoE 124B với khả năng xử lý thị giác chuyên sâu, tối ưu cho các tác vụ điều khiển giao diện, lập trình front-end và y tế.
Ant Group công bố Ling-3.0-flash-VL, mô hình đa phương thức 124B tham số với kiến trúc MoE, hỗ trợ xử lý hình ảnh, văn bản và video. Điểm đột phá nằm ở cơ chế phản hồi thị giác khép kín giúp mô hình tự quan sát, hành động và hiệu chỉnh chính xác hơn.
Ant Group vừa công bố Ling-3.0-flash-VL, mô hình đa phương thức mã nguồn mở với kiến trúc MoE 124B, hỗ trợ xử lý hình ảnh, văn bản và video cùng cửa sổ ngữ cảnh 256K token.
Nghiên cứu mới về S-Space tiết lộ cách các mô hình đa phương thức xây dựng 'bản đồ không gian' nội tại để hiểu vị trí và tương tác vật thể, dù vẫn còn hạn chế trong việc xoay chuyển góc nhìn.
Vì sao đáng đọc: Bài viết đi sâu vào cơ chế cốt lõi của các mô hình AI thế hệ mới, giải thích hiện tượng 'trí tuệ không gian' bằng góc nhìn kỹ thuật nhưng vẫn dễ hiểu, rất giá trị với người làm AI.
Today, we are releasing Ling-3.0-flash-VL, built on Ling-3.0-flash with visual understanding and vis…
DịchAnt Group vừa giới thiệu phiên bản Ling-3.0-flash-VL, bổ sung năng lực hiểu hình ảnh và vận hành AI Agent dựa trên nền tảng Ling-3.0-flash hiện có.
Puffin-World là kiến trúc đa phương thức thống nhất giúp hiểu vật lý, mô phỏng không gian và tái tạo thế giới 3D mà không cần module ngoại vi. Mô hình này tích hợp đồng thời dữ liệu vật lý, hình học và hình ảnh để tạo ra các khung hình tương lai cùng cấu trúc 3D chính xác.
Nghiên cứu giới thiệu CORE, kỹ thuật sử dụng mô hình đa phương thức làm bộ sắp xếp lại (reranker) để chưng cất khả năng suy luận kết hợp vào các mô hình nhúng thông qua mục tiêu Rank-KL và danh sách ứng viên tổng hợp.
MNIST-PRO là benchmark mới yêu cầu AI phải quan sát từng phần của hình ảnh để nhận diện chữ số, giúp đánh giá khả năng ghi nhớ và xây dựng trạng thái nhận thức của các mô hình đa phương thức.
Baidu Cloud giới thiệu thiết bị tích hợp AI sử dụng mô hình đa phương thức 40B, kết hợp quy trình kiểm tra hai lớp để đạt độ chính xác trên 95% trong việc phát hiện sự cố giao thông.
Bản tin tổng hợp 10 sự kiện AI nổi bật, tiêu biểu là sự xuất hiện của mô hình đa phương thức GLM-5.3-Flash từ Zhipu với hiệu suất tối ưu và các cập nhật về tiêu chuẩn MHS của Anthropic.
Zhipu vừa phát hành GLM-5.3-Flash, mô hình đa phương thức đầu tiên trong dòng GLM-5 với hiệu suất ngang ngửa Claude Opus 4.8 nhưng giá thành chỉ bằng 1/40, đồng thời đánh dấu bước tiến lớn khi vận hành trên hạ tầng chip nội địa.
Diễn biến sự kiện · 14 bài →Thêm 19 nguồn khác đưa tinX: SiliconFlow (@SiliconFlowAI)X: Rohan Paul (@rohanpaul_ai)X: Hongming (@hongming731)X: X.PIN (@thexpin)PandailyWeChat: Baidu AI Cloud (ERNIE)IT HomeThe Decoder: AI NewsWeChat: KhazixMarkTechPostHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Elvis Saravia (@omarsar0, DAIR.AI)X: Kim (@kimmonismus)X: OpenRouter (@OpenRouter)WeChat: Zhipu AI (GLM)X: Zhipu AI Z.ai (@Zai_org)TechNode
Vì sao đáng đọc: Đây là bước tiến quan trọng về tối ưu hóa chi phí và khả năng tự chủ hạ tầng tính toán cho mô hình AI quy mô lớn, có tính ứng dụng thực tiễn cao cho doanh nghiệp.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
V-Rubrics cải thiện độ chính xác của mô hình thị giác-ngôn ngữ bằng cách phân tách câu trả lời thành các mệnh đề nguyên tử và chấm điểm dựa trên độ trung thực, tính nhất quán và khả năng tuân thủ chỉ dẫn, giúp mô hình suy luận tốt hơn thông qua phương pháp GRPO.
Zhipu AI vừa trình làng GLM-5.3-Flash, chính là mô hình ẩn danh OX Alpha từng gây sốt. Đây là mô hình đa phương thức gốc với kiến trúc MoE 320B, hỗ trợ xử lý hình ảnh, video và văn bản với cửa sổ ngữ cảnh lên tới 1 triệu token.
WeChat vừa mã nguồn mở mô hình WeMM-Embedding, đạt đỉnh bảng xếp hạng MMEB với khả năng xử lý linh hoạt văn bản, hình ảnh và video dài. Mô hình giúp giảm đáng kể chi phí lưu trữ vector nhờ khả năng duy trì 99% hiệu suất ngay cả khi nén xuống 256 chiều.
ZHIPU AI 🔥: GLM-5.3-Flash (Ox Alpha) has been officially announced! > GLM-5.3-Flash is a 320B-A18B…
DịchZhipu AI chính thức phát hành GLM-5.3-Flash (trước đây là Ox Alpha), mô hình đa phương thức 320B-A18B theo giấy phép MIT, hứa hẹn hiệu năng cạnh tranh mạnh mẽ với Gemini 3.7 Flash.
Zhipu giới thiệu GLM-5.3-Flash, mô hình đa phương thức 320B với 18B tham số kích hoạt, đạt hiệu suất tương đương Claude Opus 4.8 nhưng có mức giá chỉ bằng 1/40.
Alibaba released Qwen3.8 Flash, a new multimodal 125B-parameter MoE model. > 262K native context, …
DịchAlibaba trình làng Qwen3.8 Flash, mô hình MoE 125B hỗ trợ ngữ cảnh 262K (mở rộng tới 1M) với hiệu suất vượt trội trên các bài kiểm tra lập trình chuyên sâu, đánh dấu bước tiến quan trọng trước khi ra mắt kiến trúc Qwen4.
Khung huấn luyện IVT giúp mô hình đa phương thức nội hóa tư duy thị giác, cho phép suy luận video trực tiếp bằng văn bản mà không cần tạo ảnh trung gian, giúp tối ưu hóa hiệu suất đáng kể.
What does it take for an AI to stay useful when a task lasts for hours-or weeks-and the world keeps …
Dịchdots3-note là mô hình đa phương thức với 280B tham số, hỗ trợ cửa sổ ngữ cảnh 512K, được thiết kế để tự đánh giá và thích nghi với các tác vụ thực tế kéo dài hàng tuần.
SenseTime vừa công bố mã nguồn mở SenseNova U1.5 Lite, mô hình 8 tỷ tham số tích hợp khả năng hiểu, tạo và chỉnh sửa hình ảnh với độ phân giải 4K, tối ưu hóa việc kiểm soát bố cục và chi tiết hình ảnh.
SenseNova U1.5 Lite là mô hình 8B tham số hỗ trợ độ phân giải 4K và khả năng điều khiển hình ảnh tinh vi, mang lại hiệu suất vượt trội trong việc xử lý văn bản và bố cục phức tạp.
MoE-ViE tối ưu hóa khả năng hiểu hình ảnh và video bằng kiến trúc chuyên gia hỗn hợp (MoE), đạt hiệu suất vượt trội với độ trễ thấp hơn 24% so với các mô hình cùng kích thước, thiết lập chuẩn mực mới cho các mô hình đa phương thức.
Nghiên cứu đề xuất hạ tầng dữ liệu mới giúp tối ưu hóa khả năng tạo ảnh thông qua việc kết hợp giám sát chuyên biệt và lập lịch học tập, tạo ra kho dữ liệu khổng lồ để huấn luyện các mô hình khuếch tán đa phương thức từ con số không.
Anthropic ra mắt Claude Tag giúp phản hồi sự cố CI/CD chỉ trong 14 phút, trong khi ByteDance trình làng mô hình đa phương thức DME đạt hiệu suất SOTA với độ trễ cực thấp.
PRISM là khung làm việc mới giúp các mô hình âm thanh-văn bản xử lý nhiễu nặng mà không cần huấn luyện lại, bằng cách loại bỏ biến dạng trong không gian tiềm ẩn dựa trên các điểm neo hình học.