26/09

Thứ Bảy · 1 tin
opencode@opencode
Mô hìnhĐiểm AI 44/100

Cùng sự kiệnMô hình LongCat-2.5-Preview hỗ trợ 1M context và đa phương thức miễn phí trên OpenCode

LongCat-2.5-Preview is now free on OpenCode for two weeks - 1M Context - Multi-modal - Zero Data Re…

DịchLongCat-2.5-Preview hiện đã có mặt trên nền tảng OpenCode, cho phép người dùng trải nghiệm miễn phí trong hai tuần với khả năng xử lý 1 triệu token context và tính năng đa phương thức.

Cùng sự kiện, bài đại diện «Meituan ra mắt LongCat-2.5-Preview: 1.6T tham số, cửa sổ ngữ cảnh 1M token và đa phương thức gốc»

22/09

Thứ Ba · 1 tin

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnMintAct: Tác nhân thị giác hợp nhất cho mọi môi trường kỹ thuật số

MintAct là dòng mô hình ngôn ngữ-thị giác đa quy mô, có khả năng điều hướng và sử dụng công cụ trên cả di động, máy tính và web với hiệu suất tương đương các chuyên gia riêng biệt.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc tạo ra tác nhân AI đa năng, giải quyết bài toán khó về tính đồng nhất giữa các nền tảng khác nhau với hạ tầng RL quy mô lớn.

20/09

Chủ Nhật · 1 tin
Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 62/100

Cùng sự kiệnAlibaba ra mắt Qwen-Image-2.1: Mô hình tạo và chỉnh sửa ảnh tích hợp, hỗ trợ vLLM-Omni ngay từ ngày đầu

Thanks @vllm_project for the day-0 support! 🙌 Generate, edit, transparent output - one model, ready…

DịchQwen-Image-2.1 kết hợp kiến trúc 7.1B DiT và Qwen3-VL-8B, cho phép tạo, chỉnh sửa và xuất ảnh trong suốt trong cùng một mô hình. Người dùng có thể triển khai ngay với sự hỗ trợ từ vLLM-Omni.

Cùng sự kiện, tinh chọn hiển thị «Alibaba ra mắt Qwen-Image-2.1: Mô hình 7B tích hợp tạo và chỉnh sửa ảnh trong một checkpoint»

18/09

Thứ Sáu · 2 tin
Alibaba Cloud@alibaba_cloud
Mô hìnhĐiểm AI 70/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-Omni-Flash: Mô hình toàn năng đầu tiên tối ưu cho AI Agent

🚀 Meet Qwen3.8-Omni-Flash, Qwen's first omni-modal model built around agentic capabilities! Native…

DịchAlibaba Cloud vừa giới thiệu Qwen3.8-Omni-Flash, mô hình toàn năng đầu tiên được thiết kế chuyên biệt cho AI Agent, tích hợp khả năng hiểu âm thanh, video, suy luận logic và điều khiển công cụ trong một hệ thống duy nhất.

Cùng sự kiện, bài đại diện «Thông Nghĩa Thiên Vấn ra mắt Qwen3.8-Omni-Flash: Mô hình toàn năng tập trung vào tác tử AI»
Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 72/100

Thông Nghĩa Thiên Vấn ra mắt Qwen3.8-Omni-Flash: Mô hình toàn năng tập trung vào tác tử AI

🚀 Meet Qwen3.8-Omni-Flash, Qwen's first omni-modal model built around agentic capabilities! Native…

DịchAlibaba vừa giới thiệu Qwen3.8-Omni-Flash, mô hình toàn năng đầu tiên của dòng Qwen được tối ưu hóa cho khả năng tác tử (agent), hỗ trợ xử lý âm thanh, video, suy luận và sử dụng công cụ trực tiếp.

Diễn biến sự kiện · 11 bài →Thêm 9 nguồn khác đưa tinThe Decoder: AI NewsX: Testing Catalog (@testingcatalog)PandailyTechNodeMarkTechPostHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Alibaba Cloud (@alibaba_cloud)IT HomeX: karminski (@karminski3)

17/09

Thứ Năm · 4 tin
JiQiZhiXin
Mô hìnhĐiểm AI 92/100

Tinh chọnZDTaichu 5.0-9B: Mô hình mã nguồn mở 9B mạnh nhất cho trí tuệ nhân tạo hiện thân

ZDTaichu 5.0-9B thiết lập tiêu chuẩn mới cho các mô hình dưới 10B, dẫn đầu 8/9 bảng xếp hạng về trí tuệ nhân tạo không gian và vượt mặt nhiều đối thủ lớn nhờ công nghệ suy luận vòng lặp thích ứng.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực mô hình nhỏ (SLM) với khả năng ứng dụng thực tế cao trong robot và AI hiện thân, đồng thời cung cấp lộ trình kỹ thuật minh bạch.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 39/100

PANORAMA: Mô hình VLM đột phá trong việc định vị và mô tả toàn cảnh hình ảnh

PANORAMA là mô hình VLM mới giúp định vị và mô tả chi tiết cả vật thể lẫn bối cảnh ở cấp độ pixel. Nghiên cứu còn giới thiệu bộ dữ liệu PanoCaps và các chỉ số đánh giá mới, thiết lập tiêu chuẩn hiệu năng vượt trội trong các tác vụ thị giác máy tính.

OpenRouter@OpenRouter
Sản phẩmĐiểm AI 39/100

OpenRouter nâng cấp hạ tầng cho mô hình Union Alpha

Significantly more capacity for Union Alpha is coming online tomorrow morning Thanks for bearing wi…

DịchOpenRouter thông báo mở rộng đáng kể dung lượng cho Union Alpha vào sáng mai để khắc phục tình trạng giật lag. Đây là mô hình đa phương thức miễn phí với cửa sổ ngữ cảnh 256K, hỗ trợ gọi công cụ và tối ưu cho lập trình.

Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 48/100

Cùng sự kiệnMô hình đa phương thức ẩn danh Union Alpha ra mắt trên OpenRouter

Union Alpha is the brand-new anonymous "stealth" multimodal model that dropped today on OpenRouter a…

DịchUnion Alpha, mô hình đa phương thức tập trung vào lập trình và tác vụ thông minh, vừa ra mắt miễn phí trên OpenRouter. Điểm nổi bật là khả năng tối ưu hóa token vượt trội, chỉ tiêu tốn 1/3 dung lượng so với Ox Alpha trong các tác vụ render 3D.

Cùng sự kiện, bài đại diện «OpenRouter ra mắt Union Alpha: Mô hình ẩn danh đa năng cho lập trình và nghiên cứu»

15/09

Thứ Ba · 1 tin

10/09

Thứ Năm · 2 tin
Pandaily
Mô hìnhĐiểm AI 85/100

Ant Group ra mắt mô hình đa phương thức Ling-3.0-flash-VL với khả năng phản hồi thị giác

Ant Group và inclusionAI vừa mã nguồn mở Ling-3.0-flash-VL, mô hình MoE 124B với khả năng xử lý thị giác chuyên sâu, tối ưu cho các tác vụ điều khiển giao diện, lập trình front-end và y tế.

Thêm 1 nguồn khác đưa tinX: Ant Ling (@AntLingAGI)

09/09

Thứ Tư · 3 tin
IT Home
Mô hìnhĐiểm AI 62/100

Cùng sự kiệnAnt Group ra mắt Ling-3.0-flash-VL: Mô hình đa phương thức mã nguồn mở với cơ chế phản hồi thị giác

Ant Group công bố Ling-3.0-flash-VL, mô hình đa phương thức 124B tham số với kiến trúc MoE, hỗ trợ xử lý hình ảnh, văn bản và video. Điểm đột phá nằm ở cơ chế phản hồi thị giác khép kín giúp mô hình tự quan sát, hành động và hiệu chỉnh chính xác hơn.

Cùng sự kiện, bài đại diện «Ant Group ra mắt Ling-3.0-flash-VL: Mô hình đa phương thức mã nguồn mở mạnh mẽ»
JiQiZhiXin
Mô hìnhĐiểm AI 88/100

Tinh chọnGiải mã 'trí tuệ không gian' trong GPT-6 Astra: Bí ẩn đằng sau khả năng dựng mô hình 3D

Nghiên cứu mới về S-Space tiết lộ cách các mô hình đa phương thức xây dựng 'bản đồ không gian' nội tại để hiểu vị trí và tương tác vật thể, dù vẫn còn hạn chế trong việc xoay chuyển góc nhìn.


Vì sao đáng đọc: Bài viết đi sâu vào cơ chế cốt lõi của các mô hình AI thế hệ mới, giải thích hiện tượng 'trí tuệ không gian' bằng góc nhìn kỹ thuật nhưng vẫn dễ hiểu, rất giá trị với người làm AI.

05/09

Thứ Bảy · 1 tin

04/09

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 41/100

Puffin-World: Mô hình thế giới đa phương thức đột phá cho không gian 3D

Puffin-World là kiến trúc đa phương thức thống nhất giúp hiểu vật lý, mô phỏng không gian và tái tạo thế giới 3D mà không cần module ngoại vi. Mô hình này tích hợp đồng thời dữ liệu vật lý, hình học và hình ảnh để tạo ra các khung hình tương lai cùng cấu trúc 3D chính xác.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

CORE: Phương pháp chưng cất mô hình đa phương thức giúp tối ưu hóa khả năng suy luận kết hợp cho mô hình nhúng

Nghiên cứu giới thiệu CORE, kỹ thuật sử dụng mô hình đa phương thức làm bộ sắp xếp lại (reranker) để chưng cất khả năng suy luận kết hợp vào các mô hình nhúng thông qua mục tiêu Rank-KL và danh sách ứng viên tổng hợp.

01/09

Thứ Ba · 1 tin

28/08

Thứ Sáu · 2 tin

27/08

Thứ Năm · 3 tin
Zhipu AI: Nghiên cứu (Dữ liệu nhúng trên web)
Mô hìnhĐiểm AI 74/100

Tinh chọnZhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp

Zhipu vừa phát hành GLM-5.3-Flash, mô hình đa phương thức đầu tiên trong dòng GLM-5 với hiệu suất ngang ngửa Claude Opus 4.8 nhưng giá thành chỉ bằng 1/40, đồng thời đánh dấu bước tiến lớn khi vận hành trên hạ tầng chip nội địa.

Diễn biến sự kiện · 14 bài →Thêm 19 nguồn khác đưa tinX: SiliconFlow (@SiliconFlowAI)X: Rohan Paul (@rohanpaul_ai)X: Hongming (@hongming731)X: X.PIN (@thexpin)PandailyWeChat: Baidu AI Cloud (ERNIE)IT HomeThe Decoder: AI NewsWeChat: KhazixMarkTechPostHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Elvis Saravia (@omarsar0, DAIR.AI)X: Kim (@kimmonismus)X: OpenRouter (@OpenRouter)WeChat: Zhipu AI (GLM)X: Zhipu AI Z.ai (@Zai_org)TechNode

Vì sao đáng đọc: Đây là bước tiến quan trọng về tối ưu hóa chi phí và khả năng tự chủ hạ tầng tính toán cho mô hình AI quy mô lớn, có tính ứng dụng thực tiễn cao cho doanh nghiệp.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 56/100

V-Rubrics: Tối ưu hóa độ trung thực thị giác cho mô hình đa phương thức bằng học tăng cường

V-Rubrics cải thiện độ chính xác của mô hình thị giác-ngôn ngữ bằng cách phân tách câu trả lời thành các mệnh đề nguyên tử và chấm điểm dựa trên độ trung thực, tính nhất quán và khả năng tuân thủ chỉ dẫn, giúp mô hình suy luận tốt hơn thông qua phương pháp GRPO.

WeChat: Khazix
Mô hìnhĐiểm AI 78/100

Cùng sự kiệnZhipu AI ra mắt GLM-5.3-Flash: 'Siêu phẩm' ẩn danh OX Alpha chính thức lộ diện

Zhipu AI vừa trình làng GLM-5.3-Flash, chính là mô hình ẩn danh OX Alpha từng gây sốt. Đây là mô hình đa phương thức gốc với kiến trúc MoE 320B, hỗ trợ xử lý hình ảnh, video và văn bản với cửa sổ ngữ cảnh lên tới 1 triệu token.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»

26/08

Thứ Tư · 4 tin
AI Notes@AYi_AInotes
Mô hìnhĐiểm AI 47/100

WeChat công bố mô hình nhúng đa phương thức WeMM-Embedding: Hiệu suất vượt trội, tối ưu chi phí lưu trữ

WeChat vừa mã nguồn mở mô hình WeMM-Embedding, đạt đỉnh bảng xếp hạng MMEB với khả năng xử lý linh hoạt văn bản, hình ảnh và video dài. Mô hình giúp giảm đáng kể chi phí lưu trữ vector nhờ khả năng duy trì 99% hiệu suất ngay cả khi nén xuống 256 chiều.

Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 55/100

Cùng sự kiệnZhipu AI ra mắt mô hình đa phương thức mã nguồn mở GLM-5.3-Flash

ZHIPU AI 🔥: GLM-5.3-Flash (Ox Alpha) has been officially announced! > GLM-5.3-Flash is a 320B-A18B…

DịchZhipu AI chính thức phát hành GLM-5.3-Flash (trước đây là Ox Alpha), mô hình đa phương thức 320B-A18B theo giấy phép MIT, hứa hẹn hiệu năng cạnh tranh mạnh mẽ với Gemini 3.7 Flash.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»
IT Home
Mô hìnhĐiểm AI 76/100

Cùng sự kiệnZhipu ra mắt mô hình đa phương thức GLM-5.3-Flash: Hiệu năng ngang ngửa Claude Opus với giá siêu rẻ

Zhipu giới thiệu GLM-5.3-Flash, mô hình đa phương thức 320B với 18B tham số kích hoạt, đạt hiệu suất tương đương Claude Opus 4.8 nhưng có mức giá chỉ bằng 1/40.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8 Flash: Mô hình đa phương thức MoE 125B mạnh mẽ

Alibaba released Qwen3.8 Flash, a new multimodal 125B-parameter MoE model. > 262K native context, …

DịchAlibaba trình làng Qwen3.8 Flash, mô hình MoE 125B hỗ trợ ngữ cảnh 262K (mở rộng tới 1M) với hiệu suất vượt trội trên các bài kiểm tra lập trình chuyên sâu, đánh dấu bước tiến quan trọng trước khi ra mắt kiến trúc Qwen4.

Cùng sự kiện, tinh chọn hiển thị «Alibaba ra mắt Qwen3.8-Flash: Mô hình MoE hiệu năng cao, hé lộ kiến trúc Qwen4»

24/08

Thứ Hai · 2 tin
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 52/100

Ra mắt dots3-note: Mô hình đa phương thức mã nguồn mở cho các tác vụ dài hạn

What does it take for an AI to stay useful when a task lasts for hours-or weeks-and the world keeps …

Dịchdots3-note là mô hình đa phương thức với 280B tham số, hỗ trợ cửa sổ ngữ cảnh 512K, được thiết kế để tự đánh giá và thích nghi với các tác vụ thực tế kéo dài hàng tuần.

21/08

Thứ Sáu · 2 tin

19/08

Thứ Tư · 3 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

MoE-ViE: Bước tiến mới cho bộ mã hóa thị giác hiệu suất cao

MoE-ViE tối ưu hóa khả năng hiểu hình ảnh và video bằng kiến trúc chuyên gia hỗn hợp (MoE), đạt hiệu suất vượt trội với độ trễ thấp hơn 24% so với các mô hình cùng kích thước, thiết lập chuẩn mực mới cho các mô hình đa phương thức.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

Thiết kế dữ liệu tập trung vào năng lực cho mô hình tạo ảnh đa năng: Từ kho ngữ liệu đến sự tiến hóa cộng hưởng

Nghiên cứu đề xuất hạ tầng dữ liệu mới giúp tối ưu hóa khả năng tạo ảnh thông qua việc kết hợp giám sát chuyên biệt và lập lịch học tập, tạo ra kho dữ liệu khổng lồ để huấn luyện các mô hình khuếch tán đa phương thức từ con số không.

18/08

Thứ Ba · 1 tin
Tổng 37 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (58 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Mô hình đa phương thức” | AIHOT.vn