04/09

Thứ Sáu · 6 tin

03/09

Thứ Năm · 7 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

NeoMME: Bộ mã hóa đa phương thức đa ngôn ngữ tối ưu cho suy luận và tinh chỉnh

NeoMME là kiến trúc bộ mã hóa Transformer hai chiều nhỏ gọn, hỗ trợ đa ngôn ngữ và hình ảnh, giúp tối ưu hóa hiệu suất cho các tác vụ truy xuất tài liệu mà không cần dùng đến các mô hình ngôn ngữ tạo sinh cồng kềnh.

Thêm 1 nguồn khác đưa tinHugging Face: Blog
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnEASE: Khi mô hình AI trả lời đúng nhưng 'nhìn nhầm' ảnh - Giải pháp từ Đại học Công nghệ Cáp Nhĩ Tân

Nghiên cứu giới thiệu EASE, phương pháp giúp mô hình đa phương thức không chỉ trả lời đúng mà còn phải 'nhìn' đúng vào vùng dữ liệu bằng chứng trên ảnh, giúp cải thiện đáng kể độ tin cậy của các mô hình VLM.


Vì sao đáng đọc: Giải quyết vấn đề cốt lõi trong suy luận đa phương thức (VLM) là 'đoán mò' thay vì hiểu ảnh. Phương pháp thực tiễn, có số liệu kiểm chứng rõ ràng trên các mô hình Qwen.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

KBMR: Bước tiến mới trong truy vấn hình ảnh dựa trên tri thức nhờ mô hình ngôn ngữ đa phương thức

KBMR giải quyết hạn chế của các mô hình CLIP truyền thống bằng cách sử dụng MLLM để ánh xạ hình ảnh vào không gian ngữ nghĩa, giúp nhận diện thực thể chính xác hơn trong các tác vụ VQA đòi hỏi kiến thức chuyên sâu.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Giải mã nguyên lý thiết kế mô hình học biểu diễn văn bản từ điểm ảnh (Pixel)

Nghiên cứu này xác định bốn yếu tố then chốt để tối ưu hóa khả năng đọc và hiểu văn bản trực tiếp từ điểm ảnh, giúp khắc phục các hạn chế về độ phân giải và khả năng đa ngôn ngữ của các mô hình hiện nay.

02/09

Thứ Tư · 5 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnQwen-Drive-1.0: Bước tiến mới của mô hình ngôn ngữ thị giác trong xe tự lái

Qwen-Drive-1.0 tích hợp khả năng nhận diện 3D, trả lời câu hỏi thị giác và lập kế hoạch di chuyển vào một khung mô hình ngôn ngữ thị giác thống nhất, giúp xe tự lái hiểu môi trường và dự đoán quỹ đạo chính xác hơn.


Vì sao đáng đọc: Đây là bước tiến quan trọng khi ứng dụng VLM vào xe tự lái, kết hợp giữa hiểu biết thị giác tổng quát và các tác vụ chuyên biệt như lập kế hoạch di chuyển.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnZimaBlue: Bước tiến mới trong huấn luyện mô hình hành động robot từ video quy mô lớn

ZimaBlue là khung huấn luyện đột phá giúp robot học cách điều khiển thông qua việc quan sát video thực tế thay vì chỉ dựa vào dữ liệu hành động đắt đỏ, giúp tăng khả năng thích nghi trong môi trường đa dạng.


Vì sao đáng đọc: Giải quyết bài toán hóc búa về dữ liệu trong robot học. Phương pháp tận dụng video egocentric để huấn luyện mô hình hành động có tính ứng dụng thực tiễn rất cao.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Nghiên cứu cơ chế phối hợp giữa hiểu và tạo trong mô hình đa phương thức nguyên bản

Nghiên cứu chỉ ra rằng việc tách biệt nhiệm vụ giúp tránh sự suy giảm hiệu năng khi mô hình đa phương thức vừa hiểu vừa tạo ảnh, đồng thời khẳng định mô hình end-to-end vượt trội hơn so với các hệ thống phân tách truyền thống.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 33/100

ReFlowSET: Khung khớp luồng không gian ẩn giúp chuyển đổi ảnh SAR sang EO hiệu quả

KAIST-VICLab giới thiệu ReFlowSET, khung khớp luồng không gian ẩn giúp tối ưu hóa việc chuyển đổi ảnh SAR sang quang học (EO) bằng cách căn chỉnh đặc trưng mà không làm tăng chi phí suy luận. Phương pháp này đạt kết quả SOTA trên các tập dữ liệu chuẩn và đã công khai mã nguồn.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

DroneCATS: Đánh giá mô hình đa phương thức làm tác nhân điều khiển drone thông minh

Nghiên cứu giới thiệu kiến trúc DroneCATS, tích hợp trực tiếp mô hình đa phương thức vào hệ thống điều khiển drone để thực hiện các nhiệm vụ phức tạp như bám đuổi và tìm kiếm mà không cần tinh chỉnh. Kết quả cho thấy dù khả năng nhận diện không gian tốt, các mô hình vẫn gặp khó khăn trong việc duy trì giao thức hành động và xác định thời điểm kết thúc nhiệm vụ.

01/09

Thứ Ba · 8 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

DICS: Phương pháp chọn lọc dữ liệu huấn luyện VLM dựa trên tính nhất quán nội tại

Nghiên cứu giới thiệu chỉ số DIC giúp định lượng tính nhất quán giữa hình ảnh và phản hồi, từ đó tối ưu hóa quy trình chọn lọc dữ liệu cho các mô hình ngôn ngữ thị giác (VLM).

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

LightNav-0: Mô hình điều hướng robot đa năng khai phá trí tuệ không gian từ VLM

LightNav-0 là mô hình điều hướng robot nhỏ gọn, tận dụng trí tuệ không gian của VLM mà không cần bộ dự đoán chuyên biệt. Nó đạt hiệu suất SOTA trên 10 môi trường mô phỏng và thể hiện khả năng thích nghi linh hoạt trong thế giới thực.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Đột phá tìm kiếm ảnh: Từ khớp ảnh đơn lẻ đến xây dựng câu chuyện hình ảnh thông minh

Nghiên cứu giới thiệu mô hình Image Bundle Composition (IBC), cho phép AI tự động tổng hợp các bộ ảnh có liên kết logic thay vì chỉ tìm kiếm ảnh đơn lẻ, giúp phản ánh đúng ý định tìm kiếm phức tạp của người dùng.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 35/100

BLARM: Tạo hoạt ảnh 3D từ video đơn lẻ bằng cách kết hợp các thành phần chuyển động cứng

BLARM là phương pháp tiên phong cho phép tạo hoạt ảnh 3D từ video đơn lẻ và lưới vật thể tĩnh mà không cần khung xương hay gắn nhãn phức tạp. Công nghệ này sử dụng các thành phần chuyển động cứng tiềm ẩn để tạo ra chuyển động mượt mà, ổn định và chính xác về mặt hình học.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

Lucida: Khung mô hình hóa cảnh quan từ thực tế sang mô phỏng thông qua phân tích, tạo và sắp xếp

Lucida là phương pháp mới giúp chuyển đổi cảnh nội thất thực tế thành các tài sản 3D có thể chỉnh sửa riêng biệt. Hệ thống sử dụng quy trình ba bước gồm phân tích, tạo tài sản và dùng VLM để tự động hóa việc sắp xếp vật thể trong môi trường mô phỏng.

JiQiZhiXin
NgànhĐiểm AI 75/100

ECCV 2026: Mời bạn tham gia đêm tiệc AI Talent Night cùng Huawei tại Thụy Điển

Máy Tính (Jiqizhixin) phối hợp cùng Huawei tổ chức đêm tiệc kết nối AI Talent Night trong khuôn khổ hội nghị ECCV 2026 tại Malmö, tạo không gian giao lưu chuyên sâu về công nghệ thị giác máy tính, mô hình thế giới và cơ hội nghề nghiệp cho các nhà nghiên cứu trẻ.

31/08

Thứ Hai · 9 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

GSSC: Bước tiến mới trong tái tạo bối cảnh 3D từ dữ liệu LiDAR thưa thớt

Nghiên cứu giới thiệu phương pháp GSSC sử dụng khuếch tán rời rạc để tái tạo bản đồ ngữ nghĩa 3D dày đặc từ dữ liệu LiDAR thưa thớt, giải quyết hiệu quả bài toán mất cân bằng dữ liệu nghiêm trọng trong môi trường ngoài trời.

IT Home
Mô hìnhĐiểm AI 76/100

Tinh chọnDeepSeek ra mắt mô hình đa phương thức mã nguồn mở V4-Flash-Vision-Exp, hiệu năng tiệm cận Opus-4.8

DeepSeek vừa phát hành mô hình đa phương thức đầu tiên DeepSeek-V4-Flash-Vision-Exp trên Hugging Face theo giấy phép MIT, cung cấp đầy đủ mã nguồn và tài liệu triển khai cho cộng đồng.

Diễn biến sự kiện · 1 bài →Thêm 1 nguồn khác đưa tinPandaily

Vì sao đáng đọc: Đây là bước tiến quan trọng của DeepSeek trong lĩnh vực đa phương thức, thu hút sự quan tâm lớn từ cộng đồng mã nguồn mở nhờ hiệu năng cạnh tranh với các mô hình hàng đầu.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

GGSS: Phương pháp điều hướng hình cầu giúp loại bỏ định kiến trong các mô hình thị giác - ngôn ngữ

GGSS là kỹ thuật can thiệp mới giúp loại bỏ định kiến về chủng tộc hoặc giới tính trong các mô hình VLM tạo sinh bằng cách điều chỉnh các token hình ảnh trên không gian hình cầu mà không làm mất đi đặc tính dữ liệu.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Định vị mọi thứ trong video: Giải pháp giải mã song song cho bài toán STVG hiệu quả

Nghiên cứu giới thiệu Parallel Tube Decoding (PTD), phương pháp giúp định vị đối tượng trong video nhanh chóng bằng cách giải mã song song thay vì tuần tự, loại bỏ độ trễ và lỗi tích lũy so với các mô hình ngôn ngữ đa phương thức hiện nay.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ABot-Recon: Tái định nghĩa bối cảnh cục bộ cho tái dựng 3D trực tuyến dài hạn

ABot-Recon là mô hình tái dựng 3D trực tuyến đột phá, chỉ sử dụng bộ nhớ đệm 11 khung hình gần nhất để duy trì độ ổn định mà không cần bộ nhớ dài hạn phức tạp, giúp tối ưu hóa tài nguyên tính toán cho các video cực dài.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnVLAct: Bước tiến mới trong huấn luyện mô hình Robot Vision-Language-Action

VLAct tối ưu hóa việc huấn luyện mô hình robot bằng cách tập trung vào chất lượng biểu diễn thay vì chỉ tăng quy mô dữ liệu, giúp chuyển đổi các quỹ đạo robot hạn chế thành kiến thức hành động có khả năng ứng dụng linh hoạt trên nhiều nền tảng khác nhau.


Vì sao đáng đọc: Nghiên cứu giải quyết bài toán hóc búa về dữ liệu robot, mang tính ứng dụng cao cho lĩnh vực AI thực thể (Embodied AI) và tối ưu hóa hiệu suất mô hình VLA.

30/08

Chủ Nhật · 2 tin

28/08

Thứ Sáu · 7 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

UrbanGround: Sandbox mô phỏng đô thị thực tế để kiểm thử trí tuệ nhân tạo không gian

UrbanGround là sandbox đầu tiên dựa trên dữ liệu 3D toàn cảnh Hong Kong, cho phép kiểm thử khả năng điều hướng và nhận thức của các mô hình MLLM trong môi trường đô thị thực tế. Kết quả cho thấy AI hiện nay vẫn gặp khó khăn trong việc duy trì định hướng và lập kế hoạch dài hạn.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnZero-WAM: Mô hình hóa hành động từ video người để robot thực hiện tác vụ mới

Zero-WAM là mô hình video-hành động cho phép robot thực hiện các tác vụ chưa từng học thông qua việc quan sát video hướng dẫn từ con người, giúp giải quyết bài toán tổng quát hóa trong điều khiển robot.


Vì sao đáng đọc: Đột phá trong việc ứng dụng học trong ngữ cảnh (ICL) vào robot học, giải quyết hiệu quả vấn đề thiếu hụt dữ liệu huấn luyện bằng cách tận dụng video con người.
AK@_akhaliq
Nghiên cứuĐiểm AI 30/100

VGI-Bench: Đánh giá toàn diện trí tuệ thị giác trong các mô hình tạo video

VGI-Bench Probing Visual Intelligence in Video Generation Models paper: https://huggingface.co/pap...

DịchVGI-Bench là bộ tiêu chuẩn mới giúp đo lường khả năng hiểu và xử lý hình ảnh của các mô hình tạo video hiện nay, cung cấp cái nhìn sâu sắc về trí tuệ thị giác trong AI.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

GUI-Primitives: Giải mã điểm yếu về tư duy không gian của các mô hình AI điều khiển giao diện

Nghiên cứu giới thiệu bộ dữ liệu GUI-Primitives nhằm kiểm tra khả năng hiểu các mối quan hệ không gian trong giao diện người dùng của các mô hình thị giác-ngôn ngữ, vốn đang gặp khó khăn lớn với độ chính xác dưới 32%.

27/08

Thứ Năm · 5 tin
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (41 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “thị giác máy tính” — Trang 4 | AIHOT.vn