24/09

Thứ Năm · 1 tin

21/09

Thứ Hai · 1 tin

18/09

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

VA-Bench: Bước tiến mới trong đánh giá trí tuệ không gian cho robot thông qua quan sát và hành động

VA-Bench là bộ tiêu chuẩn mới đánh giá khả năng 'quan sát-suy luận-hành động-điều chỉnh' của mô hình đa phương thức (MLLM) trong môi trường robot, nơi mô hình tự học từ video RGB và điều khiển hành động thực tế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

Vision-RL2: Tối ưu hóa chiến lược cấp vùng cho mô hình ngôn ngữ đa phương thức (MLLM)

Vision-RL2 sử dụng học tăng cường cấp vùng để tối ưu hóa mạng đề xuất khu vực trong MLLM mà không cần nhãn dữ liệu, giúp cải thiện độ chính xác vượt trội với số lượng token thị giác ít hơn gấp 4 lần.

16/09

Thứ Tư · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OmniHarness: Tối ưu hóa tạo ảnh đa năng thông qua học chính sách biểu tượng

OmniHarness là khung làm việc mới giúp cải thiện khả năng tạo ảnh đa năng bằng cách chuyển đổi các quy trình thực thi thành chính sách biểu tượng có thể tái sử dụng, giúp hệ thống tự học và thích nghi với các tác vụ mới hiệu quả hơn.

15/09

Thứ Ba · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 43/100

Không phải prompt nào cũng như nhau: Khung hướng dẫn khám phá cho hậu huấn luyện RL đa phương thức

Nghiên cứu giới thiệu khung 'Exploration-Guided Prompt Scaffolding' giúp tối ưu hóa hậu huấn luyện RL cho mô hình đa phương thức (MLLM) thông qua chỉ số EPS, giúp đánh giá tiềm năng khám phá mà không tốn thêm chi phí tính toán.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnReactHuman: Bộ tiêu chuẩn đánh giá khả năng phản xạ vật lý như con người cho robot AI

ReactHuman là bộ tiêu chuẩn đầu tiên đánh giá khả năng phản ứng tức thời của các mô hình đa phương thức (MLLM) trước các tình huống nguy hiểm trong môi trường gia đình, giúp robot đưa ra quyết định an toàn và chính xác hơn.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc đưa AI vào đời sống thực tế, giải quyết khoảng trống giữa hiểu biết vật lý lý thuyết và phản xạ an toàn trong robot học.

10/09

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

VDiff-Bench: Bộ tiêu chuẩn đánh giá khả năng nhận diện thay đổi chi tiết giữa hai hình ảnh

VDiff-Bench là bộ tiêu chuẩn mới gồm 1.756 câu hỏi trắc nghiệm, giúp kiểm tra khả năng phát hiện các thay đổi tinh vi giữa hai hình ảnh của các mô hình ngôn ngữ đa phương thức (MLLM) vốn thường gặp khó khăn trong tác vụ này.

07/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ShallowStream: Tối ưu hóa xử lý video trực tuyến bằng cách phân tầng độ sâu mô hình

ShallowStream là khung làm việc mới giúp giảm chi phí tính toán khi xử lý video trực tuyến bằng cách kết hợp xử lý nông (shallow) cho các khung hình đầu vào và chỉ đi sâu (deep) khi cần thiết, giúp tối ưu hóa bộ nhớ KV cache.

04/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 35/100

LatentStream: Bước tiến mới trong hiểu video trực tuyến với cơ chế bộ nhớ tiềm ẩn

LatentStream thay đổi cách xử lý video từ lưu trữ truyền thống sang nội hóa dữ liệu, giúp AI suy luận chính xác trong môi trường bộ nhớ hạn chế. Phương pháp này thiết lập chuẩn mực mới (SOTA) trên các bộ dữ liệu video trực tuyến và ngoại tuyến.

03/09

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

KBMR: Bước tiến mới trong truy vấn hình ảnh dựa trên tri thức nhờ mô hình ngôn ngữ đa phương thức

KBMR giải quyết hạn chế của các mô hình CLIP truyền thống bằng cách sử dụng MLLM để ánh xạ hình ảnh vào không gian ngữ nghĩa, giúp nhận diện thực thể chính xác hơn trong các tác vụ VQA đòi hỏi kiến thức chuyên sâu.

02/09

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

DroneCATS: Đánh giá mô hình đa phương thức làm tác nhân điều khiển drone thông minh

Nghiên cứu giới thiệu kiến trúc DroneCATS, tích hợp trực tiếp mô hình đa phương thức vào hệ thống điều khiển drone để thực hiện các nhiệm vụ phức tạp như bám đuổi và tìm kiếm mà không cần tinh chỉnh. Kết quả cho thấy dù khả năng nhận diện không gian tốt, các mô hình vẫn gặp khó khăn trong việc duy trì giao thức hành động và xác định thời điểm kết thúc nhiệm vụ.

31/08

Thứ Hai · 1 tin

28/08

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

UrbanGround: Sandbox mô phỏng đô thị thực tế để kiểm thử trí tuệ nhân tạo không gian

UrbanGround là sandbox đầu tiên dựa trên dữ liệu 3D toàn cảnh Hong Kong, cho phép kiểm thử khả năng điều hướng và nhận thức của các mô hình MLLM trong môi trường đô thị thực tế. Kết quả cho thấy AI hiện nay vẫn gặp khó khăn trong việc duy trì định hướng và lập kế hoạch dài hạn.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 66/100

Aphanta: Khung chẩn đoán tự động giúp tối ưu hóa chỉnh sửa ảnh bằng mô hình đa phương thức

Aphanta là khung chẩn đoán tự động giúp đánh giá và cải thiện hiệu quả của các công cụ chỉnh sửa ảnh trong quy trình suy luận đa phương thức, giúp tăng đáng kể độ chính xác của các tác vụ phức tạp.

27/08

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 48/100

Video-IFBench: Bộ tiêu chuẩn mới đánh giá khả năng tuân thủ chỉ dẫn của mô hình AI đa phương thức trong hiểu video

Video-IFBench là bộ tiêu chuẩn đánh giá chuyên sâu khả năng tuân thủ chỉ dẫn của các mô hình đa phương thức (MLLM) khi xử lý video, thông qua 1.500 mẫu thử nghiệm với độ phức tạp cao. Kết quả cho thấy các mô hình hiện nay vẫn gặp khó khăn lớn với các yêu cầu đa ràng buộc và cấu trúc phức tạp.

26/08

Thứ Tư · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OraRL: Tối ưu hóa học tăng cường hiệu quả cho mô hình ngôn ngữ đa phương thức video

Nghiên cứu giới thiệu OraRL, phương pháp mới tận dụng dữ liệu chú giải làm 'oracle rollout' để cải thiện hiệu suất học tăng cường cho mô hình MLLM video, giải quyết vấn đề đảo ngược lợi thế trong quá trình huấn luyện.

24/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Vượt xa độ chính xác: Đánh giá và căn chỉnh hành vi phản hồi của mô hình MLLM tư duy hỗn hợp

Nghiên cứu giới thiệu PatternEval, bộ tiêu chuẩn chẩn đoán mới nhằm đảm bảo tính nhất quán trong hành vi phản hồi giữa chế độ tư duy sâu và suy luận nhanh của các mô hình MLLM, giúp khắc phục các lỗi logic và định dạng thường gặp.

18/08

Thứ Ba · 1 tin

17/08

Thứ Hai · 2 tin

14/08

Thứ Sáu · 1 tin
Tổng 23 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (53 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “MLLM” | AIHOT.vn