Hôm qua · 27/09

Chủ Nhật · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnTừ Computer-Use đến Robot-Use: Show-Harness giúp VLM điều khiển trực tiếp robot thực tế

Show-Harness giới thiệu một bộ giao diện chuẩn hóa, cho phép các mô hình ngôn ngữ thị giác (VLM) điều khiển robot trong thế giới thực mà không cần tinh chỉnh phức tạp, thu hẹp khoảng cách giữa trí tuệ số và hành động vật lý.


Vì sao đáng đọc: Đề tài (Embodied AI) đang là xu hướng nóng. Bài báo cung cấp giải pháp thực tiễn, mã nguồn mở và dữ liệu đầy đủ, có giá trị cao cho cộng đồng nghiên cứu robot.

25/09

Thứ Sáu · 2 tin
IT Home
NgànhĐiểm AI 31/100

Mercedes-Maybach S-Class mới ra mắt: Tích hợp MB.OS và mô hình thế giới Momenta R7, giá từ 1,398 triệu NDT

Mercedes-Maybach S-Class thế hệ mới chính thức trình làng với hệ điều hành MB.OS và mô hình thế giới Momenta R7, hỗ trợ lái xe tự động từ vị trí đỗ đến vị trí đỗ. Đây là dòng xe sang chạy xăng đầu tiên ứng dụng mô hình VLM đa phương thức tại thiết bị.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

World Action Agent: Điều khiển robot thông qua VLM và kỹ thuật diễn tập hành động

World Action Agent (WAA) là khung đa tác nhân cho phép VLM điều khiển robot trực tiếp trong không gian làm việc thị giác, thông qua các tính năng như chế độ xem tiếp xúc, diễn tập hành động và hiệu chỉnh trực quan.

24/09

Thứ Năm · 4 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

X-Planner: Hệ thống lập kế hoạch tác vụ dựa trên cấu trúc sự kiện cho robot thông minh

X-Planner là giải pháp lập kế hoạch mới giúp robot hiểu rõ các bước trung gian trong tác vụ dài hạn, kết hợp dữ liệu đa nguồn và giao diện VLM để tối ưu hóa khả năng suy luận và xử lý lỗi thực tế.

Thêm 1 nguồn khác đưa tinX: X Square (@XSquareRobot)

23/09

Thứ Tư · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

RULER: Phương pháp đánh giá và tối ưu hóa mới cho việc tạo hình ảnh vector (SVG) bằng AI

RULER giải quyết vấn đề thiếu tiêu chuẩn đánh giá trong tạo mã SVG bằng cách sử dụng hệ thống chấm điểm đa tiêu chí dựa trên mô hình ngôn ngữ thị giác, giúp tối ưu hóa mô hình học tăng cường hiệu quả hơn so với các chỉ số truyền thống.

AK@_akhaliq
Nghiên cứuĐiểm AI 23/100

Đưa trí tuệ của VLM vào điều khiển robot

Transferring the Intelligence of VLMs to Robotic Control paper: https://huggingface.co/papers/2609....

DịchNghiên cứu mới đề xuất phương pháp tích hợp khả năng hiểu ngữ cảnh của các mô hình ngôn ngữ thị giác (VLM) vào hệ thống điều khiển robot, giúp robot thực hiện các tác vụ phức tạp linh hoạt hơn.

22/09

Thứ Ba · 1 tin

17/09

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 40/100

GPT-Policy: Đột phá học tập ngữ cảnh cho robot thông minh nhờ VLM

GPT-Policy là khung làm việc cho phép robot học tập trong ngữ cảnh mà không cần huấn luyện lại, tận dụng VLM để đề xuất hành động và bộ điều khiển để thực thi, giúp tối ưu hóa hiệu suất từ các video hướng dẫn của con người.

15/09

Thứ Ba · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

E2A-Bench: Đánh giá độ tin cậy từ bằng chứng đến hành động trong phân tích biểu đồ tài chính

E2A-Bench là bộ tiêu chuẩn mới giúp đánh giá khả năng suy luận và đưa ra quyết định dựa trên biểu đồ tài chính của các mô hình ngôn ngữ thị giác (VLM), tập trung vào tính nhất quán giữa bằng chứng và hành động thay vì chỉ kiểm tra lỗi ảo tưởng thông thường.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

ModaLens: Phương pháp kiểm định mới đánh giá độ phụ thuộc vào hình ảnh của mô hình VLM y tế

Nghiên cứu giới thiệu ModaLens, kỹ thuật thay thế hình ảnh theo cặp để đo lường mức độ ảnh hưởng của báo cáo chẩn đoán đến khả năng phân tích hình ảnh thực tế của các mô hình thị giác ngôn ngữ (VLM) trong y tế.

10/09

Thứ Năm · 3 tin
LlamaIndex: Sản phẩm, kỹ thuật và đánh giá
Hướng dẫnĐiểm AI 65/100

Tinh chọnLlamaIndex giới thiệu OCR thông minh: Giải pháp cân bằng chi phí và độ chính xác cho tài liệu

LlamaIndex đề xuất quy trình OCR hai bước: dùng công cụ miễn phí để quét sơ bộ, sau đó chỉ dùng mô hình thị giác (VLM) cho các trang quan trọng nhằm tối ưu chi phí và hiệu suất.


Vì sao đáng đọc: Giải pháp thực tế, giải quyết trực tiếp bài toán chi phí cao khi xử lý tài liệu bằng AI, rất hữu ích cho các kỹ sư và doanh nghiệp.

09/09

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 36/100

CoVeR: Phương pháp cắt tỉa token dựa trên độ phủ cho suy luận 3D đa góc nhìn trên VLM

CoVeR là bộ chọn token thị giác không cần huấn luyện, giúp tối ưu hóa suy luận 3D đa góc nhìn bằng cách loại bỏ token dư thừa. Chỉ với 8% lượng token, mô hình vẫn duy trì 93,5% hiệu suất, vượt qua các phương pháp hiện có tới 3,9 điểm phần trăm.

08/09

Thứ Ba · 1 tin

07/09

Thứ Hai · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnTFO: Biến mô hình thị giác-ngôn ngữ (VLM) thành hệ thống hiểu âm thanh mà không cần huấn luyện lại

TFO là giải pháp plug-and-play cho phép tích hợp khả năng hiểu âm thanh vào các mô hình VLM đóng băng mà không cần thay đổi kiến trúc hay huấn luyện lại, giúp bảo toàn nguyên vẹn năng lực suy luận thị giác ban đầu.


Vì sao đáng đọc: Giải pháp đột phá giúp tiết kiệm chi phí tính toán đáng kể khi tích hợp đa phương thức, giải quyết trực tiếp vấn đề 'quên lãng' năng lực cũ của các mô hình VLM hiện nay.

05/09

Thứ Bảy · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnMeta công bố HumanCLAW: Đưa mô hình nền tảng vào tầng quyết định của robot

HumanCLAW tách biệt việc ra quyết định cấp cao và điều khiển vận động, giúp đánh giá chính xác khả năng 'trí tuệ hành động' của các mô hình ngôn ngữ thị giác (VLM) trong môi trường vật lý thực tế.


Vì sao đáng đọc: Đề tài đột phá về (Embodied AI), giải quyết bài toán hóc búa trong việc tách biệt tư duy và hành động của robot, có mã nguồn mở và tính ứng dụng cao.

04/09

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

WorldReward: Phương pháp đánh giá mô hình thế giới dựa trên VLM cho video AI

WorldReward là mô hình phần thưởng dựa trên VLM giúp đánh giá đồng bộ tính nhất quán của hành động và chất lượng hình ảnh trong các mô hình thế giới. Phương pháp này vượt trội hơn GPT-4o trong các bài kiểm tra thực tế, hỗ trợ tối ưu hóa hiệu quả cho quá trình huấn luyện RL.

03/09

Thứ Năm · 2 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnEASE: Khi mô hình AI trả lời đúng nhưng 'nhìn nhầm' ảnh - Giải pháp từ Đại học Công nghệ Cáp Nhĩ Tân

Nghiên cứu giới thiệu EASE, phương pháp giúp mô hình đa phương thức không chỉ trả lời đúng mà còn phải 'nhìn' đúng vào vùng dữ liệu bằng chứng trên ảnh, giúp cải thiện đáng kể độ tin cậy của các mô hình VLM.


Vì sao đáng đọc: Giải quyết vấn đề cốt lõi trong suy luận đa phương thức (VLM) là 'đoán mò' thay vì hiểu ảnh. Phương pháp thực tiễn, có số liệu kiểm chứng rõ ràng trên các mô hình Qwen.

02/09

Thứ Tư · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Học cách suy luận hình học đa phương thức thông qua cơ chế phân bổ tín dụng

Nghiên cứu giới thiệu phương pháp suy luận mới giúp mô hình VLM xác định chính xác các bước logic quan trọng trong bài toán hình học, từ đó tối ưu hóa việc học thông qua mã thực thi và phân bổ tín dụng cục bộ thay vì chỉ dựa vào kết quả cuối cùng.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnQwen-Drive-1.0: Bước tiến mới của mô hình ngôn ngữ thị giác trong xe tự lái

Qwen-Drive-1.0 tích hợp khả năng nhận diện 3D, trả lời câu hỏi thị giác và lập kế hoạch di chuyển vào một khung mô hình ngôn ngữ thị giác thống nhất, giúp xe tự lái hiểu môi trường và dự đoán quỹ đạo chính xác hơn.


Vì sao đáng đọc: Đây là bước tiến quan trọng khi ứng dụng VLM vào xe tự lái, kết hợp giữa hiểu biết thị giác tổng quát và các tác vụ chuyên biệt như lập kế hoạch di chuyển.

01/09

Thứ Ba · 5 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

WebWorld: Biến trình duyệt thành mô hình thế giới để tự cải thiện khả năng tạo mã web

WebWorld sử dụng trình duyệt như một môi trường mô phỏng để VLM tự kiểm chứng và tối ưu hóa mã nguồn. Hệ thống chỉ chấp nhận các đoạn mã đạt chuẩn, tạo ra dữ liệu chất lượng cao để tinh chỉnh mô hình một cách tự động.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

DICS: Phương pháp chọn lọc dữ liệu huấn luyện VLM dựa trên tính nhất quán nội tại

Nghiên cứu giới thiệu chỉ số DIC giúp định lượng tính nhất quán giữa hình ảnh và phản hồi, từ đó tối ưu hóa quy trình chọn lọc dữ liệu cho các mô hình ngôn ngữ thị giác (VLM).

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

LightNav-0: Mô hình điều hướng robot đa năng khai phá trí tuệ không gian từ VLM

LightNav-0 là mô hình điều hướng robot nhỏ gọn, tận dụng trí tuệ không gian của VLM mà không cần bộ dự đoán chuyên biệt. Nó đạt hiệu suất SOTA trên 10 môi trường mô phỏng và thể hiện khả năng thích nghi linh hoạt trong thế giới thực.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

MineAmongUs: Nghiên cứu khả năng lừa dối bằng ngôn ngữ và hành vi của tác nhân AI trong môi trường 3D

MineAmongUs là môi trường sandbox 3D mô phỏng trò chơi Among Us, cho phép các tác nhân VLM thực hiện hành vi lừa dối phức tạp thông qua sự kết hợp giữa ngôn ngữ và hành động phi ngôn ngữ.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

NavMCP: Khung kết hợp mô hình nền tảng giúp robot điều hướng thông minh trong thế giới thực

NavMCP là khung làm việc mới kết hợp khả năng suy luận của VLM với mô hình điều hướng (NFM), cho phép robot thực hiện các nhiệm vụ dài hạn mà không cần huấn luyện lại, thông qua sự phối hợp giữa ý định, quan sát và bộ nhớ.

31/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

GGSS: Phương pháp điều hướng hình cầu giúp loại bỏ định kiến trong các mô hình thị giác - ngôn ngữ

GGSS là kỹ thuật can thiệp mới giúp loại bỏ định kiến về chủng tộc hoặc giới tính trong các mô hình VLM tạo sinh bằng cách điều chỉnh các token hình ảnh trên không gian hình cầu mà không làm mất đi đặc tính dữ liệu.

28/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 49/100

MMLVE-Agent: Bước tiến mới trong chỉnh sửa video dài đa góc quay bằng tác nhân AI

MMLVE-Agent là khung làm việc mới sử dụng tác nhân AI để phân tách và chỉnh sửa video dài đa góc quay, giúp loại bỏ hiện tượng ảo giác và đảm bảo tính nhất quán về không gian, thời gian giữa các cảnh quay.

27/08

Thứ Năm · 1 tin

24/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnLlama-Mobile: Đột phá nén mô hình thị giác ngôn ngữ xuống 2.7-bit cho thiết bị di động

Llama-Mobile giới thiệu phương pháp nén mô hình VLMs xuống định dạng 2.7-bit, cho phép chạy mượt mà trên chip Arm mà vẫn giữ vững hiệu suất, giúp đưa các mô hình lớn như Llama 3.2 11B lên smartphone.


Vì sao đáng đọc: Đây là bước tiến quan trọng cho ứng dụng AI trên thiết bị (on-device AI), giải quyết bài toán tài nguyên phần cứng vốn là rào cản lớn nhất hiện nay.

21/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 48/100

EXIMO: Tối ưu hóa robot VLA thông qua dẫn dắt khám phá bằng mô hình VLM

EXIMO là thuật toán ba giai đoạn giúp tinh chỉnh mô hình VLA hiệu quả bằng cách sử dụng VLM để lập kế hoạch, phân rã nhiệm vụ và tối ưu hóa thông qua học tăng cường, giúp robot đạt hiệu suất vượt trội với ít dữ liệu hơn.

19/08

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 41/100

TAMP-Nav: Bước tiến mới trong điều hướng robot nhờ mô hình ngôn ngữ thị giác (VLM)

TAMP-Nav tối ưu hóa điều hướng robot bằng cách chuyển đổi tác vụ thành chọn điểm 2D trên ảnh, kết hợp suy luận chọn lọc và bộ nhớ quỹ đạo để đạt hiệu suất kỷ lục trên R2R-CE.

18/08

Thứ Ba · 1 tin

14/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 49/100

Spatial Memory Agent: Tối ưu hóa suy luận không gian cho mô hình VLM mà không cần huấn luyện lại

Spatial Memory Agent (SMA) là khung tự tiến hóa giúp các mô hình VLM đóng băng cải thiện khả năng suy luận không gian thông qua việc đúc kết kinh nghiệm và đánh giá độ tin cậy, đạt hiệu suất vượt trội trên nhiều tiêu chuẩn đánh giá.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (65 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “VLM” | AIHOT.vn