Nghiên cứu
SCoPE
(giờ Việt Nam)
Tóm tắt AI
SCoPE
Chính văn · Bản dịch AI
AngelSlim: Công cụ nén mô hình lớn mã nguồn mở của Tencent Hunyuan, giúp mô hình lớn chạy siêu tốc trên điện thoại của bạn
Suy luận mô hình lớn quá chậm, không đủ VRAM? AngelSlim, mã nguồn mở từ đội ngũ Tencent Hunyuan,... mô-đun này đề xuất hai cải tiến: Token Position Decay (Suy giảm vị trí): thứ tự...
Cộng đồng ModelScope
Cuộc chiến mô hình thế giới, Ant Group tung quân bài mã nguồn mở
Tuy nhiên, trong vài phút cuối của video, mối quan hệ vị trí giữa các tòa nhà dường như đã bị mô hình lãng quên... Trong thiết lập này, mô hình thế giới đóng vai trò là "trình mô phỏng nội bộ" của robot: trong VLA...
AI Frontline
Hành trình phát triển mô hình lớn: 31, Từ thị giác đến đa phương thức: Nguyên lý kỹ thuật và ứng dụng thực tế của mô hình thị giác AI lớn
(như tính liên tục của hành động), cấu trúc không gian trong khung hình (như vị trí, hình dạng của vật thể). Mục tiêu cốt lõi của giai đoạn này là "giúp mô hình hiểu được quy luật động của video". 2. Stage 2:...
Yunlan Zhiyu
Quan điểm về "Trí tuệ không gian" của "Mẹ đỡ đầu AI" Fei-Fei Li: Một cuộc chuyển dịch mô hình AI từ ngôn ngữ sang thế giới vật lý
Từ mô hình ngôn ngữ lớn giúp máy móc "biết nói", đến trí tuệ không gian giúp máy móc "biết làm" —... Mối quan hệ giữa nó và con người sẽ được tái cấu trúc hoàn toàn. Hành trình từ "văn bản" đến "thế giới" này...
Yixin Juejin
Từ bỏ NeRF? Tại sao Gaussian Splatting lại hot đến vậy trong các kịch bản xe tự lái?
NeRF chủ yếu sử dụng các mô hình dựa trên tọa độ ẩn để ánh xạ tọa độ không gian sang giá trị pixel. 3... Liên quan đến việc robot hoặc thiết bị hiểu vị trí của mình trong môi trường chưa biết và lập bản đồ thời gian thực. Công nghệ này...
Computer Vision Life
CVPR 2026 | Đại học Trento và các đơn vị khác đề xuất TerraScope: VLM suy luận không gian địa lý cấp pixel đầu tiên, hiệu suất vượt xa GPT-4o
So sánh với các mô hình hiện có và ưu thế của nó trong suy luận cấp pixel như hình trên, truyền... trên lưới, chỉ khi độ bao phủ của mặt nạ (mask) vượt quá 50%, Token thị giác tại vị trí đó mới...
Nền tảng Extreme-Mart
3.12-3 | Nhận thức và kiểm chuẩn mô hình ngôn ngữ thị giác: Khoảng cách hiểu văn bản pixel, khoảng cách phương thức, căn chỉnh phương thức tự chưng cất; Kiểm chuẩn đánh giá trí tuệ không gian thể thao; Kiểm chuẩn suy luận so sánh chi tiết
Sự vụng về của mô hình trước các pixel bắt nguồn từ sự can thiệp của đầu vào thị giác đối với độ chính xác khi đọc và đối với... đặt ra yêu cầu cực cao về nhận thức không gian chi tiết của mô hình. Tuy nhiên, các video thể thao hiện có...
AI Research Frontier
Tác phẩm mới từ UC Berkeley: Vứt bỏ tiền đề 3D, dùng "tia sáng" (light rays) để xây dựng mô hình thế giới tổng quát?
Nó mã hóa chính mối quan hệ vị trí tương đối giữa tia sáng i và tia sáng j (bao gồm không gian và thời gian... và là bài toán khó về mô hình thế giới cho video lái xe đa góc nhìn có thể kiểm soát. Các phương pháp truyền thống hoặc quá "cứng nhắc"...
AI Zhixiaolong
CVPR 2026 | TerraScope tái định hình mô hình mới về quan sát Trái Đất: Giúp AI viễn thám học cách "tư duy bằng pixel"
TerraScope vượt xa các mô hình hiện có trong các tác vụ suy luận không gian địa lý cấp pixel, tương lai... mặt nạ cấp token thu được sau khi điều chỉnh về độ phân giải lưới token (khi mặt nạ bao phủ một...
Viễn thám và Học sâu
Phát triển mô hình ngôn ngữ khuếch tán DLM với Diffusers (2): Giới thiệu các tính năng và chức năng chính
Thư viện Python mã nguồn mở được phát triển, tập trung vào các mô hình khuếch tán (Diffusion Models)... Chuyển đổi giữa không gian pixel và không gian tiềm ẩn, AutoencoderKL, Text Encoder chuyển văn bản...
Matu Shanhai. Zhiyin Changjuan
1234 Trang tiếp theo
Tìm thấy khoảng 34 kết quả
Bài viết được AI dịch và tổng hợp tự động từ Jiqizhixin. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.