25/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

Tối ưu hóa tỷ lệ méo hình cho các chỉ số chất lượng ảnh toàn tham chiếu bằng ước tính Hessian ngẫu nhiên

Nghiên cứu giới thiệu IDQD-RDO, phương pháp sử dụng ước tính Hessian ngẫu nhiên để tối ưu hóa các chỉ số chất lượng ảnh như MS-SSIM và LPIPS trong mã hóa VVC, giúp tiết kiệm 14.2-36.7% BD-rate mà không cần thay đổi bộ giải mã.

15/09

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 46/100

Omni-Streaming Thinking: Giải pháp ngăn chặn AI đa phương thức đưa ra kết luận vội vàng

Omni-Streaming Thinking (OST) giúp mô hình AI phân tách dữ liệu thành bằng chứng và dự đoán, cho phép kiểm chứng thông tin theo thời gian thực để tránh sai sót khi xử lý dữ liệu đa phương thức.

09/09

Thứ Tư · 1 tin

07/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ShallowStream: Tối ưu hóa xử lý video trực tuyến bằng cách phân tầng độ sâu mô hình

ShallowStream là khung làm việc mới giúp giảm chi phí tính toán khi xử lý video trực tuyến bằng cách kết hợp xử lý nông (shallow) cho các khung hình đầu vào và chỉ đi sâu (deep) khi cần thiết, giúp tối ưu hóa bộ nhớ KV cache.

04/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

Scal3R: Phương pháp truy vấn tư thế tương đối đa khung hình giúp ổn định tái tạo 3D video dài

Scal3R tối ưu hóa tái tạo 3D trực tuyến bằng cách sử dụng các token học được để tinh chỉnh mô hình nền, kết hợp tối ưu hóa đồ thị tư thế giúp giảm thiểu sai số tích lũy trong các video dài.

02/09

Thứ Tư · 1 tin
Google AI for Developers@googleaidevs
Sản phẩmĐiểm AI 50/100

Cùng sự kiệnGemini 3.7 Flash nâng cấp khả năng hiểu video, đếm chính xác từng nhịp vỗ tay

Can Gemini count the number of claps? 👏 Accurately counting rapid movements is a notoriously trick…

DịchGoogle giới thiệu tính năng hiểu video thông minh trên Gemini 3.7 Flash, cho phép tự động điều chỉnh tốc độ xử lý để nhận diện các hành động nhanh như vỗ tay, thay vì bỏ lỡ do giới hạn khung hình cố định.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt tính năng hiểu video thông minh cho Gemini»

01/09

Thứ Ba · 2 tin
cb_doge@cb_doge
Hướng dẫnĐiểm AI 24/100

DogeDesigner dùng Grok Build để khử nhiễu và phụ đề hóa video bài phát biểu của Elon Musk tại G20

Grok Build isn't just for coding. It can help you far beyond that. Today, I used it to clean up the…

DịchDogeDesigner chia sẻ trải nghiệm sử dụng Grok Build để xử lý video, từ việc loại bỏ tạp âm nền đến tự động tạo phụ đề cho bài phát biểu của Elon Musk, cho thấy tiềm năng của công cụ này trong lĩnh vực hậu kỳ video.

15/08

Thứ Bảy · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 72/100

Tinh chọnMOSS-VL: Dòng mô hình ngôn ngữ thị giác mã nguồn mở đột phá với khả năng tương tác thời gian thực

MOSS-VL là dòng mô hình ngôn ngữ thị giác tiên phong tích hợp khả năng vừa quan sát vừa phản hồi theo thời gian thực. Nhờ cơ chế chú ý chéo, mô hình đạt hiệu suất vượt trội trên các bài kiểm tra luồng dữ liệu, dẫn đầu các giải pháp mã nguồn mở hiện nay.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc xử lý video thời gian thực, giải quyết bài toán độ trễ vốn là điểm yếu của các mô hình đa phương thức hiện nay.
Tổng 9 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (29 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Xử lý video” | AIHOT.vn