Jiqizhixin
92

Nghiên cứu

VideoChat3: Mô hình đa phương thức mã nguồn mở đột phá cho khả năng hiểu video toàn diện

(giờ Việt Nam)

Tóm tắt AI

VideoChat3 là mô hình đa phương thức 4B tham số, tối ưu hóa khả năng hiểu video từ ngắn đến dài và luồng trực tiếp với chi phí tính toán thấp. Dự án đã mở mã nguồn toàn diện bao gồm dữ liệu, mã nguồn và trọng số mô hình.

Bản dịch AI

Chỉ mất 3 ngày để huấn luyện mô hình lớn 13 tỷ tham số, Đại học Bắc Kinh giới thiệu Chat-UniVi giúp thống nhất khả năng hiểu hình ảnh và video

Chuyên mục Synced, Ban biên tập Synced: Các nhà nghiên cứu từ Đại học Bắc Kinh, Đại học Tôn Trung Sơn và các tổ chức khác đã đề xuất mô hình ngôn ngữ thị giác thống nhất — Chat-UniVi. Thông qua việc xây dựng sự thống nhất giữa hình ảnh và video...

Synced

Liệu có thể đạt được cả năng lực lẫn độ tin cậy? Báo cáo đánh giá các mô hình lớn đa phương thức như GPT-4, Gemini đã ra mắt

Chuyên mục Synced, Ban biên tập Synced: Năm 2023, chúng ta đang chứng kiến các mô hình lớn đa phương thức... Đối với đầu vào là video, đặc biệt là các vấn đề suy luận nhân quả đòi hỏi khả năng hiểu về trình tự thời gian...

Synced

Ant Group công bố mô hình thế giới video-hành động đầu tiên trên thế giới, vừa mở mã nguồn đã thiết lập kỷ lục thế giới mới

Robot cuối cùng đã bắt đầu hiểu được "hành động của tôi sẽ thay đổi thế giới như thế nào". Trong đó, điểm cốt lõi thực sự là... Vài ngày trước, Ant Lingbo Technology đã mở mã nguồn mô hình hiện thân LingBot-VLA và không gian...

MacTalk

Alibaba DAMO Academy mở mã nguồn Video-LLaMA, giúp các mô hình ngôn ngữ lớn có thêm "mắt" và "tai"

Chuyên mục Synced, Ban biên tập Synced: Video trong văn hóa internet và mạng xã hội ngày nay... Video-LLaMA có khả năng cảm nhận và hiểu được các tín hiệu video và âm thanh trong video, đồng thời có thể hiểu...

Cộng đồng mở AIGC

Thực tiễn khởi nghiệp với AgenticOS mã nguồn mở toàn diện: Bước nhảy vọt về mô hình từ công cụ sang lực lượng lao động — Tái cấu trúc chuỗi ngành dựa trên kiến trúc 5 tầng của AGI và đổi mới mô hình kinh doanh ToI

Sự tiến hóa của "nền tảng đầu cuối chuỗi ngành", không chỉ cung cấp khả năng tạo video mà còn kết nối trực tiếp... Mã nguồn mở toàn diện: Cập nhật mang tính sử thi về tính nhất quán của chân dung, tích hợp đa yếu tố, làm đẹp, huấn luyện và triển khai...

DataFunSummit

Tin nóng! Đợt phê duyệt mô hình lớn thứ tư tại Trung Quốc đã được thông qua!

Tuyên bố bao phủ từ thiết bị biên, mô hình ngôn ngữ lớn, đa phương thức, robot, v.v... Có khả năng hiểu ngôn ngữ, cảm nhận thẩm mỹ, cung cấp cho người dùng các tính năng cách điệu hình ảnh, sản xuất tư liệu, nghệ thuật...

Cộng đồng Machine Learning

Thực tiễn ứng dụng mô hình lớn: Hành trình khám phá AIGC

Bài viết này giới thiệu mối liên hệ mật thiết giữa mô hình lớn và AIGC theo cách hiểu của tác giả, từ lịch sử hình thành đến... Robot viết bài, trợ lý phỏng vấn, tạo phụ đề video, phát thanh giọng nói, tổng hợp video...

Công nghệ Taobao (Đại Taobao)

VideoChat mở mã nguồn! Hiểu video tổng quát lấy trò chuyện làm trung tâm

Đồng huấn luyện một chatbot đầu cuối có khả năng đọc hình ảnh và hiểu video. VideoChat hiểu trò chơi, VideoChat-Text và VideoChat-Embed. Mục đích ban đầu của chúng tôi là tận dụng...

Algorithm Bang (Thuật toán Bang)

Công nghệ cốt lõi về Machine Learning, Deep Learning với AI-Python mới nhất cùng các ứng dụng tiên phong và quy trình tự động hóa Agent toàn diện

Kỹ năng toàn diện, nâng cao dầnTừ lập trình Python nâng cao (hàm, OOP, hiệu năng... Ba góc nhìn về tự động hóa mô hình lớn, kết nối chặng đường cuối từ hiểu thuật toán đến ứng dụng thực tiễn trong nghiên cứu...

Ai Shang Nghiên cứu Khoa học (Ai Shang Yanxiu)

Nhật báo điểm tin AI · 31-03-2026

Một khi các công cụ lập trình xâm nhập vào quy trình đánh giá mã và tương tác, niềm tin, quyền riêng tư và... của nhà phát triển sẽ... Giải pháp mã nguồn mở toàn diện sẽ đẩy nhanh khả năng tái hiện của các đội ngũ robot và nhận thức 3D. Người làm phần mềm...

AI - Ủng hộ. Thực hành. Truyền bá

12345678910 Trang sau

Tìm thấy khoảng 236 kết quả

VideoChat3Mô hình đa phương thứcHiểu videoMã nguồn mởAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Jiqizhixin. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.