HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Điểm AI 35/100

Nghiên cứu

EvolvingAvatar: Công nghệ tạo hình 3D tương tác tự thích ứng theo hội thoại

(giờ Việt Nam)

Tóm tắt AI

EvolvingAvatar là mô hình tạo hình 3D tự thích ứng với video khuôn mặt và âm thanh người dùng trong thời gian thực, sử dụng cơ chế dự đoán ngữ cảnh để tự học mà không cần gắn nhãn dữ liệu thủ công.

Chính văn · Bản dịch AI

Xem PDF HTML (thử nghiệm)

Tóm tắt: Việc tạo đầu 3D tương tác đòi hỏi chuyển động nói và nghe phối hợp để phản hồi lại một cuộc hội thoại đang diễn ra. Các trình tạo hiện nay sử dụng dữ liệu quan sát đầu vào làm ngữ cảnh nhưng giữ nguyên các tham số, khiến các mô hình hội thoại không được tận dụng làm tín hiệu học tập. Chúng tôi giới thiệu EvolvingAvatar, một trình tạo nhân quả sử dụng phương pháp huấn luyện tại thời điểm kiểm thử (test-time training) để thích nghi với video khuôn mặt người dùng và âm thanh đối thoại trong quá trình tương tác. Mục tiêu dự đoán ngữ cảnh đối thoại của nó cung cấp tín hiệu học tự giám sát từ ngữ cảnh nghe nhìn mà không cần nhãn chuyển động mục tiêu khi kiểm thử. Các trọng số nhanh bền vững (persistent fast weights) tích lũy những cập nhật này trong mỗi cuộc hội thoại để dẫn dắt quá trình tạo chuyển động, trong khi sự thích nghi hàm tạm thời (transient jaw adaptation) phản hồi lại ngữ cảnh nghe nhìn hiện tại. Hoạt động lời nói được dự đoán sẽ kiểm soát cách thức sự thích nghi bền vững dẫn dắt chuyển động. Chúng tôi cũng giới thiệu InterHead-Bench, một bộ tiêu chuẩn thống nhất dài 455,95 giờ được xây dựng từ các video hội thoại đơn góc và đa góc nhìn. Các thí nghiệm cho thấy sự cải thiện về thống kê chuyển động hội thoại so với các mô hình cơ sở mạnh. Trên tập dữ liệu phân phối chéo (out-of-distribution) khó nhất, khả năng tạo chuyển động được cải thiện khi cuộc hội thoại diễn ra, giảm mức độ sai lệch so với thống kê biểu cảm của người dùng-avatar được ghi lại lên đến 11,1% so với khoảng thời gian đầu tiên.

Bình luận:Trang dự án: this https URL
Chủ đề:Thị giác máy tính và Nhận dạng mẫu (cs.CV)
Trích dẫn là:arXiv:2609.35616 [cs.CV]
(hoặc arXiv:2609.35616v1 [cs.CV] cho phiên bản này)
https://doi.org/10.48550/arXiv.2609.35616 DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

Lịch sử gửi bài

Từ: Junjie Chen [xem email] [v1] Thứ Hai, 28 tháng 9 năm 2026 16:56:07 UTC (32.314 KB)

Avatar 3DThị giác máy tínhAI tạo sinhHội thoại tương tácNghiên cứu AI

Bài viết được AI dịch và tổng hợp tự động từ HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

EvolvingAvatar: Công nghệ tạo hình 3D tương tác tự thích ứng theo hội thoại | AIHOT.vn