Tất cả chủ đề
CHỦ ĐỀ

Giọng nói & Âm thanh

Tiến triển âm thanh AI: Tổng hợp giọng nói, trò chuyện thời gian thực, tạo nhạc và mô hình hiểu âm thanh.

Hôm qua · 03/09

Sundar Pichai@sundarpichai· 2 nguồn
85

Google tích hợp tính năng điều khiển bằng giọng nói cho Gemini trên Gmail, Docs và Keep

Sundar Pichai vừa giới thiệu tính năng giọng nói mới trên Gemini, cho phép người dùng tìm kiếm email, quản lý ghi chú và soạn thảo văn bản bằng hội thoại tự nhiên. Tính năng này hiện đã khả dụng cho người dùng đăng ký Google AI.

Google GeminiAI WorkspaceTrợ lý ảoCông nghệ giọng nóiNăng suất
Runway@runwayml
92

Runway công bố GWM Worlds 2: Mô hình thế giới ảo tương tác thời gian thực

Runway giới thiệu GWM Worlds 2, mô hình thế giới ảo cho phép tạo video 720p/24fps kèm âm thanh chất lượng cao, nơi người dùng tùy chỉnh môi trường, vật lý và điều khiển diễn biến thế giới bằng văn bản mà không bị giới hạn kịch bản.

RunwayWorld ModelAI VideoMô phỏngCông nghệ mới
Artificial Analysis@ArtificialAnlys
88

Wan 3.0 thống trị bảng xếp hạng Artificial Analysis: Đỉnh cao mới trong tạo video có âm thanh

Mô hình Wan 3.0 của Alibaba vừa vươn lên dẫn đầu bảng xếp hạng chỉnh sửa video có âm thanh của Artificial Analysis, đồng thời xếp thứ hai ở hạng mục tạo video từ văn bản. Đây là mô hình đa năng hỗ trợ xuất video 1080p dài 30 giây với khả năng tùy chỉnh sâu qua văn bản, hình ảnh và âm thanh.

Wan 3.0AlibabaVideo AIArtificial AnalysisGenerative AI
Testing Catalog@testingcatalog
85

Inworld ra mắt Realtime TTS-2: Sao chép giọng nói chỉ với 5-15 giây

Inworld vừa giới thiệu bộ đôi TTS-2 và TTS-2 Flash với khả năng sao chép giọng nói siêu tốc chỉ trong 5-15 giây, hỗ trợ đọc chính xác các mã số phức tạp và tối ưu độ trễ thấp.

AITTSVoice CloningInworldCông nghệ giọng nói

T4 · 02/09

T3 · 01/09

The Decoder: AI News· 4 nguồn
92

Runway ra mắt Solaris: Mô hình AI thế hệ mới có khả năng tạo giao diện phần mềm theo thời gian thực

Runway giới thiệu Solaris, mô hình 'Interface World Model' đầu tiên có khả năng render giao diện phần mềm ở độ phân giải 720p theo thời gian thực, cho phép người dùng tương tác trực tiếp qua thao tác chuột hoặc giọng nói mà không cần chạy mã nguồn.

RunwaySolarisAIGiao diện người dùngCông nghệ mới

T2 · 31/08

OpenBMB@OpenBMB
85

OpenMAIC gây bão GitHub: Nền tảng AI tạo khóa học tương tác tự động

Dự án mã nguồn mở OpenMAIC vừa đạt hơn 25,7k sao trên GitHub, cho phép tạo khóa học tương tác chỉ với một cú nhấp chuột. Đồng thời, VoxCPM2 cũng được tích hợp để hỗ trợ tính năng sao chép giọng nói trong hệ thống.

OpenMAICAI giáo dụcGitHubVoxCPMMã nguồn mở
HuggingFace Daily Papers (Nổi bậtBài nghiên cứu)
92

Ra mắt DreamX-Creator 1.0: Mô hình 7B hỗ trợ tạo video và âm thanh đồng bộ ở độ phân giải 2K

DreamX-Creator 1.0 là hệ thống tạo nội dung đa phương tiện đột phá, sử dụng mô hình 7B để đồng bộ hóa âm thanh và video từ văn bản và khung hình đầu tiên, mang lại chất lượng 2K sắc nét.

AI tạo videoĐa phương tiệnNghiên cứu AIDreamX-CreatorĐồng bộ âm thanh

CN · 30/08

TechCrunch: AI
85

Caterpillar ứng dụng kinh nghiệm tự động hóa khai thác mỏ vào triển khai AI

Gã khổng lồ công nghiệp Caterpillar ra mắt Cat AI Assistant, tận dụng kho dữ liệu khổng lồ để hỗ trợ kỹ thuật viên qua giọng nói, đồng thời đầu tư 100 triệu USD đào tạo nhân sự trong bối cảnh doanh thu đạt kỷ lục nhờ nhu cầu từ trung tâm dữ liệu.

CaterpillarỨng dụng AICông nghiệpChuyển đổi sốTự động hóa
IT Home
85

Huawei ra mắt bản cập nhật HarmonySpace mùa hè: Tích hợp AI Agent ghi nhớ địa chỉ thông minh

Huawei vừa nâng cấp hệ thống buồng lái thông minh HarmonySpace với các tính năng AI mới như tự động ghi nhớ địa chỉ, tối ưu hóa điều hướng bằng giọng nói và bộ lọc trạm sạc thông minh, hướng tới cột mốc 2 triệu xe được trang bị công nghệ này.

HuaweiHarmonyOSXe thông minhAI AgentCông nghệ ô tô

T7 · 29/08

T6 · 28/08