24/09

Thứ Năm · 3 tin
MarkTechPost
Mô hìnhĐiểm AI 58/100

Cùng sự kiệnNVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Hỗ trợ theo dõi 8 người cùng lúc

NVIDIA vừa phát hành Nemotron 3 Diarization trên Hugging Face, mô hình mã nguồn mở 100M tham số có khả năng theo dõi thời gian thực tới 8 người nói và xử lý chồng lấn âm thanh, cho phép sử dụng thương mại.

Cùng sự kiện, bài đại diện «NVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Đỉnh cao mới trên VoiceArena»
Jason Liu@jxnlco
Hướng dẫnĐiểm AI 28/100

Quy trình dùng Astra để chuyển soạn nhạc và tinh chỉnh lỗi thủ công

been using astra to transcribe music, then to review the spectrogram to do error correction and then…

DịchNgười dùng chia sẻ cách kết hợp Astra để chuyển soạn nhạc với việc kiểm tra phổ âm (spectrogram) nhằm sửa lỗi cao độ và điều chỉnh các đoạn nhạc phức tạp, giúp đạt kết quả chính xác cho mục đích học tập.

Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 45/100

Cùng sự kiệnVoiceArena ra mắt Diarization Bench: Đánh giá 12 hệ thống tách lời nói trong môi trường thực tế

VoiceArena launched Diarization Bench to compare 12 diarization systems on the same real-world audio…

DịchVoiceArena giới thiệu bộ tiêu chuẩn Diarization Bench với 139 đoạn hội thoại thực tế để so sánh 12 hệ thống tách lời nói. Kết quả cho thấy NVIDIA Nemotron 3 dẫn đầu với tỷ lệ lỗi DER 14.72%, đồng thời làm rõ sự ảnh hưởng của tham số collar và độ khó khi xử lý giọng nói chồng lấn.

Cùng sự kiện, bài đại diện «NVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Đỉnh cao mới trên VoiceArena»

23/09

Thứ Tư · 2 tin
Baseten Blog kỹ thuật (Web)
Sản phẩmĐiểm AI 56/100

Cùng sự kiệnNVIDIA Nemotron 3 Diarization cập bến Baseten: Tùy chỉnh độ trễ linh hoạt cho nhận diện người nói

Baseten ra mắt dịch vụ lưu trữ cho mô hình NVIDIA Nemotron 3 Diarization, hỗ trợ ba chế độ xử lý từ batch đến thời gian thực với chi phí tối ưu chỉ 1 cent mỗi giờ âm thanh.

Cùng sự kiện, bài đại diện «NVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Đỉnh cao mới trên VoiceArena»
Hugging Face: Blog
Sản phẩmĐiểm AI 59/100

NVIDIA ra mắt mô hình tách giọng nói Nemotron 3 Diarization: Đỉnh cao mới trên VoiceArena

NVIDIA phát hành mã nguồn mở mô hình Nemotron 3 Diarization với 100 triệu tham số, hỗ trợ tách tối đa 8 người nói và dẫn đầu bảng xếp hạng VoiceArena Diarization-Bench với tỷ lệ lỗi DER chỉ 14.72%.

Diễn biến sự kiện · 4 bài →Thêm 3 nguồn khác đưa tinMarkTechPostX: Rohan Paul (@rohanpaul_ai)Baseten Blog kỹ thuật (Web)

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OmniVChat: Bước tiến mới trong đối thoại đa phương thức trực tiếp qua âm thanh và hình ảnh

OmniVChat giới thiệu phương thức tương tác trực tiếp giữa người dùng và mô hình AI thông qua âm thanh và video mà không cần chuyển đổi văn bản, giúp giảm độ trễ và giữ trọn vẹn các tín hiệu cảm nhận.

16/09

Thứ Tư · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnStepAudio 3: Bước tiến đột phá trong mô hình AI hội thoại thời gian thực

StepAudio 3 giới thiệu cơ chế 'Think-While-Speaking' cho phép AI suy luận chuyên sâu song song với việc phản hồi bằng giọng nói, tạo ra trải nghiệm hội thoại tự nhiên, mượt mà và có độ trễ cực thấp.

Thêm 1 nguồn khác đưa tinX: Google AI (@GoogleAI)

Vì sao đáng đọc: Đây là một nghiên cứu quan trọng giải quyết bài toán hóc búa về độ trễ trong AI hội thoại, mang tính ứng dụng cao cho các trợ lý ảo thế hệ mới.

11/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 39/100

X-AuT: Tối ưu hóa bộ mã hóa âm thanh cho mô hình ngôn ngữ lớn thông qua nén và chưng cất

X-AuT sử dụng kỹ thuật cắt tỉa dần dần và chưng cất đa quy mô để nén bộ mã hóa âm thanh của LLM, giúp giảm số lớp Transformer mà vẫn cải thiện độ chính xác trên các bài kiểm tra tiếng Anh và tiếng Trung.

08/09

Thứ Ba · 1 tin

07/09

Thứ Hai · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnTFO: Biến mô hình thị giác-ngôn ngữ (VLM) thành hệ thống hiểu âm thanh mà không cần huấn luyện lại

TFO là giải pháp plug-and-play cho phép tích hợp khả năng hiểu âm thanh vào các mô hình VLM đóng băng mà không cần thay đổi kiến trúc hay huấn luyện lại, giúp bảo toàn nguyên vẹn năng lực suy luận thị giác ban đầu.


Vì sao đáng đọc: Giải pháp đột phá giúp tiết kiệm chi phí tính toán đáng kể khi tích hợp đa phương thức, giải quyết trực tiếp vấn đề 'quên lãng' năng lực cũ của các mô hình VLM hiện nay.

06/09

Chủ Nhật · 1 tin

02/09

Thứ Tư · 1 tin

29/08

Thứ Bảy · 1 tin

27/08

Thứ Năm · 1 tin

14/08

Thứ Sáu · 1 tin
Tổng 16 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (33 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “xử lý âm thanh” | AIHOT.vn