Apple Machine Learning Research
85

Nghiên cứu

Tinh chỉnh tiệm tiến: Phương pháp gán nhãn giả lặp cho nhận diện giọng nói song ngữ Trung - Anh

(giờ Việt Nam)

Tóm tắt AI

Apple giới thiệu phương pháp huấn luyện bán giám sát mới, sử dụng dữ liệu chưa gán nhãn để tối ưu hóa khả năng nhận diện giọng nói pha trộn Trung - Anh thông qua quy trình tinh chỉnh lặp lại.

Bản dịch AI

Progressive Refinement: An Iterative Pseudo-Labeling Approach for Mandarin-English Code-Switching ASR

Tác giả: Qu Yang†**, Cakra Wardhana, Tim Ng

Chuyển đổi mã (Code-switching - CS), tức việc sử dụng xen kẽ các ngôn ngữ trong cùng một phát ngôn, đặt ra những thách thức đáng kể cho nhận dạng giọng nói tự động (ASR) do hạn chế về dữ liệu huấn luyện CS. Bài báo này lần đầu tiên áp dụng phương pháp huấn luyện gán nhãn giả (pseudo-labeling) lặp lại cho CS-ASR, chứng minh hiệu quả của nó trong việc tận dụng dữ liệu chưa được gán nhãn để cải thiện hiệu suất CS-ASR. Phương pháp này bao gồm ba giai đoạn: tạo nhãn giả, huấn luyện mô hình song ngữ hai giai đoạn và cải tiến lặp lại. Quy trình bắt đầu bằng việc tạo các nhãn giả từ một tập dữ liệu lớn chưa được gán nhãn, tạo thành một tập dữ liệu bán giám sát. Tập dữ liệu này hỗ trợ khung huấn luyện hai giai đoạn, trong đó mô hình được tiền huấn luyện và sau đó tinh chỉnh (fine-tuned) trên dữ liệu CS có giám sát. Các tinh chỉnh lặp lại giúp nâng cao hơn nữa độ chính xác của mô hình trong việc xử lý các tình huống CS phức tạp. Phương pháp của chúng tôi thúc đẩy đáng kể các hệ thống CS-ASR, đạt được mức giảm Tỷ lệ lỗi hỗn hợp (Mix Error Rate - MER) đáng chú ý trên các tập con devman (6,35%) và devsge (8,29%) của SEAME.

Các bài đọc và cập nhật liên quan.

Công nghệ giọng nói đã trở nên phổ biến trong thời gian gần đây. Tuy nhiên, độ chính xác, và do đó là trải nghiệm người dùng, ở các ngôn ngữ khác nhau lại khác biệt đáng kể, khiến công nghệ này không có tính bao trùm đồng đều. Sự sẵn có của dữ liệu cho các ngôn ngữ khác nhau là một trong những yếu tố then chốt ảnh hưởng đến độ chính xác, đặc biệt là trong việc huấn luyện các hệ thống nhận dạng giọng nói tự động đầu-cuối (end-to-end) hoàn toàn dựa trên mạng thần kinh.

Chuyển giao tri thức đa ngôn ngữ và gán nhãn giả lặp lại là hai…

Đọc thêm

Tự huấn luyện (Self-training) đã được chứng minh là hữu ích trong việc giải quyết tình trạng khan hiếm dữ liệu cho nhiều lĩnh vực, bao gồm thị giác, giọng nói và ngôn ngữ. Cụ thể, tự huấn luyện, hay gán nhãn giả, sẽ gán nhãn cho dữ liệu không được giám sát và thêm chúng vào tập dữ liệu huấn luyện. Trong nghiên cứu này, chúng tôi khảo sát và sử dụng phương pháp gán nhãn giả cho một thiết lập mới được đề xuất gần đây: đồng thời phiên âm và dịch giọng nói, vốn đang gặp khó khăn do thiếu hụt các nguồn dữ liệu song song đầy đủ. Chúng tôi…

Đọc thêm

AppleNhận diện giọng nóiAIHọc bán giám sátXử lý ngôn ngữ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.