# Apple công bố giải pháp ASR liên kết bán giám sát: Tối ưu hóa nhãn giả và ổn định cập nhật máy chủ

- Nguồn: Apple Machine Learning Research
- Thời gian phát hành: 2026-09-24 07:00 (giờ Việt Nam)
- Điểm AI: 38/100
- Link AIHOT.vn: https://aihot.vn/items/4ec5921f6ecdc6be
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmufwl0mz02xerogvi4yarzn0
- Link gốc: https://machinelearning.apple.com/research/practical-recipe-federated-asr

## Tóm tắt AI

Apple giới thiệu phương pháp mới giúp giảm sai số trong học máy liên kết ASR bán giám sát, cải thiện hiệu suất nhận diện giọng nói đáng kể bằng cách ổn định nhãn giả và cập nhật máy chủ liên tục.

## Thân bài

![A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization](https://mlr.cdn-apple.com/media/Home_1200x630_48225d82e9.png)

Tác giả: Wonho Bae, Zakaria Aldeneh, Martin Pelikan, Jan “Honza” Silovsky, Tatiana Likhomanenko, Sheikh Shams Azam

Học máy liên kết bán giám sát (SSFL) huấn luyện các mô hình trên dữ liệu không gán nhãn của khách hàng bằng cách sử dụng một giáo viên để tạo nhãn giả, với một tập dữ liệu hạt giống nhỏ đã gán nhãn trên máy chủ. Nhận dạng giọng nói tự động (ASR) đặc biệt nhạy cảm trong trường hợp này: các lỗi nhãn giả tích tụ qua chuỗi đầu ra và qua các vòng huấn luyện dẫn đến sự phân kỳ, tạo ra khoảng cách lớn so với FL có giám sát hoàn toàn. Chúng tôi chỉ ra rằng việc thu hẹp khoảng cách này phụ thuộc vào hai trục thiết kế kết hợp—giáo viên (mô hình nào tạo ra nhãn giả) và neo (các cập nhật phía máy chủ trên dữ liệu đã gán nhãn giúp ổn định quá trình huấn luyện). Trên trục giáo viên, một giáo viên trực tuyến theo từng khách hàng (mô hình đang phát triển của riêng mỗi khách hàng) sẽ tự phân kỳ, nhưng khi đã ổn định, nó sẽ ngang bằng hoặc vượt qua giáo viên toàn cục được phát sóng (một mô hình máy chủ, cố định trong một vòng)—vượt trội trong miền và cạnh tranh khi có sự dịch chuyển miền. Khi tập hạt giống mạnh hơn và lợi thế của giáo viên trực tuyến thu hẹp lại, một giáo viên chuyển tiếp (toàn cục → trực tuyến tại vòng r) sẽ ngang bằng hoặc vượt qua cả hai. Trên trục neo, máy chủ phải tiếp tục huấn luyện trên dữ liệu đã gán nhãn giữa các vòng—nếu không giáo viên trực tuyến sẽ bị trôi—và sự xen kẽ này, quan trọng hơn cả mô hình hạt giống, quyết định sự hội tụ. Hai trục này không thể tách rời: các lựa chọn giáo viên mạnh mẽ chỉ mang lại hiệu quả khi neo ổn định quá trình huấn luyện, vốn rất nhạy cảm với tăng cường dữ liệu và kích thước lô—các thiết lập quyết định mức độ nhiễu đầu vào và nhiễu gradient mà máy chủ đưa vào. Mức độ ổn định cần thiết phụ thuộc vào miền, được quyết định bởi sự phân tán của dữ liệu hạt giống và mức độ trùng lặp của nó với dữ liệu khách hàng. Những phát hiện này đưa ra các hướng dẫn cho SSFL trong huấn luyện ASR, cải thiện so với phương pháp trước đó mạnh nhất trên 9 trong số 11 cặp, trung bình 20,8% trong miền và 10,0% liên miền, thu hẹp khoảng cách với FL có giám sát hoàn toàn.

### Các bài đọc và cập nhật liên quan.

Tự huấn luyện đã được chứng minh là hữu ích trong việc giải quyết tình trạng khan hiếm dữ liệu cho nhiều lĩnh vực, bao gồm thị giác, giọng nói và ngôn ngữ. Cụ thể, tự huấn luyện, hay gán nhãn giả, sẽ gán nhãn cho dữ liệu không giám sát và thêm vào nhóm huấn luyện. Trong nghiên cứu này, chúng tôi điều tra và sử dụng gán nhãn giả cho một thiết lập mới được đề xuất gần đây: phiên âm và dịch thuật giọng nói kết hợp, vốn đang thiếu hụt các tài nguyên dữ liệu song song đầy đủ. Chúng tôi…

[Đọc thêm](https://machinelearning.apple.com/research/joint-speech-transcription)

Bài báo này đã được chấp nhận tại hội thảo “I Can’t Believe It’s Not Better: Understanding Deep Learning Through Empirical Falsification”

Các thuật toán gán nhãn giả (PL) liên tục như slimIPL gần đây đã nổi lên như một chiến lược mạnh mẽ cho học bán giám sát trong nhận dạng giọng nói. Trái ngược với các chiến lược trước đây luân phiên giữa việc huấn luyện mô hình và tạo nhãn giả (PL) bằng mô hình đó, ở đây các PL được tạo ra theo cách end-to-end…

[Đọc thêm](https://machinelearning.apple.com/research/soft-pseudo-labeling)
