Hugging Face: Blog
75

Sản phẩm

Bảng xếp hạng Open ASR bổ sung ngôn ngữ Nam bán cầu đầu tiên: Tiếng Hindi và tiếng Anh Ấn Độ

(giờ Việt Nam)

Tóm tắt AI

Voice Arena và Hugging Face vừa tích hợp bộ dữ liệu Monsoon cho tiếng Hindi và tiếng Anh Ấn Độ vào bảng xếp hạng Open ASR, đánh dấu cột mốc ngôn ngữ phi châu Âu đầu tiên được đưa vào hệ thống đánh giá này.

Bản dịch AI

The Open ASR Leaderboard Adds Its First Global South Language

Voice Arena và Hugging Face hợp tác ra mắt đánh giá ASR mở cho tiếng Hindi và tiếng Anh Ấn Độ

Các bộ tiêu chuẩn (benchmarks) quyết định những gì được xây dựng. Một mô hình đạt điểm cao trên Open ASR Leaderboard sẽ được áp dụng và cải tiến, trong khi các khả năng mà bảng xếp hạng không đo lường được thường không có xu hướng cải thiện. Phần lớn công việc gần đây trên bảng xếp hạng đã tập trung vào việc làm cho các chỉ số đánh giá trở nên đáng tin cậy hơn:

Tất cả những điều đó khiến một con số duy nhất (WER) trở nên khó bị thao túng hơn. Tuy nhiên, nó vẫn chỉ là một con số. Một loạt các nghiên cứu đã chỉ ra rằng tỷ lệ lỗi ASR không được phân bổ đồng đều giữa những người sử dụng chúng. Sự chênh lệch về chủng tộc trong nhận dạng giọng nói tự động cho thấy các hệ thống thương mại hoạt động kém hiệu quả đối với người nói là người da đen gấp đôi so với người da trắng, và nghiên cứu "Quantifying Bias in Automatic Speech Recognition" (Định lượng thiên kiến trong nhận dạng giọng nói tự động) đã tìm thấy thêm những khác biệt về giới tính, độ tuổi và giọng vùng miền. Không điều nào trong số đó hiển thị trên bảng xếp hạng, không phải vì bảng xếp hạng đang che giấu nó. Các tập kiểm thử mà nó chạy ghi lại những gì đã được nói và hầu như không ghi lại bất cứ điều gì về người nói.

Để giải quyết khoảng cách này, chúng tôi giới thiệu hai tập đánh giá cho Open ASR Leaderboard: Monsoon en-IN và Monsoon hi-IN. Tiếng Hindi, ngôn ngữ được hơn nửa tỷ người sử dụng, là ngôn ngữ Ấn Độ đầu tiên trên tab đa ngôn ngữ vốn hiện chỉ bao gồm các ngôn ngữ châu Âu. Mỗi tập dữ liệu được phát hành dưới dạng một phần công khai (public split), có sẵn để tự chấm điểm, và một phần riêng tư (private split) được giữ lại để hạn chế việc tối ưu hóa theo tiêu chuẩn cụ thể. Bốn phần này tách biệt về người nói, bao gồm 4.888 người nói, với 12 thuộc tính người nói được ghi lại cho mỗi người.

Thiết kế của bộ sưu tập

Một tập kiểm thử chỉ có thể phơi bày một chế độ lỗi mà nó biến thiên theo đó. Hầu hết các bộ tiêu chuẩn được xây dựng từ bất kỳ âm thanh nào có sẵn. Monsoon được xây dựng để biến thiên theo chín trục: địa lý, độ tuổi, giới tính, từ vựng, thiết bị, môi trường âm thanh, loại hình lời nói, tốc độ nói và sự tồn tại của nhiều bản ghi chép hợp lệ cho cùng một âm thanh. Mỗi trục là một cách mà chỉ số WER tổng hợp có thể đúng ở mức trung bình nhưng lại sai đối với một nhóm dân cư cụ thể.

nine axes of variation in the Monsoon collection

Phương pháp thu thập tuân theo điều đó.

Thành phần tập dữ liệu

Bốn phần, hai ngôn ngữ, được thu thập thông qua một quy trình duy nhất.

Dữ liệu được lấy từ các cuộc hội thoại tự phát hai kênh không theo kịch bản, với các đoạn clip được phân đoạn từ một kênh duy nhất để mỗi clip chỉ chứa một người nói. Cùng với các trường được báo cáo trong bảng, mỗi clip còn ghi lại nghề nghiệp, trình độ học vấn, tình trạng hôn nhân, mức thu nhập, thương hiệu điện thoại, thành phố hiện tại và số năm sinh sống tại quận hiện tại.

Năm clip từ phần tiếng Anh Ấn Độ công khai, cùng với siêu dữ liệu đi kèm mỗi clip:

Phụ nữ 29 tuổi, Tây Tripura, Tripura. Sinh viên, samsung SM-G781B.

Phụ nữ 32 tuổi, Satna, Madhya Pradesh. Thất nghiệp, samsung SM-E146B.

Nam giới 22 tuổi, Rohtas, Bihar. Sinh viên, motorola moto g54 5G.

Phụ nữ 27 tuổi, Warangal, Telangana. Thất nghiệp, vivo V2247.

Nam giới 57 tuổi, Puducherry. Làm việc tư nhân, Xiaomi M2006C3LI.

Các tập tiếng Anh sử dụng các tham chiếu chuỗi tiêu chuẩn, nơi bộ chuẩn hóa của bảng xếp hạng thu gọn hầu hết các biến thể chính tả. Tiếng Hindi có nhiều biến thể hơn thế và không có bộ chuẩn hóa nào có thể giải quyết được, vì các biến thể không phải là một ánh xạ cố định giữa hai quy ước. Do đó, các tập tiếng Hindi đi kèm với một mạng lưới (lattice): đối với mỗi đoạn của bản ghi chép, một danh sách các cách viết được chấp nhận là đúng.

Độ bao phủ người nói

Monsoon nhỏ nếu đo bằng giờ và lớn nếu đo bằng số lượng người nói. Đó là thiết kế, và đó là nơi chứa đựng phần lớn giá trị.

Sự tập trung và đa dạng của người nói vượt ra ngoài các trường nêu trên.

Ba đặc tính sau đây được rút ra, và mỗi đặc tính là một khẳng định về phương sai thay vì khối lượng.

Không có giọng nói nào chi phối điểm số: Mười người đóng góp lớn nhất chỉ chiếm từ 2,8% đến 6,8% tổng thời lượng, và hơn một nửa số người nói chỉ xuất hiện đúng một lần. Kết quả trên Monsoon là mức trung bình của hàng trăm giọng nói khác biệt, không phải một số ít người nói được ghi âm dài. Các tập kiểm thử có thời lượng tương đương thường được xây dựng theo cách ngược lại.

Không có khu vực hoặc thiết bị cầm tay nào chi phối điểm số: Tập công khai tiếng Anh Ấn Độ lấy dữ liệu từ 428 quận bản địa trên 30 bang và vùng lãnh thổ; các tập tiếng Hindi, là ngôn ngữ thuộc vành đai Hindi, tập trung chặt chẽ hơn nhưng vẫn trải dài trên 202 và 295 quận. Các bản ghi âm đến từ 315 đến 582 mẫu thiết bị khác nhau, không có mẫu đơn lẻ nào vượt quá 2,1% số phân đoạn trong bất kỳ tập con nào. Các tập dữ liệu được thu thập trên phần cứng tiêu chuẩn hóa thường bị quá khớp (overfit) với phản hồi của một loại micro; tập dữ liệu này thì không.

Tiếng Anh Ấn Độ ở đây không phải là một giọng duy nhất: Đây là tiếng Anh được nói trên khắp cả nước, không phải tiếng Anh của một vùng. Tất cả sáu khu vực đều được đại diện: trong tập công khai, 35% phân đoạn được đóng góp bởi người nói miền Nam, 18% từ miền Đông, 18% từ miền Trung, 16% từ miền Bắc và 11% từ miền Tây. Sự biến đổi giọng nói từ sự phân bổ đó được ghi lại trong siêu dữ liệu thay vì được khẳng định.

Các trường siêu dữ liệu

Monsoon cung cấp 18 cột cho mỗi phân đoạn, trong đó 12 cột là siêu dữ liệu, trong khi hầu hết các tập kiểm thử ASR công khai chỉ cung cấp mã định danh, bản ghi chép và thời lượng. Các trường nhân khẩu học đầy đủ hoặc gần như đầy đủ; những người đóng góp đã đồng ý với việc sử dụng này.

Hai ngôn ngữ có hình thái địa lý khác nhau, và hình thái đó mang tính thông tin. Các tập tiếng Hindi tập trung vào vành đai Hindi, với Uttar Pradesh chiếm khoảng 40% số người nói, đây là điều mà một tập dữ liệu tiếng Hindi được lấy mẫu theo dân số nên có. Các tập tiếng Anh Ấn Độ phẳng hơn nhiều: không bang nào vượt quá 13% và một phần ba số người nói đến từ bên ngoài tám bang lớn nhất. Các phần công khai và riêng tư khớp chặt chẽ với nhau trên cả hai.

Ranh giới các bang của Ấn Độ được vẽ theo ranh giới ngôn ngữ, vì vậy quận và bang mang tín hiệu giọng nói thực sự, đó là lý do tại sao các trường này được công bố thay vì bị tóm tắt lược bỏ. Phân tích loại này đã được báo cáo ở quy mô lớn cho ASR Ấn Độ: tỷ lệ lỗi cấp quận dao động từ khoảng 4% đến 44%, với các khu vực ít được đại diện nằm xa phía sau vành đai Hindi và các đô thị, cộng với việc phân tách theo chất lượng âm thanh, tốc độ nói, thời lượng phát ngôn, giới tính, độ tuổi và thiết bị. Những lần chạy đó là trên một bộ tiêu chuẩn đóng. Monsoon làm cho cùng một loại phân tích đó trở nên khả thi trên một tập kiểm thử bảng xếp hạng công khai.

Thu thập và kiểm soát chất lượng

monsoon_collection_and_annotation_pipeline

Độ bao phủ địa lý rộng đòi hỏi việc tuyển dụng trên hàng trăm quận thay vì các phiên dài hơn từ ít người nói hơn, và việc tuyển dụng phân tán ở quy mô này đưa ra các chế độ lỗi mà một bộ sưu tập nhỏ hơn không gặp phải: người đóng góp thao túng nhiệm vụ, âm thanh phát lại được gửi dưới dạng giọng nói trực tiếp và chú thích thiếu tập trung. Mỗi vấn đề đều được giải quyết bằng một bước kiểm tra rõ ràng.

Tuyển dụng và ghi âm: Những người đóng góp được tuyển dụng thông qua cộng đồng Voice Arena, một nền tảng kỹ thuật số toàn cầu có phạm vi tiếp cận đến các quận nông thôn và bán đô thị mà các tập dữ liệu giọng nói hiếm khi bao phủ. Các cặp đôi sau đó ghi lại các cuộc hội thoại hai người qua giao diện ngang hàng (peer-to-peer), hai kênh, về các chủ đề hàng ngày được chỉ định. Những người đóng góp sử dụng thiết bị cầm tay và kết nối của riêng họ. Nhiều thiết bị trong số đó là thiết bị cấp thấp trên băng thông không ổn định, đó là lý do tại sao tình trạng đó hiện diện trong âm thanh được phát hành thay vì bị lọc bỏ. Những người đóng góp tiềm năng đã hoàn thành bài kiểm tra trình độ ngôn ngữ trước khi được cấp quyền truy cập ghi âm, được trả thù lao và cung cấp sự đồng ý có hiểu biết bao gồm việc sử dụng trong đào tạo và phân phối. Giới hạn thời lượng mỗi người nói, được hiệu chỉnh theo ngôn ngữ dựa trên quy mô dân số và phân bổ địa lý của người nói, đã ngăn chặn một số ít người đóng góp tích cực thống trị một ngôn ngữ hoặc khu vực; hơn một nửa số người nói trong các tập này chỉ đóng góp đúng một phân đoạn.

Khơi gợi: Việc khơi gợi lời nói tự phát ở quy mô lớn gây ra khó khăn riêng, vì những người đóng góp có xu hướng đưa ra các phản hồi ngắn và thưa thớt mà không có hướng dẫn có cấu trúc. Do đó, mỗi cuộc hội thoại được bắt đầu bằng một gợi ý tường thuật mở và các câu hỏi tiếp theo được tiết lộ dần dần, trải dài trên các lĩnh vực bao gồm du lịch, chăm sóc sức khỏe, nông nghiệp, giáo dục và dịch vụ kỹ thuật số, hướng dẫn cuộc trao đổi theo hướng mô tả mở rộng mà không cần kịch bản. Các chủ đề ứng viên được tạo bằng các mô hình ngôn ngữ lớn, sau đó được xem xét và bản địa hóa bởi các nhà ngôn ngữ học bản ngữ.

Kiểm soát chất lượng: Mọi bản ghi âm đều vượt qua một loạt các kiểm tra sàng lọc trước khi phiên âm. Ngôn ngữ nói được xác minh dựa trên ngôn ngữ được chỉ định bằng cách sử dụng các mô hình nhận dạng ngôn ngữ được huấn luyện trên dữ liệu do con người chú thích trên hơn 30 ngôn ngữ. Giới tính của người nói được xác nhận dựa trên nhãn tự báo cáo bằng cách sử dụng một bộ phân loại chuyên dụng, được áp dụng như một sự xác thực cho báo cáo tự thân thay vì thay thế nó. Một mô hình khác phân biệt cuộc hội thoại tự phát thực sự với âm thanh được ghi sẵn hoặc phát lại. Ước tính tỷ lệ tín hiệu trên nhiễu (SNR) đã loại bỏ các bản ghi âm bị suy giảm vượt quá mức có thể hiểu được, trong khi tiếng ồn nền môi trường tự nhiên được cố tình giữ lại để duy trì tính chân thực về âm thanh của lời nói trong môi trường thực tế. Các bản ghi âm vượt qua các kiểm tra này được phân đoạn bằng cách phát hiện hoạt động giọng nói (VAD), chia nhỏ tại hai giây im lặng liên tục hoặc tại giới hạn mềm mười lăm giây đóng lại ở khoảng lặng tiếp theo được phát hiện. Việc phân đoạn được áp dụng độc lập cho mỗi kênh, vì vậy mọi phân đoạn đều là đơn kênh và đơn người nói. Các phân đoạn sau đó đã vượt qua kiểm tra DNSMOS P.808.

Phiên âm: Các bản ghi chép tham chiếu là công việc của con người. Bản thảo đầu tiên được tạo bởi các mô hình ASR nội bộ được huấn luyện trên dữ liệu trong miền, không có mô hình nào trong số đó xuất hiện trên bất kỳ bảng xếp hạng công khai nào, vì vậy không có hệ thống nào được đánh giá trên các tập này đóng góp vào các tham chiếu mà nó được chấm điểm. Mọi giai đoạn tiếp theo đều được thực hiện bởi các nhà ngôn ngữ học bản ngữ theo quy trình năm cấp độ được xây dựng trên sự phân công lao động nghiêm ngặt, trong đó mỗi vòng sửa lỗi được theo sau bởi một vòng xác minh độc lập do một người chú thích khác thực hiện, vì vậy không có nhà ngôn ngữ học nào kiểm tra đầu ra của chính mình. Một nhà ngôn ngữ học trước tiên sửa bản thảo từng phân đoạn dựa trên tín hiệu âm thanh; người thứ hai xác minh lại và gắn cờ các bất đồng còn sót lại. Các cấp độ tiếp theo lặp lại chu kỳ này với những người chú thích mới, dần dần giải quyết các hiện tượng thực hiện ngữ âm mơ hồ, ranh giới chuyển đổi mã, thực thể có tên và tính nhất quán chính tả giữa các biến thể chính tả. Các chữ số được viết thành từ, để bản ghi chép tương ứng trực tiếp với những gì đã được nói. Các phân đoạn vẫn bị gắn cờ ở cấp độ cuối cùng được trả lại để phiên âm lại trước khi được chấp nhận. Hành vi của người chú thích được giám sát tự động trong suốt quá trình, gắn cờ các bài nộp chứa các ký tự nằm ngoài tập lệnh mục tiêu, các ký tự hoặc từ lặp lại không tự nhiên và số lượng chỉnh sửa thấp hoặc cao bất thường.

Biến thể vùng miền

Sau đây là một ví dụ, chạy trên phần công khai tiếng Anh Ấn Độ, để cho thấy loại đánh giá mà siêu dữ liệu có thể thực hiện được. Đây không phải là phát hiện mà các tập dữ liệu tồn tại để mang lại; đó là minh họa về những gì trở nên có thể trả lời được khi mỗi clip chứa một người nói.

Tám mô hình trên bảng xếp hạng đạt mức WER từ 4,81 đến 4,99 trên tập này. Đó là 0,18 điểm từ tốt nhất đến tệ nhất, nằm trong phạm vi mà năm giờ có thể giải quyết. Được xếp hạng trên tập dữ liệu, chúng là cùng một mô hình.

ASRHugging FaceNhận diện giọng nóiAI đa ngôn ngữNam bán cầu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.