Apple Machine Learning Research
85

Tin ngành

Apple giới thiệu DiscoSign: Khung chuyển đổi văn bản sang ngôn ngữ ký hiệu dựa trên ngữ cảnh

(giờ Việt Nam)

Tóm tắt AI

Apple cùng các đối tác ra mắt DiscoSign, khung mô-đun dựa trên LLM giúp chuyển đổi văn bản sang ngôn ngữ ký hiệu Mỹ (ASL) chính xác hơn bằng cách xử lý các cấu trúc ngữ pháp phức tạp và tính nhất quán trong hội thoại.

Bản dịch AI

DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation

Tác giả: Vasileios Baltatzis‡, Mert Inan‡†**, Connor Gillis, Raja Kushalnagar§**, Lorna Quandt§**, Leah Findlater, Colin Lea

Các hệ thống xử lý ngôn ngữ ký hiệu truyền thống thường hoạt động ở cấp độ câu, bỏ qua các hiện tượng diễn ngôn quan trọng vốn là nền tảng cho việc hiểu ngôn ngữ ký hiệu. Chúng tôi giới thiệu DiscoSign, một phương pháp tính toán cho việc dịch từ văn bản sang gloss ngôn ngữ ký hiệu có nhận thức về diễn ngôn, dựa trên các nghiên cứu ngôn ngữ học. Chúng tôi giải quyết ba hiện tượng chính trong khuôn khổ dịch thuật dựa trên Mô hình ngôn ngữ lớn (LLM) dạng mô-đun của mình: (i) giải quyết tham chiếu không gian (spatial coreference resolution), nơi các thực thể duy trì vị trí không gian nhất quán trong suốt diễn ngôn; (ii) Mệnh đề Hỏi-Đáp (QACs), các cấu trúc giả chẻ (pseudocleft) phục vụ các chức năng diễn ngôn cụ thể; và (iii) tính nhất quán giữa khái niệm và gloss, đảm bảo các ánh xạ ổn định giữa các khái niệm tiếng Anh và các ký hiệu Ngôn ngữ ký hiệu Mỹ (ASL). Các thước đo dịch thuật truyền thống không nắm bắt được chất lượng ở cấp độ diễn ngôn, vì vậy chúng tôi giới thiệu một bộ các thước đo đánh giá mới được thiết kế để đánh giá từng khía cạnh của sự mạch lạc diễn ngôn mà khuôn khổ của chúng tôi giải quyết. Các thử nghiệm trên các tập dữ liệu cấp độ câu và cấp độ diễn ngôn cho thấy phương pháp xử lý có nhận thức về diễn ngôn của chúng tôi cải thiện đáng kể tính nhất quán không gian và theo dõi thực thể so với dịch thuật chỉ ở cấp độ câu, đồng thời duy trì chất lượng dịch gloss từng câu ở mức cạnh tranh. Công trình của chúng tôi thiết lập khuôn khổ hệ thống đầu tiên cho việc dịch từ văn bản sang gloss ngôn ngữ ký hiệu ở cấp độ diễn ngôn cùng với phương pháp đánh giá tương ứng.

Các bài đọc và cập nhật liên quan.

Việc phiên dịch ngôn ngữ ký hiệu bằng AI bị hạn chế do thiếu dữ liệu chú giải chất lượng cao. Các tập dữ liệu mới bao gồm ASL STEM Wiki và FLEURS-ASL chứa dữ liệu từ các phiên dịch viên chuyên nghiệp với hàng trăm giờ ghi hình nhưng vẫn chỉ được chú giải một phần, do đó chưa được tận dụng hết, một phần vì chi phí chú giải ở quy mô này là quá đắt đỏ. Trong công trình này, chúng tôi phát triển một quy trình chú giải giả (pseudo-annotation pipeline) nhận đầu vào là video ký hiệu và văn bản tiếng Anh, sau đó xuất ra một danh sách được xếp hạng…

Đọc thêm

Ngôn ngữ ký hiệu là thiết yếu đối với cộng đồng người Điếc và người khiếm thính (DHH). Các hệ thống tạo ngôn ngữ ký hiệu có tiềm năng hỗ trợ giao tiếp bằng cách dịch từ các ngôn ngữ viết, chẳng hạn như tiếng Anh, sang các video ký hiệu. Tuy nhiên, các hệ thống hiện tại thường không đáp ứng được nhu cầu của người dùng do dịch sai các cấu trúc ngữ pháp, thiếu các tín hiệu khuôn mặt và ngôn ngữ cơ thể, cũng như độ trung thực về hình ảnh và chuyển động chưa đủ. Chúng tôi giải quyết các vấn đề này…

Đọc thêm

AppleAINgôn ngữ ký hiệuLLMCông nghệ hỗ trợ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.