Google DeepMind: Blog
85

Mô hình

Google DeepMind ra mắt mô hình SL2T: Chuyển đổi ngôn ngữ ký hiệu thành văn bản theo thời gian thực

(giờ Việt Nam)

Tóm tắt AI

Google DeepMind giới thiệu mô hình SL2T đột phá, hỗ trợ người khiếm thính giao tiếp dễ dàng hơn bằng cách chuyển đổi ngôn ngữ ký hiệu sang văn bản ngay lập tức.

Bản dịch AI

Putting sign language AI into users’ hands

Ngày 12 tháng 8 năm 2026 Các mô hình

Nhóm Ngôn ngữ Ký hiệu Google DeepMind

Giới thiệu sign-language-to-text (SL2T), mô hình đột phá của chúng tôi nhằm cung cấp sức mạnh cho các tính năng ngôn ngữ ký hiệu mới dành cho người khiếm thính và người nghe kém.

Khả năng xử lý ngôn ngữ nói của AI đã tiến bộ vượt bậc trong những thập kỷ gần đây, cho phép thực hiện dịch thuật tự động, đọc chính tả và các giao diện hội thoại mang lại cảm giác tự nhiên cho người nghe bình thường. Tuy nhiên, cuộc cách mạng công nghệ này vẫn chưa tiếp cận được hơn 200 ngôn ngữ ký hiệu trên thế giới — và khoảng 70 triệu người khiếm thính và người nghe kém đang sử dụng chúng.

Hôm nay, chúng tôi giới thiệu một mô hình dịch ngôn ngữ ký hiệu sang văn bản (SL2T) đa ngôn ngữ quy mô lớn, đánh dấu một bước đột phá về chất lượng và tính tổng quát. Với mô hình này, lần đầu tiên chúng tôi đưa AI ngôn ngữ ký hiệu ra khỏi phòng thí nghiệm và tích hợp vào các sản phẩm tiêu dùng: SL2T cung cấp sức mạnh cho tính năng đọc chính tả từ ký hiệu sang văn bản trong Gboard và Live Transcribe trên Pixel 11, bắt đầu với Ngôn ngữ Ký hiệu Mỹ (ASL) sang tiếng Anh. Nhiều thiết bị hơn sẽ sớm được hỗ trợ và các ngôn ngữ bổ sung sẽ tiếp nối.

Tương tự như cách người nghe bình thường có thể sử dụng tính năng đọc chính tả để nói thay vì gõ phím, tính năng này cho phép người dùng khiếm thính thực hiện ký hiệu vào điện thoại ở bất cứ đâu họ thường gõ văn bản. Bạn có thể ký hiệu để tìm kiếm trên web, soạn thảo tin nhắn hoặc tài liệu, và yêu cầu Gemini giải quyết các truy vấn hoặc thực hiện tác vụ. Trong Live Transcribe, bạn có thể ký hiệu để phản hồi trong các cuộc hội thoại thay vì phải gõ qua lại. Theo những người thử nghiệm của chúng tôi, việc ký hiệu bằng ASL nhanh hơn, tự nhiên hơn và thú vị hơn so với việc gõ bằng tiếng Anh.

Tính năng chuyển đổi từ ký hiệu sang văn bản, được vận hành bởi SL2T, cho phép người dùng ký hiệu vào điện thoại ở bất cứ đâu họ thường gõ văn bản.

Tại sao ngôn ngữ ký hiệu lại quan trọng

Ngôn ngữ ký hiệu là ngôn ngữ chính của các cộng đồng người khiếm thính trên khắp thế giới và là nền tảng cho bản sắc văn hóa của người khiếm thính. Có sự đa dạng lớn giữa những người khiếm thính về trình độ ký hiệu, nói, đọc và viết, vì vậy việc hỗ trợ tiếp cận ở mọi phương thức là rất quan trọng. Người khiếm thính có thể hưởng lợi từ việc xử lý ngôn ngữ ký hiệu giống như cách người nghe bình thường hưởng lợi từ việc xử lý ngôn ngữ nói, hơn nữa công nghệ này còn mở ra những khả năng mới để thu hẹp khoảng cách giao tiếp giữa cộng đồng người khiếm thính và người nghe bình thường. Mặc dù có cơ hội tạo ra tác động xã hội tích cực này, nhưng tiến bộ trong AI ngôn ngữ ký hiệu vẫn còn chậm — cả vì việc xây dựng AI cho ngôn ngữ ký hiệu đặt ra những thách thức phức tạp và vì tồn tại những quan niệm sai lầm phổ biến về cách thức hoạt động của chính các ngôn ngữ này.

So với việc phiên âm ngôn ngữ nói, dịch ngôn ngữ ký hiệu đặt ra hai thách thức cốt lõi. Thứ nhất, phiên âm lời nói là vấn đề thực hiện ánh xạ tuần tự từ âm thanh sang văn bản trong cùng một ngôn ngữ, trong khi ngôn ngữ ký hiệu là các ngôn ngữ tự nhiên, độc lập với ngữ pháp và từ vựng riêng biệt. Do đó, chúng đòi hỏi dịch máy thực sự thay vì một quy trình tuần tự chuyển đổi từ ký hiệu sang từ ngữ. Thứ hai, mô hình phải học cách “nhìn” và hiểu chuyển động vật lý. Ngôn ngữ ký hiệu truyền tải ý nghĩa thông qua các chuyển động đồng thời của bàn tay, cánh tay, thân mình, đầu và khuôn mặt. Việc theo dõi chính xác các chuyển động này ở tốc độ khung hình cao là một nhiệm vụ thị giác máy tính khó khăn và đòi hỏi khả năng tính toán lớn.

Với bối cảnh này, dễ hiểu tại sao một số nỗ lực ban đầu về công nghệ ngôn ngữ ký hiệu, như găng tay ngôn ngữ ký hiệu, lại bị hạn chế về cơ bản: ngôn ngữ ký hiệu không đơn thuần là “tiếng Anh trên đôi tay”. Chúng đòi hỏi nhận thức thị giác phức tạp về các chuyển động toàn thân tinh vi và dịch thuật ngôn ngữ hoàn chỉnh. SL2T được thiết kế để mang lại cả hai điều đó.

SL2T xem các đầu vào ngôn ngữ ký hiệu như các điểm trên cơ thể người ký hiệu và dịch chúng thành các đầu ra văn bản dạng dòng. Ví dụ từ bộ chuẩn FLEURS-ASL.

Cách thức hoạt động của SL2T

Chúng tôi đã xây dựng SL2T bằng cách kết hợp phương pháp tiếp cận lấy người dùng làm trung tâm, có hiểu biết về văn hóa với việc mở rộng quy mô dữ liệu khổng lồ. Mô hình được huấn luyện trên hơn 100.000 giờ dữ liệu trên hơn 50 ngôn ngữ ký hiệu — với khoảng một phần tư dữ liệu là ASL. Việc huấn luyện đồng thời trên các ngôn ngữ, phương ngữ và trình độ thông thạo khác nhau giúp mô hình học được các cấu trúc cơ bản được chia sẻ, vượt trội hơn các mô hình đơn ngôn ngữ trong các thử nghiệm của chúng tôi.

Để bảo vệ quyền riêng tư của người dùng, SL2T xem ngôn ngữ ký hiệu như một chuỗi các vị trí điểm mốc trên cơ thể thay vì nguồn cấp dữ liệu camera thô. Một mô hình trên thiết bị (MediaPipe Holistic) theo dõi vị trí các điểm trên người ký hiệu, và chỉ những tọa độ hình học này được gửi đến máy chủ để dịch, cho phép video gốc bị loại bỏ ngay lập tức.

SL2T dịch chuỗi tọa độ này trực tiếp thành văn bản, bỏ qua các chú thích trung gian được gọi là “glosses” vốn được sử dụng rộng rãi trong các công trình nghiên cứu trước đây về dịch ngôn ngữ ký hiệu. Glosses không nắm bắt được các khía cạnh phong phú, phi tuyến tính của ngôn ngữ ký hiệu như các dấu hiệu phi thủ công và cấu trúc không gian. Việc dịch trực tiếp từ các điểm mốc giúp loại bỏ các giới hạn từ vựng nhân tạo và cho phép chất lượng dịch thuật tăng tỉ lệ thuận với dữ liệu.

SL2T là mô hình dịch ngôn ngữ ký hiệu có năng lực nhất cho đến nay theo các bộ chuẩn chính như FLEURS-ASL (sd-test), đánh giá chất lượng dịch từ ASL sang tiếng Anh. SL2T đạt điểm zero-shot ấn tượng là 70 BLEURT, cao hơn đáng kể so với bất kỳ điểm số nào được báo cáo trước đây. Nhưng việc tối ưu hóa các bộ chuẩn học thuật thôi chưa đảm bảo khả năng sử dụng trong các ứng dụng thực tế, vì vậy chúng tôi đã nỗ lực giải quyết các vấn đề thực tiễn như giảm thiểu độ trễ truyền tải, ngăn chặn tình trạng "ảo giác" (hallucination) đối với các đầu vào không phải ký hiệu, đảm bảo tính công bằng cho 10% người ký hiệu thuận tay trái, và cải thiện hiệu suất cho việc ký hiệu bằng một tay, vốn được sử dụng khi cầm điện thoại thông minh bằng tay còn lại.

Các ví dụ từ bộ chuẩn FLEURS-ASL. SL2T dịch chính xác ASL phức tạp sang tiếng Anh lưu loát. Vẫn còn những lỗi thỉnh thoảng xảy ra ở các ký hiệu hiếm, đánh vần bằng ngón tay nhanh ("prey" → "grey"), các cấu trúc bị động, các mô tả phân loại (bỏ qua "claws"), và thì không có ngữ cảnh ("kicked off" → "start").

Xây dựng cùng cộng đồng

Chúng tôi tin vào việc xây dựng cùng với cộng đồng người khiếm thính, không chỉ là cho họ. Các góc nhìn của người khiếm thính đã định hình mọi giai đoạn của dự án này — từ khâu ý tưởng bởi Sam Sepah, một nhân viên khiếm thính tại Google, đến thu thập dữ liệu với các đối tác khiếm thính, đánh giá trong các nghiên cứu người dùng khiếm thính và đánh giá tác động của công nghệ với các chuyên gia khiếm thính.

Để hướng dẫn việc triển khai thực tế có trách nhiệm, chúng tôi đã thành lập Ủy ban Cố vấn AI Ngôn ngữ Ký hiệu (AISLAC), tập hợp nhiều tổ chức người khiếm thính toàn cầu và các chuyên gia trong lĩnh vực này. Thông qua mô hình quản trị có sự tham gia này, các cộng đồng chịu ảnh hưởng nhiều nhất bởi công nghệ của chúng tôi sẽ trực tiếp tác động đến các ưu tiên phát triển của chúng tôi. Chúng tôi đã đồng tác giả một báo cáo tác động chung cho việc phát hành SL2T 1.0 trong Gboard và Live Transcribe, trình bày minh bạch các khả năng và hạn chế hiện tại của công nghệ — một phương pháp hợp tác mà chúng tôi dự định tiếp tục cho tất cả các bản phát hành ngôn ngữ ký hiệu lớn.

Hướng tới tương lai

SL2T được xây dựng dựa trên nhiều thập kỷ nghiên cứu nền tảng trong giới học thuật và ngành công nghiệp, nhưng việc đưa đầu vào ASL lên điện thoại của người dùng chỉ mới là sự khởi đầu. Sứ mệnh của Google là sắp xếp thông tin của thế giới và làm cho thông tin đó có thể truy cập được và hữu ích trên toàn cầu. Đạt được khả năng tiếp cận phổ quát có nghĩa là đạt được sự ngang bằng hoàn toàn với các ngôn ngữ nói và viết. Nhóm của chúng tôi đang nỗ lực mở rộng công nghệ này sang các ngôn ngữ ký hiệu bổ sung, tạo ngôn ngữ ký hiệu và các khả năng AI tiên phong. Chúng tôi mong muốn chia sẻ tiến bộ của mình một cách có trách nhiệm để biến việc tiếp cận thông qua ngôn ngữ ký hiệu trở thành tiêu chuẩn trên toàn bộ bối cảnh kỹ thuật số.

Bạn có thể trải nghiệm SL2T trong Gboard và Live Transcribe trước tiên trên Pixel 11, với nhiều thiết bị hơn sẽ sớm được hỗ trợ — tất cả đều không mất thêm chi phí.

Lời cảm ơn

Công trình này được thực hiện chung bởi các nhóm từ Google DeepMind và Android. Nhóm nòng cốt phát triển mô hình SL2T bao gồm: Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang và Chris Dyer.

Nhóm Android đã tích hợp mô hình vào Gboard và Live Transcribe bao gồm: Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su và Sharlene Yuan.

Chúng tôi biết ơn sự hỗ trợ bổ sung từ Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus và Biao Zhang.

Xin gửi lời cảm ơn sâu sắc đến những người đã tham gia thử nghiệm giai đoạn đầu các mô hình của chúng tôi.

Google DeepMindNgôn ngữ ký hiệuCông nghệ hỗ trợSL2TAI nhân văn
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google DeepMind: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.