Nghiên cứu
Apple ra mắt kiến trúc tổng hợp âm thanh siêu tiết kiệm bộ nhớ cho Siri
(giờ Việt Nam)
Tóm tắt AI
Apple giới thiệu kiến trúc tổng hợp giọng nói mới cho Siri với mức tiêu thụ bộ nhớ chỉ 21MB, giúp cải thiện đáng kể độ tự nhiên và cảm xúc của giọng đọc trên thiết bị.
Bản dịch AI

Tác giả: Dongseong Hwang*, Prasanth Yadla*, Kaan Elgin*, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen
Siri Expressive Voices tổng hợp giọng nói phong phú, có thể tùy chỉnh trong thời gian thực và hoàn toàn trên thiết bị, được vận hành bởi AFM 3 Core Advanced, mô hình nền tảng trên thiết bị mạnh mẽ nhất của Apple. Nghiên cứu này trình bày kiến trúc tổng hợp âm thanh tiết kiệm bộ nhớ đằng sau khả năng đó: một bộ giải mã token (detokenizer) chuyển đổi các token âm thanh ngữ nghĩa do mô hình nền tảng tạo ra thành âm thanh có độ trung thực cao trong giới hạn tính toán và bộ nhớ khắt khe của Apple Matrix Coprocessor (AMX). Chúng tôi chuyển đổi các token âm thanh ngữ nghĩa sang biểu diễn lượng tử hóa vector dư (RVQ) với thiết kế ba thành phần—bộ mã hóa luồng (streaming encoder), bộ giải mã thời gian (temporal decoder) và bộ giải mã độ sâu (depth decoder)—giúp tách biệt một cách hệ thống quá trình xử lý thời gian và độ sâu. Một bộ giải mã độ sâu có thể tái sử dụng duy nhất với cơ chế điều kiện giai đoạn kiểu Diffusion Transformer (DiT) tạo ra tất cả các cấp độ RVQ một cách tự hồi quy, thay thế cho các bộ giải mã chuyên dụng cho từng cấp độ của các kiến trúc đa bộ giải mã trước đây, trong khi cơ chế chú ý cửa sổ trượt nhân quả (causal sliding window attention) với bộ nhớ đệm khóa-giá trị cửa sổ cố định mang lại độ phức tạp bộ nhớ không đổi, độc lập với độ dài chuỗi. Khi triển khai trên AMX, bộ giải mã token duy trì khoảng 10ms cho mỗi bước tạo—nhanh hơn khoảng 16 lần so với thời gian thực—với bộ nhớ runtime đỉnh chỉ khoảng ∼21MB và 329MB tài nguyên trên thiết bị, cho phép tổng hợp luồng liên tục từ 20–320 giây âm thanh cùng với mô hình nền tảng trên thiết bị. Dấu chân bộ nhớ nhỏ và không đổi này thay thế cho việc mở rộng bộ nhớ tuyến tính và bậc hai của các phương pháp dựa trên transformer và GAN truyền thống. Các nghiên cứu cắt bỏ (ablation studies) toàn diện đã xác nhận hiệu quả của các thành phần kiến trúc chính, bao gồm cơ chế điều kiện DiT, xử lý nhìn trước thời gian (temporal lookahead) và các chiến lược giải mã độ sâu thống nhất. Đánh giá chất lượng âm thanh thông qua phân tích khả năng phân biệt ngữ âm, các chỉ số chất lượng cảm nhận và ước tính chất lượng thần kinh xác nhận rằng kiến trúc được đề xuất duy trì độ trung thực của quá trình tổng hợp trong khi đạt được hiệu quả tính toán vượt trội so với các phương pháp hiện có. Kiến trúc này được triển khai thực tế như một phần của Siri Expressive Voices, hỗ trợ cải tiến giọng nói với các thanh trượt tùy chỉnh Pace và Expressivity trên các thiết bị Apple và hỗ trợ các giọng nói trợ lý tùy chỉnh. Hoạt động ở kích thước kích hoạt 1 tỷ tham số trong AFM 3 Core Advanced, nó cải thiện Điểm ý kiến trung bình (MOS) thêm +0,28 tổng thể (4,15 so với 3,87) và +0,42 đối với giọng nói hội thoại (4,24 so với 3,82) so với hệ thống chuyển văn bản thành giọng nói trên thiết bị trước đây.
Các bài đọc và cập nhật liên quan.
Thế hệ Apple Intelligence tiếp theo của chúng tôi tập trung vào người dùng, được tích hợp sâu vào hệ điều hành và vận hành bởi một kiến trúc mới táo bạo với quyền riêng tư là cốt lõi.
Trọng tâm của kiến trúc này là thế hệ thứ ba của Apple Foundation Models (AFM), một dòng gồm năm mô hình nền tảng được xây dựng tùy chỉnh với sự hợp tác của Google. Các mô hình này trải dài từ các mô hình trên thiết bị đến các mô hình dựa trên máy chủ chạy trên Private Cloud Compute…
Đọc thêm
Ngày càng có nhiều thiết bị tiêu dùng, bao gồm loa thông minh, tai nghe và đồng hồ, sử dụng giọng nói làm phương thức nhập liệu chính của người dùng. Kết quả là, các hệ thống phát hiện lệnh kích hoạt bằng giọng nói (voice trigger detection)—một cơ chế sử dụng công nghệ nhận dạng giọng nói để kiểm soát quyền truy cập vào một thiết bị hoặc tính năng cụ thể—đã trở thành một thành phần quan trọng trong quy trình tương tác của người dùng vì chúng báo hiệu sự bắt đầu của một tương tác giữa người dùng và thiết bị. Vì các hệ thống này được triển khai hoàn toàn trên thiết bị, nên có một số cân nhắc ảnh hưởng đến thiết kế của chúng, như quyền riêng tư, độ trễ, độ chính xác và mức tiêu thụ điện năng.
Đọc thêm
Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.