Thủ thuật
Storyteller: Giải pháp tự động hóa trải nghiệm đọc sách kết hợp nghe (Immersive Reading)
(giờ Việt Nam)
Tóm tắt AI
Storyteller sử dụng thuật toán căn chỉnh tự động để đồng bộ hóa sách điện tử và sách nói, cho phép trình đọc làm nổi bật văn bản theo thời gian thực. Công cụ này giải quyết thông minh các vấn đề về sai lệch chương hồi hoặc thay đổi từ ngữ mà các phương pháp thủ công trước đây không làm được.
Bản dịch AI
Thuật toán forced alignment (căn chỉnh cưỡng bức) của Storyteller hoạt động như thế nào.
Tất cả trẻ em, trừ một đứa, đều lớn lên. Chúng sớm biết rằng mình sẽ lớn lên, và cách Wendy biết điều đó như sau. Một ngày nọ khi cô bé lên hai, cô bé đang chơi trong vườn, hái một bông hoa rồi chạy đến chỗ mẹ. Tôi cho rằng lúc đó trông cô bé hẳn là rất đáng yêu, vì bà Darling đã đặt tay lên tim mình và thốt lên: "Ôi, sao con không thể mãi như thế này!" Đó là tất cả những gì họ trao đổi về chủ đề này, nhưng từ đó về sau, Wendy biết rằng mình phải lớn lên. Bạn luôn biết điều đó sau khi lên hai. Hai tuổi là khởi đầu của sự kết thúc.
Peter và Wendy
J. M. Barrie
Storyteller hiện đã trở thành một hệ sinh thái phần mềm rộng lớn, với ứng dụng web full-stack, ứng dụng native cho Android và iOS, các plugin cho KOReader, cùng các ứng dụng sắp ra mắt cho macOS, watchOS và tvOS. Chúng tôi đang trong giai đoạn thử nghiệm alpha và beta cho các bản phát hành v3 của những ứng dụng trên, hứa hẹn mang đến giao diện người dùng được cập nhật, một bộ tính năng quản lý thư viện mới khổng lồ và nhiều hơn thế nữa. Chúng tôi rất hào hứng được giới thiệu những gì mình đã và đang thực hiện!
Nhưng cốt lõi của Storyteller chính là thuật toán căn chỉnh. Storyteller có thể lấy một ebook và một audiobook mà bạn cung cấp để căn chỉnh chúng, tìm ra vị trí của từng từ trong ebook được đọc ở đâu trong audiobook. Nó thực hiện việc này một cách tự động mà không cần bạn phải nhập liệu gì thêm. Sau đó, nó sử dụng hệ thống đồng bộ hóa âm thanh tích hợp trong đặc tả EPUB, gọi là Media Overlays, để nhúng thông tin âm thanh và đồng bộ hóa vào tệp EPUB. Điều đó cho phép bạn đọc sách một cách đắm chìm, với ứng dụng đọc sách làm nổi bật từng câu khi được người dẫn chuyện đọc, giống như trong bản demo ở trên (đang sử dụng các bản căn chỉnh thực tế từ Storyteller!).
Ban đầu, Storyteller chỉ đơn giản là một tập lệnh Python. Nó nhận một tệp audiobook và một tệp ebook, rồi xuất ra một tệp ebook mới có chứa siêu dữ liệu đồng bộ hóa âm thanh. Vào thời điểm đó, có rất ít ứng dụng đọc sách (và không có thiết bị đọc sách nào) có thể xử lý các tệp này, vốn sử dụng đặc tả EPUB Media Overlay để vận hành. Tôi thường chạy tập lệnh trên máy tính của mình, sao chép tệp EPUB thu được vào điện thoại, rồi sử dụng tính năng hỗ trợ Media Overlay còn sơ khai của BookFusion để đọc và nghe sách của mình.
Hồi đó, tôi hoàn toàn không biết gì về lĩnh vực forced alignment mà mình đang vô tình lao đầu vào. Thuật toán căn chỉnh đầu tiên của tôi là một cấu trúc lỏng lẻo với các vòng lặp while lồng nhau vụng về. Tôi cảm thấy như mình đang mò mẫm trong bóng tối, biết rằng có lẽ có ánh sáng ở cuối đường hầm nhưng lại không thể nhìn thấy nó.
Những thách thức
Tuy nhiên, tôi đã tìm ra một vài hiểu biết trong quá trình thực hiện. Các công cụ forced alignment hiện có, ngay cả những công cụ được thiết kế cho nhiệm vụ cụ thể là căn chỉnh ebook và audiobook, đều gặp khó khăn với một vài thách thức phổ biến trong sách, và ngay cả nỗ lực đầu tiên còn non trẻ của tôi cũng đã xử lý được những vấn đề này (với mức độ thành công khác nhau):
Thứ tự chương
Ebook và audiobook có thể (và thường xuyên) có thứ tự chương khác nhau. Ví dụ, nội dung được coi là phần đầu sách (frontmatter) trong ebook, như lời đề tặng, có thể được đọc ở cuối audiobook, vì audiobook thường cố gắng bắt đầu ngay với nội dung chính.
Tress of the Emerald Sea
Brandon Sanderson
MỘT HÀNH TRÌNH ĐÁNG NHỚ.
Khi tôi ngồi xuống viết cuốn sách này một cách ngẫu hứng, tôi không hề biết toàn bộ dự án sẽ đi đến đâu…
lời cảm ơn. một hành trình đáng nhớ.
Sự tồn tại của chương
Mỗi định dạng gần như chắc chắn sẽ có những chương mà định dạng kia hoàn toàn thiếu. Phụ lục, lời nói đầu, mục lục — những phần này hầu như luôn bị bỏ qua trong audiobook. Và audiobook cũng thường có những chương nhỏ không tồn tại trong ebook.
You Just Need to Lose Weight
Aubrey Gordon
Cuốn sách này đã có thể hoàn thành nhờ sự chăm chỉ và lòng hào phóng phi thường của rất nhiều người.
Các đoạn bị bỏ qua
Đôi khi các đoạn nội dung nhỏ hơn sẽ bị bỏ qua trong phần đọc audiobook, hoặc audiobook sẽ chứa nội dung không có trong ebook, chẳng hạn như mô tả về một hình ảnh hoặc đồ họa.
Siddhartha
Herman Hesse
dịch bởi Hilda Rosner
Đó là những suy nghĩ của Siddhartha; đó là cơn khát, là nỗi buồn của chàng.
Chàng thường tự lặp lại những lời từ một trong các bộ Chandogya-Upanishad. “Sự thật là, tên của Brahman là Satya. Quả thực, ai biết được điều đó sẽ bước vào thế giới thiên đường mỗi ngày.” Thế giới thiên đường ấy thường có vẻ gần kề—nhưng chàng chưa bao giờ thực sự chạm tới, chưa bao giờ làm dịu được cơn khát cuối cùng.
Đó là những suy nghĩ của Siddhartha; đó là cơn khát, là nỗi buồn của chàng.
Thế giới thiên đường ấy thường có vẻ gần kề—nhưng chàng chưa bao giờ thực sự chạm tới, chưa bao giờ làm dịu được cơn khát cuối cùng.
Các lựa chọn từ ngữ thay thế
Đôi khi các đạo diễn hoặc người đọc audiobook sẽ cố tình chọn một từ hoặc cụm từ khác khi từ gốc khó đọc trôi chảy hoặc nghe có vẻ gượng gạo khi đọc thành tiếng. Ngoài ra, đôi khi họ cũng mắc lỗi!
You Didn’t Hear This From Me
Kelsey McKinney
Đọc cuốn sách này, ví dụ, sẽ không giúp bạn nuôi sống gia đình hay bảo vệ cơ thể bạn.
Nghe cuốn sách này, ví dụ, sẽ không giúp bạn nuôi sống gia đình hay bảo vệ cơ thể bạn.
Trong số này, ngay cả các hệ thống forced alignment khá cơ bản thường có thể xử lý các lựa chọn từ ngữ thay thế mà không gặp vấn đề gì. Và các đoạn bị bỏ qua có thể là một thách thức, đặc biệt là khi âm thanh bỏ qua các đoạn trong văn bản, nhưng kết quả thường không quá tệ hại, chỉ là chưa hoàn hảo.
Nhưng việc thiếu hụt và sắp xếp lại các chương có thể là rào cản đối với nhiều hệ thống forced alignment. Các công cụ tồn tại trước Storyteller, như syncabook rất thú vị, yêu cầu người dùng phải xác định trước chương nào của ebook tương ứng với chương nào của audiobook. Đây là công việc vừa thủ công vừa khá thách thức, vì nhiều audiobook thậm chí không có siêu dữ liệu chương hoặc tệp tin riêng cho từng chương.
Tôi muốn làm tốt hơn, và điều đó có nghĩa là phải giải quyết vấn đề này. Tôi cần một thuật toán tìm kiếm.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.