Quan điểm
Tôi đã tạo ra phiên bản avatar kỹ thuật số của chính mình để trò chuyện với mọi người
(giờ Việt Nam)
Tóm tắt AI
Sau khi huấn luyện một avatar tương tác để thảo luận về gian lận đầu tư, tác giả chia sẻ những suy ngẫm trái chiều về việc tạo ra các bản sao AI của chính con người.
Chính văn · Bản dịch AI

Khi Alexandru Voica, giám đốc phụ trách đối ngoại tại startup tạo video Synthesia, gửi cho tôi một đường link vào mùa hè này về thành viên mới nhất trong đội ngũ PR của họ, tôi đã rất ngạc nhiên. Đó là một hình đại diện ảo tương tác của anh ấy, được huấn luyện để trả lời các câu hỏi báo chí phổ biến về Synthesia, như công ty làm gì và hoạt động ra sao. Một ngày trước đó, tôi đã tham gia một buổi tọa đàm nơi các chuyên gia PR hỏi tôi rằng liệu tôi có phiền nếu các bài giới thiệu sử dụng văn bản do AI tạo ra hay không. Nhưng hình đại diện của Alexandru còn vượt xa điều đó — đối với tôi, đây dường như là "trùm cuối" của việc sử dụng AI trong ngành PR.
Vào tháng 9, Synthesia đã mời tôi đến văn phòng mới của họ tại New York. Vốn có trụ sở tại Vương quốc Anh, Synthesia là một startup hình đại diện kỹ thuật số đang rất "hot" bên cạnh những cái tên khác như D-ID, HeyGen và Colossyan. Công ty đã đạt mức định giá 4 tỷ USD vào đầu năm nay và cho biết năm ngoái họ đã vượt mốc 100 triệu USD doanh thu định kỳ hàng năm (ARR).
Synthesia cho phép các doanh nghiệp xây dựng các video đào tạo tương tác với hình đại diện AI và gần đây đã ra mắt một sản phẩm có tên là Roleplay Sessions, cho phép nhân viên thực hành, ví dụ như các bài thuyết trình bán hàng, với một hình đại diện AI tương tác có khả năng phản hồi và chấm điểm câu trả lời của họ.
Khi tôi đến dự lễ khai trương văn phòng mới và họ hỏi liệu tôi có muốn sở hữu hình đại diện AI của riêng mình không, tôi đã không ngần ngại đồng ý. Tất nhiên là tôi muốn có một bản sao kỹ thuật số của chính mình rồi. Hôm đó trang phục của tôi rất đẹp và tóc tai cũng gọn gàng.
Cho đến khi gặp bản sao kỹ thuật số của mình, tôi vốn dĩ thờ ơ với các hình đại diện, nhưng tôi cảm thấy chúng chắc chắn sẽ trở thành một phần của cuộc sống trực tuyến hàng ngày. Tôi từng nghe nói về những người trên Instagram tạo ra các hình đại diện giống hệt mình để giúp họ làm nội dung xã hội. Tôi thấy tất cả những điều này rất thú vị, và có lẽ đó là lý do tại sao bây giờ tôi không ngần ngại giới thiệu với bạn bản sao kỹ thuật số của mình. Đây là lần đầu tiên Synthesia tạo ra một hình đại diện kỹ thuật số cho một nhà báo (hoặc cho bất kỳ ai, nói chung, ngoài Voica). Nó được huấn luyện dựa trên bài viết của tôi về lý do tại sao các startup được đầu tư mạo hiểm lại gian lận nhiều hơn so với các startup không được đầu tư mạo hiểm và sẽ chỉ trả lời các câu hỏi liên quan đến bài viết đó.
Dưới đây, chỉ cần nhấn “start in a new window” để bắt đầu.
Bạn có thể hỏi nó những câu như:
- Tại sao tôi quyết định viết bài này?
- Bài báo nghiên cứu nói về điều gì?
- Các nhà nghiên cứu đã tìm ra điều gì?
Để tạo ra nó, tôi đã bước vào một studio phim mini nằm ngay trong văn phòng Synthesia, nơi họ chụp vô số ảnh của tôi và ghi lại đoạn ghi âm giọng nói dài hai phút. Tôi đã phải đồng ý cho việc tạo ra các hình đại diện này và thế là, Dom kỹ thuật số đã ra đời. Họ tạo ra một hình đại diện cá nhân cho tôi (loại chỉ đọc bất kỳ kịch bản nào tôi đưa) — có và không có kính — và họ tạo ra hai hình đại diện tương tác cho tôi (loại có thể đối thoại và lắng nghe tôi), cũng có và không có kính.
Chúng tôi đã chọn một bài báo để huấn luyện hình đại diện tương tác, và sau đó một trong các nhóm đã xây dựng hình đại diện tương tác của tôi, được vận hành bởi sự kết hợp giữa các mô hình chuyển đổi giọng nói thành văn bản, video, ngôn ngữ và văn bản thành giọng nói. Hệ thống công nghệ của hình đại diện của tôi bao gồm các mô hình video và giọng nói của riêng Synthesia, mặc dù công ty cũng cho phép khách hàng chọn các giải pháp thay thế từ các phòng thí nghiệm khác như Cartesia, ElevenLabs, Google hoặc OpenAI. Các doanh nghiệp cũng có thể chọn lưu trữ hình đại diện của họ trên bất kỳ nền tảng đám mây nào họ muốn hoặc trả phí để Synthesia lưu trữ giúp.
Mô hình chuyển đổi giọng nói thành văn bản biến những gì mọi người nói thành văn bản, mô hình ngôn ngữ tác nhân hiểu được văn bản và có thể thực hiện các hành động dựa trên đó, mô hình chuyển đổi văn bản thành giọng nói biến phản hồi thành âm thanh, và cuối cùng là mô hình video (do Synthesia xây dựng) tạo hoạt ảnh cho hình đại diện khi nó nói.
Nhìn chung, Synthesia xây dựng ba loại sản phẩm — một nền tảng tạo và phân phối video với các hình đại diện cổ điển, nơi người dùng nhập kịch bản và hình đại diện sẽ đọc lại; một nền tảng tác nhân có tên là Sessions, nơi mọi người có thể tương tác với các hình đại diện trong các cuộc khảo sát hoặc đóng vai (roleplay); và một nền tảng API nơi mọi người có thể lấy các mô hình video và giọng nói của Synthesia để kết hợp với các dịch vụ công nghệ khác nhằm xây dựng hình đại diện tương tác hoặc các loại sản phẩm khác.
Đội ngũ Synthesia mất vài ngày để tạo ra các hình đại diện của tôi. Tôi đã thử nghiệm với các hình đại diện cá nhân trước và nhập một kịch bản khá chung chung để xem giọng nói AI của mình nghe như thế nào. Tôi để nó nói về việc mùa thu đã đến New York, thời điểm yêu thích nhất trong năm của tôi. Giọng nói khá chính xác, và tôi rất vui vì nó không thu lại bất kỳ sự khàn giọng nào mà tôi mắc phải khi ghi âm mẫu giọng nói của mình.
Tôi đã cho một vài người bạn không làm trong ngành công nghệ xem và họ thấy nó vừa thú vị vừa đáng sợ.
Sau đó, tôi cho họ xem hình đại diện tương tác của mình, vốn mang tính xác định, nghĩa là nó chỉ nói những gì nó được huấn luyện để phản hồi. Trong trường hợp này, đó là bài viết về gian lận đầu tư mạo hiểm của tôi. Tôi hỏi nó những câu như tôi đã làm ở đâu trước khi đến TechCrunch và tôi sống ở khu vực nào của New York, nhưng mỗi lần như vậy, nó đều hướng tôi quay lại với bài viết đó.
Bạn bè tôi không nghĩ giọng nói đó giống tôi lắm và cho rằng độ giống không bằng hình đại diện cá nhân, nhưng dù sao thì nó cũng đủ gần để gây cảm giác hơi rợn người. Mẹ tôi gọi đó là "tuyệt vời", một lời khen khá cao từ bà. Bà và bố tôi cứ cố gắng hỏi nó những câu "chỉ họ mới biết" về tôi — nhưng mô hình không trả lời, mỗi lần đều chuyển hướng họ về bài viết gian lận đầu tư mạo hiểm.
"Mẹ không nhớ là đã sinh ra hai đứa con giống hệt nhau," bà nói đùa sau khi thử nghiệm mô hình.
Trải nghiệm này khiến tôi suy nghĩ về tương lai của ngành báo chí. Liệu mọi người có ổn không khi bật tin tức lên và thấy nó được trình bày bởi một hình đại diện? Một nhà đầu tư đã nói với tôi là không ngay lập tức. Chắc chắn hiện nay có rất nhiều sự phản đối đối với nội dung AI rác đã xâm nhập vào mạng xã hội và các nền tảng chia sẻ tin tức khác. Nhưng những người khác mà tôi hỏi lại không chắc chắn như vậy. Liệu các hình đại diện có thể tăng cường — hoặc thậm chí thay thế — các nhà báo? Liệu các CEO có muốn nói chuyện với một hình đại diện AI của nhà báo hơn là một con người bằng xương bằng thịt?
Điều tôi thích ở sự nghiệp của mình là kết nối với mọi người, viết các câu chuyện và nghiên cứu các chủ đề mới. Nhưng phần quan trọng nhất của báo chí là sự tin tưởng. Điều đó dường như không bao giờ có thể thuê ngoài cho một AI.
Ngoài báo chí, tôi tin rằng ý tưởng tự nhân bản chính mình có thể rất hấp dẫn. Không còn cảnh phải bù đầu giải quyết công việc sau kỳ nghỉ lễ hay kỳ nghỉ phép, vì một phiên bản của bạn luôn có thể ở đó để trả lời các câu hỏi.
Chúng ta sẽ phải chờ xem việc sử dụng hình đại diện phát triển như thế nào trong giới doanh nghiệp Mỹ. Nhưng giờ đây khi đã có hình đại diện của riêng mình, tôi có những cảm xúc lẫn lộn. Sau khi vượt qua sự mới lạ ban đầu, tôi quan sát kỹ hình đại diện của mình sau khi nó ngừng nói và chờ đợi — chờ đợi điều gì, tôi cũng không chắc. Có lẽ tôi đang chờ nó chớp mắt. Hoặc nói điều gì đó mới mẻ, hoặc mỉm cười, hoặc chỉ để tôi biết rằng nó có nhận thức.
Vì các bản sao kỹ thuật số của tôi mang tính xác định, chúng sẽ không bao giờ làm điều đó. Nhưng tôi có thể thấy việc một người rơi vào trạng thái "tâm thần AI" dễ dàng như thế nào với một hình đại diện không mang tính xác định, nghĩa là được vận hành bởi một chatbot có thể tự do suy luận.
Tôi đã nói với một nhà đầu tư rằng, bất kể tương lai của digital twins sẽ ra sao, tôi dự đoán thế hệ của mình, Gen Z, có lẽ sẽ không quen với chúng. Chúng mang cảm giác khoa học viễn tưởng: Mọi thứ chúng ta từng thấy trong phim ảnh giờ đã hiện hữu ở đây. Nhưng tôi phải thừa nhận rằng, tôi thấy các digital avatar ít gây khó chịu hơn so với robot hình người. Ít nhất là với một avatar, nếu mọi thứ trở nên kỳ quặc, tôi luôn có thể đăng xuất.
Tuy nhiên, trước khi điều đó xảy ra, đây là avatar cá nhân của tôi, sẽ tóm tắt cho bạn tất cả những tin tức hàng đầu trên trang web của chúng tôi trong tuần này!
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.