NVIDIA Blog
85

Tin ngành

NVIDIA mang AI thời gian thực đến với ngành phát thanh, thể thao và truyền hình trực tuyến tại IBC 2026

(giờ Việt Nam)

Tóm tắt AI

Tại sự kiện IBC ở Amsterdam, NVIDIA giới thiệu các giải pháp AI thời gian thực đột phá, hứa hẹn thay đổi cách thức sản xuất và phân phối nội dung trong ngành truyền thông toàn cầu.

Bản dịch AI

NVIDIA Brings Real-Time AI to Broadcast, Sports and Global Streaming at IBC

Tại hội nghị IBC, diễn ra từ ngày 11-14 tháng 9 tại Amsterdam, cộng đồng sáng tạo, công nghệ và kinh doanh đang cùng hội tụ để biến ý tưởng thành hành động và thảo luận về những đổi mới trong ngành truyền thông và giải trí. Hơn 44.000 người tham dự từ hơn 170 quốc gia đang tập trung để khám phá hơn 1.300 triển lãm tại hơn 14 hội trường và không gian ngoài trời, với sự góp mặt của hơn 600 diễn giả chia sẻ những thông tin chuyên sâu.

Hãy đọc tiếp để tìm hiểu thêm về những điểm nhấn của NVIDIA tại sự kiện này.

Các công ty truyền thông đang ngày càng tích hợp AI vào quy trình sản xuất trực tiếp, thể thao, tin tức và phát trực tuyến để mở khóa những thông tin chuyên sâu về hiệu suất, xác thực tính nguyên bản của video, cũng như nâng cao và bản địa hóa nội dung — tất cả đều không làm gián đoạn các môi trường phát sóng đáng tin cậy.

Tại IBC 2026 ở Amsterdam, NVIDIA đã công bố sự mở rộng lớn cho NVIDIA AI for Media — một bộ sưu tập các bộ công cụ phát triển phần mềm (SDK) tăng tốc bằng GPU, các microservice NVIDIA NIM, các playbook và blueprint giúp nâng cao hiệu ứng âm thanh, video và thực tế tăng cường cho các quy trình truyền thông và giải trí — nhằm mở ra những cách thức mới để hiểu về chuyển động, xác thực và nâng cao chất lượng video, bản địa hóa chương trình và xây dựng các ứng dụng truyền thông hỗ trợ bởi AI.

Microservice NVIDIA Synthetic Video Detector (SVD) NIM, được công bố đầu năm nay tại SIGGRAPH, giúp các tổ chức đánh giá xác suất liệu cảnh quay là nguyên bản hay do AI tạo ra, cung cấp cho các đội ngũ biên tập, xác thực nội dung, pháp y kỹ thuật số và tính toàn vẹn truyền thông một điểm phân tích bổ sung trong quy trình đánh giá của họ.

Kể từ khi ra mắt lần đầu, độ chính xác của SVD đã đạt 99,3% đối với nội dung văn bản-thành-video và 97,7% đối với nội dung hình ảnh-thành-video, với những cải thiện đặc biệt lớn trong các trường hợp hình ảnh-thành-video phức tạp.

Dalet đang tích hợp SVD vào một quy trình xác thực bảo mật, lưu trữ trên đám mây dành cho các tổ chức tin tức. Điều này cho phép các đội ngũ biên tập gửi cảnh quay qua SVD, kiểm tra và xem xét các điểm số cũng như siêu dữ liệu thu được ngay trong giao diện của Dalet.

TwelveLabs đã công bố sự sẵn sàng rộng rãi của Compliance by TwelveLabs, ứng dụng đầu tiên được xây dựng trên nền tảng trí tuệ video của công ty, giúp các đội ngũ truyền thông và phát sóng sàng lọc nội dung nhanh chóng dựa trên các tiêu chuẩn tuân thủ khu vực và tùy chỉnh. Giải pháp này tích hợp SVD để bổ sung các tín hiệu xác thực ở cấp độ khung hình và điểm tin cậy, cho phép các đội ngũ truyền thông xác định nội dung có khả năng là giả mạo trong cùng một quy trình tuân thủ.

Wowza, đơn vị sở hữu công nghệ máy chủ truyền thông Wowza Streaming Engine đang vận hành hơn 35.000 triển khai video tại hơn 170 quốc gia, sẽ phân phối SVD thông qua Wowza Video Intelligence Framework. Giải pháp này, được vận hành bởi cơ sở hạ tầng tăng tốc của NVIDIA, sẽ cho phép các đài truyền hình, nhà cung cấp dịch vụ phát trực tuyến và các tổ chức khác phân tích nguồn cấp dữ liệu video trực tiếp và trích xuất dữ liệu về các đối tượng, cảnh quay và dấu hiệu tạo bởi AI trong thời gian thực. Nó có thể được triển khai và chạy tại chỗ, tại biên, trên đám mây, trên các triển khai lai hoặc hoàn toàn tách biệt (air-gapped), giúp các tổ chức kiểm soát tốt hơn các quy trình truyền thông quan trọng.

NVIDIA 3D Body Pose ước tính vị trí và góc độ của các khớp cơ thể người ở dạng 2D và 3D từ video được quay bởi một camera duy nhất, giúp chuyển đổi chuyển động thành dữ liệu có cấu trúc mà không cần các hệ thống ghi hình dựa trên điểm đánh dấu (marker).

Đối với các tổ chức thể thao, dữ liệu đó có thể hỗ trợ theo dõi chuyển động của cầu thủ và vận động viên, phân tích cơ sinh học và hiệu suất, nâng cao chất lượng phát lại (replay), quy trình trọng tài và ra quyết định, các ứng dụng an toàn cho cầu thủ, cũng như tương tác ảo và trải nghiệm nhập vai.

Công nghệ này cũng có thể cung cấp dữ liệu chuyển động cơ thể người có cấu trúc cho các quy trình sáng tạo nội dung. Khi được ánh xạ tới một khung nhân vật tương thích, dữ liệu khớp và chuyển động có thể đóng vai trò là đầu vào cho việc dàn dựng hoạt ảnh (animation blocking), tạo bản sao kỹ thuật số (digital doubles), tái mục tiêu nhân vật và các trải nghiệm sản xuất ảo.

Vizrt đang sử dụng công nghệ Body Pose trong các môi trường studio ảo trực tiếp, với chuyển động cơ thể được theo dõi để điều khiển các hiệu ứng ánh sáng 3D thời gian thực như phản chiếu, đổ bóng và kết xuất môi trường.

Video Frame Generation (VFG) giúp chuyển động video trông mượt mà hơn bằng cách sử dụng AI tạo sinh để tạo ra các khung hình mới giữa các khung hình gốc của video. Nó có thể tăng tốc độ khung hình lên 2x hoặc 4x trong khi vẫn duy trì chất lượng hình ảnh và tính nhất quán theo thời gian, cho phép các trải nghiệm thể thao, phát lại chậm (slow-motion), truyền thông trực tiếp và các video có chuyển động cao trở nên mượt mà hơn. VFG cũng hỗ trợ chuyển đổi tốc độ khung hình và tăng cường khung hình cho các quy trình video AI tạo sinh.

Ross Video đang tích hợp VFG vào nền tảng Rio Replay của mình để tạo video quay chậm hỗ trợ bởi AI cho sản xuất thể thao.

Công việc này hỗ trợ tạo chuyển động chậm 6x cho phát lại thể thao. Quá trình phát triển đang được thực hiện để đạt mức nội suy 8x, nghĩa là các khung hình trung gian được tạo ra có thể mang lại cho đội ngũ phát lại chuyển động mượt mà hơn mà không cần mọi khung hình phải được ghi lại bởi camera nguồn có tốc độ khung hình siêu cao.

NVIDIA Video Super Resolution (VSR) sử dụng AI để nâng cấp độ phân giải video đồng thời giảm nhiễu, nhòe và các lỗi nén. Các chế độ phát trực tuyến mới cho phép các nhà phát triển lựa chọn giữa hiệu suất thời gian thực và chất lượng hình ảnh cao hơn, trong khi các điều khiển có thể tùy chỉnh giúp đạt được mức độ nâng cao mong muốn. VSR cũng bổ sung hỗ trợ video 10-bit và cải thiện hiệu suất cũng như chất lượng tổng thể. VSR hiện có sẵn thông qua NVIDIA Video Effects SDK và một microservice NIM để sử dụng trong các ứng dụng phát trực tuyến, phát sóng, hội nghị, phát video và sáng tạo nội dung.

Công nghệ này có thể hỗ trợ các trình phát video, ứng dụng hội nghị, công cụ sáng tạo, dịch vụ phát trực tuyến, bộ chuyển mã và hệ thống phát sóng thông qua một giao diện chung.

NVIDIA TrueHDR chuyển đổi video dải động tiêu chuẩn (SDR) thành đầu ra dải động cao (HDR) trong thời gian thực, đạt tới khoảng 2.000 nits trong khi vẫn bảo toàn độ tương phản cục bộ và điều chỉnh độ sáng phù hợp với nội dung.

VSR, VFG và TrueHDR có thể được kết hợp trong một quy trình hiệu ứng video duy nhất — giúp các công ty truyền thông nâng cao các thư viện nội dung hiện có cho các quy trình phát trực tuyến, chuyển mã, chơi game và sáng tạo.

Các microservice NVIDIA LipSync và Active Speaker Detection NIM giúp các nhà phát triển xây dựng hệ thống bản địa hóa cho các cuộc phỏng vấn, tin tức, thể thao, giải trí và các chương trình khác nơi có nhiều người xuất hiện trên màn hình.

LipSync biến đổi chuyển động miệng trong video đầu vào để khớp với bản âm thanh mục tiêu trong khi vẫn bảo toàn tư thế đầu, cử động chớp mắt và chuyển động cơ thể tự nhiên. Phiên bản mới cải thiện khả năng xử lý khi khuôn mặt bị che khuất và bảo toàn tốt hơn kết cấu răng, môi và khuôn mặt.

Microservice Active Speaker Detection NIM mới không còn yêu cầu phân đoạn người nói (speaker diarization) cho nhiều bản âm thanh, bổ sung tính năng phát hiện hoạt động giọng nói và mở rộng hỗ trợ triển khai microservice NIM thông qua giao diện gRPC và khả năng tương thích GPU rộng hơn.

NDI đang sử dụng NVIDIA AI for Media, bao gồm microservice NVIDIA LipSync NIM, để cho phép dịch thuật thời gian thực, lồng tiếng khớp khẩu hình và thích ứng ngôn ngữ khu vực trong các quy trình phát sóng hiện có. Bằng cách tạo ra nhiều trải nghiệm ngôn ngữ từ một luồng truyền thông chung, phương pháp này có thể giúp các đài truyền hình tiếp cận khán giả toàn cầu trong khi giảm thiểu băng thông, cơ sở hạ tầng và sự phức tạp trong sản xuất vốn thường cần thiết cho việc phân phối đa ngôn ngữ.

Studio Voice bao gồm các Microphone Profiles mới được xây dựng trên các microservice NVIDIA Studio Voice NIM, mang lại cho người dùng nhiều quyền kiểm soát hơn đối với đặc tính âm sắc của giọng nói đã được tăng cường.

Khả năng này được thiết kế để loại bỏ tiếng ồn nền, giảm vang vọng trong phòng và cải thiện độ rõ của giọng nói, sau đó định hình đầu ra đã tăng cường thành một cấu hình micro được chọn để có các cuộc hội thoại trực tiếp, phát trực tuyến, podcast và sáng tạo nội dung chỉn chu hơn.

Hãy thử các microservice NVIDIA AI for Media NIM. Xem các quy trình làm việc mới nhất của NVIDIA và đối tác tại IBC 2026.

NVIDIA Holoscan for Media cung cấp Lớp trao đổi truyền thông mở (Open Media Exchange Layer) để xây dựng và kết nối các ứng dụng truyền thông trực tiếp 🔗

Khi các đài truyền hình, dịch vụ phát trực tuyến và tổ chức thể thao áp dụng phần mềm và AI, cơ sở hạ tầng đằng sau nội dung trực tiếp đang trở nên linh hoạt hơn, kết nối tốt hơn và ngày càng được xây dựng trên nền tảng điện toán tăng tốc chia sẻ.

Việc tích hợp Media Exchange Layer (MXL) với NVIDIA Holoscan for Media đẩy nhanh quá trình chuyển đổi đó — cung cấp lớp trao đổi chung giúp các ứng dụng truyền thông kết nối và vận hành cùng nhau.

Holoscan for Media là một kiến trúc tham chiếu mở và bộ công cụ phát triển để xây dựng các chức năng và ứng dụng truyền thông hỗ trợ bởi AI cho sản xuất trực tiếp dựa trên phần mềm. MXL bổ sung một cách thức mở để các chức năng truyền thông dựa trên phần mềm đó trao đổi video, âm thanh và dữ liệu trực tiếp trong một môi trường phân tán.

Khi các chức năng sản xuất chuyển sang phần mềm, các nhà phát triển có thể xây dựng các ứng dụng chia sẻ cơ sở hạ tầng tăng tốc, kết nối linh hoạt và phát triển độc lập. Điều đó có thể giúp các công ty truyền thông sử dụng cơ sở hạ tầng hiệu quả hơn, giới thiệu các khả năng mới nhanh hơn và giảm bớt lượng tích hợp tùy chỉnh cần thiết giữa các ứng dụng.

Sự tích hợp này cũng tạo ra một nền tảng vững chắc hơn cho AI trong truyền thông trực tiếp. Xử lý AI, các ứng dụng video và các chức năng truyền thông truyền thống ngày càng có thể vận hành trên cùng một cơ sở hạ tầng tăng tốc và trong cùng một môi trường dựa trên phần mềm.

Đối với các nhà cung cấp công nghệ, điều này mở rộng cơ hội xây dựng các ứng dụng có thể hoạt động trên các hệ sinh thái đa nhà cung cấp rộng lớn hơn. Đối với các công ty truyền thông, nó tạo ra con đường hướng tới cơ sở hạ tầng có thể thích ứng khi các định dạng, ứng dụng và khả năng AI thay đổi.

Xem bản demo tại IBC ở gian hàng EBU 10.D21. Tìm hiểu thêm về Holoscan for Media.

NVIDIA Sports Intelligence Playbooks vạch ra con đường hướng tới AI đa phương thức cho thể thao 🔗

Thể thao đang trở thành nơi thử nghiệm cho một sự thay đổi rộng lớn hơn trong AI: từ các mô hình mục đích chung sang các mô hình mở được tinh chỉnh dựa trên dữ liệu độc quyền.

NVIDIAAI thời gian thựcTruyền thôngIBC 2026Công nghệ phát sóng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ NVIDIA Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.