Mô hình
Ra mắt LTX-2.5: Mô hình thế giới mã nguồn mở tối ưu cho GPU NVIDIA, đưa công nghệ làm phim vào máy tính cá nhân
(giờ Việt Nam)
Tóm tắt AI
LTX-2.5 là mô hình thế giới mã nguồn mở chuyên dụng cho tạo video và AI vật lý, được tối ưu hóa để chạy mượt mà trên GPU NVIDIA RTX với yêu cầu VRAM thấp, giúp đơn giản hóa quy trình sản xuất video chuyên nghiệp.
Bản dịch AI

Sản xuất video đang thay đổi khi các đoạn clip mạng xã hội, nội dung quảng cáo và tiền hình ảnh hóa (pre-visualization) cho phim đang chuyển dịch từ đám mây sang các GPU cục bộ. Hôm nay, LTX đã phát hành LTX-2.5, một mô hình thế giới (world model) mã nguồn mở dành cho tạo video, các ứng dụng thời gian thực và AI vật lý, được xây dựng chính xác cho sự chuyển dịch đó. LTX đã tối ưu hóa mô hình này để suy luận cục bộ trên các GPU NVIDIA RTX và NVIDIA DGX Spark, cắt giảm yêu cầu VRAM để một mô hình thế giới tiên phong có thể chạy trên phần cứng mà các nhà sáng tạo đã sở hữu. Bản phát hành này là điểm nhấn trong chuỗi sự kiện AI cục bộ kéo dài một tháng của NVIDIA, được ra mắt cùng ngày với mô hình tác nhân (agent model) mã nguồn mở Nemotron 3.5 Lightning. Tín hiệu từ cả hai: các mô hình mở, được tăng tốc cục bộ, đang trở thành cơ sở hạ tầng sản xuất mặc định.
Tạo nội dung cục bộ thay đổi điều gì đối với các nhà sáng tạo
LTX-2.5 mang đến cho các nhà sáng tạo thứ mà trước đây chỉ nằm sau cánh cửa phòng thu: sự nhất quán thực sự. Khả năng tạo đa cảnh (multishot) nguyên bản giúp kết xuất toàn bộ chuỗi hình ảnh thành một tác phẩm mạch lạc, giữ nguyên diện mạo nhân vật qua từng cảnh quay, khắc phục tình trạng lỗi hình (glitching) vốn khiến các mô hình mở trước đây không thể sử dụng cho các chiến dịch quảng cáo. Kết hợp với nền tảng ngôn ngữ Gemma 4 sắc nét hơn và bộ giải mã mới giúp giảm nhiễu trong các cảnh quay chuyển động nhanh, kết quả đầu ra gần như đã sẵn sàng để hậu kỳ. Tất cả đều chạy trên GPU NVIDIA RTX phổ thông, ngay trong ComfyUI. Một người ngồi tại bàn làm việc có thể khóa một nhân vật thương hiệu hoặc phong cách đặc trưng bằng cách tinh chỉnh LoRA nhanh chóng. Không cần phòng thu. Không cần đám mây. Không có sở hữu trí tuệ (IP) nào rời khỏi máy tính.
Đó mới là sự thay đổi thực sự: toàn bộ quy trình sản xuất giờ đây nằm gọn trên một chiếc máy tính để bàn. Những công việc từng cần cả một ê-kíp, một ngày quay, một hệ thống render farm và hóa đơn đám mây, giờ đây được thực hiện trên chính chiếc card RTX có sẵn trong máy. Các clip bổ sung không tốn phí cho mỗi lần tạo hay tín dụng đo lường. Điều đó thay đổi cách làm việc của các nhà sáng tạo: thử nghiệm rộng rãi, theo đuổi hàng chục hướng đi thay vì đặt cược vào một ý tưởng an toàn, và để GPU tự động tạo hàng loạt nội dung qua đêm. Bạn thức dậy với một thư mục đầy ắp các lựa chọn.
Đối với những nhà sáng tạo nội dung ngắn và các đội ngũ quảng cáo cần làm mới liên tục, đây là một sự chuyển đổi mang tính cách mạng. Sự nhàm chán với quảng cáo thường xuất hiện trong vòng 7 đến 10 ngày, vì vậy nút thắt cổ chai chưa bao giờ là ý tưởng; mà là chi phí và thời gian để sản xuất đủ số lượng. Tạo nội dung cục bộ xóa bỏ điều đó: tạo ra nhiều biến thể trên cùng một bản tóm tắt, thử nghiệm mười tiêu đề thu hút, bản địa hóa cho năm thị trường và làm mới nội dung sáng tạo trước khi sự nhàm chán ập đến. Các nhà sáng tạo độc lập và các đội ngũ nhỏ giờ đây có thể đạt được khối lượng đầu ra tương đương một phòng thu lớn chỉ với một GPU RTX trên bàn làm việc.
Tốc độ: Những con số đằng sau câu chuyện
Tất cả những điều này sẽ vô nghĩa nếu tốc độ tạo không nhanh, và thực tế là nó rất nhanh. Trong bài kiểm tra chuẩn (benchmark) chuyển đổi văn bản thành video mà LTX công bố, một clip dài 10 giây mất 6,8 giây khi chạy tại chỗ (on-prem) trên 2x NVIDIA GB200 và 23,7 giây thông qua LTX API. Các giải pháp thay thế đóng (closed alternatives) nhanh nhất được liệt kê là Omni Flash, Grok 1.5 và Veo 3.1, mất từ 52 đến 70 giây. Các hệ thống chậm hơn còn kéo dài hơn nhiều: Seedance 2.0 mất 196 giây, FLUX 3 mất 259 giây, Seedance 2.5 mất 317 giây và Kling 3.0 Pro mất 398 giây. Tại chỗ, LTX-2.5 tạo video nhanh hơn thời lượng thực của clip, nhanh hơn 7,6 lần so với giải pháp thay thế đóng gần nhất và nhanh hơn khoảng 58 lần so với giải pháp chậm nhất. Khoảng cách đó làm cho việc tạo hàng loạt qua đêm và lặp lại A/B nhanh chóng trở nên khả thi, chứ không còn là lý thuyết.
Động lực AI cục bộ của NVIDIA
Trong suốt tháng 8, NVIDIA đang làm nổi bật các mô hình, ứng dụng và công cụ trên toàn hệ sinh thái AI cục bộ. Nemotron 3.5 Lightning, cũng được phát hành hôm nay, là một mô hình hỗn hợp chuyên gia (mixture-of-experts) 30B mã nguồn mở dành cho các tác nhân luôn hoạt động, cùng với NeMo Switchyard, một thư viện mã nguồn mở giúp điều hướng từng bước quy trình làm việc của tác nhân đến mô hình phù hợp nhất. Điểm chung là sự lựa chọn phần cứng: các mô hình mở trong hệ sinh thái NVIDIA có thể mở rộng từ PC RTX đến máy trạm, trung tâm dữ liệu và đám mây. LTX-2.5 kết nối trực tiếp vào câu chuyện đó như một mô hình thế giới được tăng tốc bởi NVIDIA dành cho các nhà sáng tạo, nhà phát triển và đội ngũ robot.
LTX-2.5 là gì?
Trong khi các mô hình ngôn ngữ lớn (LLMs) học cách dự đoán từ tiếp theo, các mô hình thế giới học cách dự đoán khoảnh khắc tiếp theo. Chúng tạo ra các môi trường, mô phỏng cách chúng vận hành và cho phép người dùng tương tác bên trong đó. Nền tảng đó hỗ trợ cho phim ảnh, quảng cáo, trò chơi, mô phỏng và robot trong các kho hàng và nhà máy. LTX mô tả dòng LTX là mô hình thế giới mở được sử dụng nhiều nhất, với hơn 33 triệu lượt tải xuống, và định vị LTX-2.5 là bản phát hành mạnh mẽ nhất từ trước đến nay. Trọng số mở (open weights) mang lại cho các đội ngũ toàn quyền kiểm soát phần cứng, tùy chỉnh và sở hữu trí tuệ.
Kiến trúc có gì mới
LTX đã xây dựng lại gần như mọi giai đoạn của quy trình tạo thay vì chỉ gắn thêm các tính năng vào một lõi cũ:
LTX-2.5 dành cho ai
Tính khả dụng và cấp phép
LTX-2.5 được phát hành dưới dạng trọng số mở trên Hugging Face, tích hợp nguyên bản trong ComfyUI và thông qua LTX API để tạo nội dung được quản lý. Nó chạy trên mọi thiết bị từ GPU trung tâm dữ liệu đến máy Mac và miễn phí cho các tổ chức có doanh thu định kỳ hàng năm dưới 10 triệu USD. Mã nguồn có sẵn trên GitHub, kèm theo tài liệu hướng dẫn.
Những điểm chính cần lưu ý
Cảm ơn đội ngũ NVIDIA vì sự dẫn dắt tư tưởng / tài nguyên cho bài viết này. Bài viết này được tài trợ bởi NVIDIA.

Jean-marc là một giám đốc điều hành kinh doanh AI thành công. Ông lãnh đạo và thúc đẩy tăng trưởng cho các giải pháp hỗ trợ bởi AI và đã thành lập một công ty thị giác máy tính vào năm 2006. Ông là một diễn giả được công nhận tại các hội nghị AI và có bằng MBA từ Stanford.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.