QbitAI
85

Mô hình

Đại diện Trung Quốc gia nhập top đầu thế giới: HiDream.ai ra mắt mô hình video dựa trên quy luật vật lý

(giờ Việt Nam)

Tóm tắt AI

HiDream.ai vừa chính thức trình làng HiDream-O1-Video-1.0, mô hình tạo video toàn diện đầu tiên được xây dựng dựa trên các quy luật vật lý thực tế.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

15/09/2026 18:41:06 Nguồn: QbitAI

HiDream.ai chính thức ra mắt mô hình tạo video toàn phương thức (native multimodal) đầu tiên: HiDream-O1-Video-1.0

Hôm nay, HiDream.ai đã chính thức công bố mô hình tạo video toàn phương thức nguyên bản đầu tiên mang tên HiDream-O1-Video-1.0 (viết tắt là HD-V1). HD-V1 sử dụng kiến trúc toàn phương thức nguyên bản do HiDream tự phát triển, hỗ trợ đầu vào đa dạng như văn bản, hình ảnh và video. Mô hình có khả năng xuất trực tiếp video 1080p độ trung thực cao với thời lượng từ 5–20 giây chỉ bằng một cú nhấp chuột. Đồng thời, HD-V1 đã được nâng cấp toàn diện về khả năng hiểu ý định, hiểu quy luật vật lý, tự lập kế hoạch kể chuyện và tạo đồng bộ âm thanh - hình ảnh, đạt trình độ dẫn đầu thế giới.

Cùng thời điểm ra mắt, HD-V1 đã lọt vào top đầu thế giới trên hai bảng xếp hạng đánh giá quốc tế uy tín. Trên nền tảng phân tích và kiểm chuẩn AI độc lập hàng đầu thế giới Artificial Analysis Image to Video Leaderboard (With Audio), HD-V1 đã xuất sắc giành vị trí thứ 4 toàn cầu. Bảng xếp hạng tạo video từ hình ảnh của Artificial Analysis được coi là thước đo quan trọng để đánh giá năng lực tổng thể của các mô hình tạo video AI nhờ các tiêu chuẩn đánh giá hệ thống và có khả năng tái lập.

Tại Arena.ai Image-to-Video, nền tảng đánh giá mù (blind test) các mô hình AI có ảnh hưởng nhất thế giới, HD-V1 cũng đạt thành tích ấn tượng ở vị trí thứ 8. Arena.ai Image-to-Video là nền tảng con chuyên biệt cho các mô hình tạo video AI, hiện là tài liệu tham khảo bên thứ ba quan trọng để đánh giá năng lực của các mô hình tạo video từ hình ảnh, được các nhà sản xuất AI chính thống trên toàn cầu trích dẫn rộng rãi.

Đặt trong bối cảnh cạnh tranh AI toàn cầu, thành tích này mang ý nghĩa vượt xa thứ hạng đơn thuần: Đa phương thức (multimodal) hiện là chiến trường cốt lõi của trí tuệ nhân tạo toàn cầu, trong đó tạo video từ hình ảnh là một trong những lĩnh vực có mật độ kỹ thuật cao nhất và cạnh tranh khốc liệt nhất. Việc HD-V1 ra mắt toàn cầu với vị trí cao trên cả hai bảng xếp hạng đánh dấu bước tiến vượt bậc của các doanh nghiệp mô hình lớn ưu tú tại Trung Quốc, chính thức hình thành nên nhóm dẫn đầu (first-tier) về mô hình video AI trên thế giới.

CTO của HiDream.ai, ông Yao Ting, cho biết: "HiDream-O1-Video-1.0 là thành phần then chốt trong ma trận mô hình thế giới toàn phương thức nguyên bản của HiDream. Chúng tôi luôn tin rằng sự tiến hóa qua các thế hệ của công nghệ tạo video không chỉ nằm ở việc tăng số lượng điểm ảnh hay kéo dài thời lượng, mà nằm ở việc liệu mô hình có thực sự hiểu được ý định của người sáng tạo và các quy luật vật lý của thế giới thực hay không. Ngay từ khi thiết kế kiến trúc, HD-V1 đã hướng tới sự biểu diễn thống nhất giữa văn bản, video và âm thanh. Công nghệ toàn phương thức nguyên bản giúp mô hình chuyển mình từ 'nhìn rõ, chuyển động mượt' sang 'nghe hiểu, nói chuẩn, diễn đạt mạch lạc'. Việc tiếp tục lọt vào nhóm dẫn đầu trên hai bảng xếp hạng quốc tế uy tín lần này là sự kiểm chứng trực tiếp nhất cho lộ trình công nghệ toàn phương thức nguyên bản của HiDream."

01. Toàn phương thức nguyên bản, thấu hiểu ý định và vật lý hơn

Khó khăn của việc tạo video thường không nằm ở chỗ "có biết vẽ hay không", mà là "có nghe hiểu hay không". Thông tin người dùng nhập vào thường là ngôn ngữ nói, rời rạc và mơ hồ. Nếu đưa trực tiếp vào mô hình, rất dễ xảy ra các vấn đề như hiểu sai ý định, nhảy cảnh, trôi nhân vật và lệch âm thanh - hình ảnh.

Vì vậy, thiết kế của HD-V1 tích hợp sẵn mô-đun hiểu ý định đa phương thức, tận dụng khả năng tư duy và hiểu sâu của các mô hình đa phương thức để lập kế hoạch cấu trúc cho nội dung video. Các nội dung lập kế hoạch bao gồm: thời lượng cảnh quay, địa điểm bối cảnh, nội dung hình ảnh, ràng buộc khung hình đầu tiên, nhân vật có mặt, hành động và biểu cảm, bố cục khung hình, tiêu cự quay, lời thoại và thiết kế âm thanh nền, v.v. Sự tồn tại của mô-đun này đảm bảo mô hình hiểu đầy đủ ý định từ ngôn ngữ tự nhiên của người dùng và chuyển đổi chúng thành các biểu đạt chuyên nghiệp mà mô hình có thể tiếp nhận. Hiểu càng sâu, kế hoạch càng ổn định; kế hoạch càng ổn định, quá trình tạo đồng bộ sau đó càng ít bị "chệch hướng".

Hiểu ý định chỉ là bước đầu tiên, một bước đột phá quan trọng khác của HD-V1 chính là "thấu hiểu vật lý hơn".

Vật thể rơi xuống dưới tác động của trọng lực như thế nào, phản hồi va chạm ra sao, quán tính được duy trì thế nào, ánh sáng và bóng đổ suy giảm ra sao, không gian được giữ tính liên tục như thế nào — những quy luật vật lý này không chỉ được thấu hiểu mà còn được đưa vào logic kể chuyện của mô hình video, trở thành logic nền tảng cho việc tạo hình ảnh.

Khi các quy luật vật lý đi vào logic tạo hình, chất lượng chân thực của hình ảnh được nâng cao toàn diện. Ba bản demo dưới đây là sự so sánh video được tạo bởi ba mô hình hàng đầu trong ngành với cùng một câu lệnh (prompt), trong đó demo thứ ba là của HD-V1 (áp dụng cho toàn văn).

Trong hình ảnh của mô hình thứ nhất, hai bàn tay dùng lực hướng vào nhau khiến sợi dây đỏ bị co ngắn lại một cách "phi lý"; mô hình thứ hai đột ngột tạo ra một chiếc kim từ hư không. Trong khi đó, hình ảnh do HD-V1 tạo ra hoàn toàn khác biệt: khi hai bàn tay dùng lực hướng vào nhau, sợi dây đỏ tự nhiên phồng lên, tạo sự tương phản rõ rệt với mô hình thứ nhất; khi ngón cái tay trái nhẹ nhàng vê đầu sợi dây ra ngoài, sợi dây đỏ theo lực của tay mà duỗi ra, độ căng, hướng đi và sự biến dạng đều tuân thủ vật lý thực tế. Hơn nữa, hình ảnh còn có chất lượng chân thực tuyệt vời, kết cấu móng tay, độ kim loại của chiếc kim đều được thể hiện rất thật, thậm chí có thể cảm nhận được độ dẻo dai của sợi dây.

02. Nâng cấp toàn diện về độ trung thực hình ảnh, tính liên tục của câu chuyện và tính nhất quán của nhân vật

Đối với các chỉ số then chốt như chất lượng hình ảnh cao, tính liên tục của câu chuyện và tính nhất quán của nhân vật, HD-V1 đã đạt được sự tối ưu hóa và nâng cấp toàn diện. Nó không chỉ theo đuổi sự tinh xảo của từng khung hình đơn lẻ mà còn đảm bảo nội dung video tự nhất quán trong chiều không gian kể chuyện tổng thể.

Khi nhân vật, cảm xúc, động cơ và quy luật vật lý đi vào các cảnh quay liên tục, chúng chắc chắn sẽ ảnh hưởng lẫn nhau. Vì vậy, HiDream đã đề xuất tư duy kỹ thuật "lập kế hoạch trước, tạo đồng bộ sau, sau đó căn chỉnh bằng phần thưởng đa phương thức (multimodal Reward)", cho phép mô hình lập kế hoạch kể chuyện và trạng thái nhân vật ở cấp độ tổng thể trước, sau đó ràng buộc hình ảnh, hành động và ngữ nghĩa trong quá trình tạo đồng bộ, cuối cùng sử dụng tín hiệu phần thưởng đa phương thức để căn chỉnh chất lượng hình ảnh, tính liên tục và tính hợp lý về vật lý.

03. Đổi mới logic về thời lượng tạo video tuân theo nội dung kể chuyện

Hầu hết thời lượng tạo video đều tuân theo lộ trình câu lệnh cố định, ví dụ người dùng nhập tạo 5 giây, mô hình chỉ có thể lấp đầy nội dung trong cửa sổ thời gian đó, nội dung kể chuyện bị "ép" phải thích nghi với thời lượng.

Cách làm của HD-V1 là trả quyền quyết định thời lượng lại cho chính nội dung. Mô hình tự lập kế hoạch thời lượng tạo dựa trên logic triển khai sự kiện, chu kỳ hoàn thành hành động và nhịp độ tiến triển của câu chuyện. Chìa khóa của khả năng này không nằm ở việc thay đổi số khung hình đơn thuần, mà nằm ở việc gắn kết lựa chọn thời lượng với bối cảnh nội dung, phục vụ mục tiêu thực sự của người dùng — cung cấp hình ảnh hoàn chỉnh, hợp lý và chân thực trong một câu chuyện mạch lạc.

Đây cũng là sự so sánh thực tế giữa ba mô hình. Hai mô hình đầu tiên đều "máy móc" tạo ra 10 giây hình ảnh, nhưng một quả táo từ lúc ném đi đến lúc bắt được vốn là một quá trình ngắn ngủi, không cần thiết phải kéo dài đến 10 giây. Kết quả là, mô hình thứ nhất sau khi hoàn thành hành động, từ giây thứ ba chỉ có thể để tay tiếp tục cầm quả táo, hình ảnh dừng lại trong sự chờ đợi vô nghĩa; mô hình thứ hai dùng hình thức quay chậm để lấp đầy thời lượng. Trong khi đó, hình ảnh do HD-V1 tạo ra có nhịp độ tự nhiên: nhân vật ném, bắt và giữ ổn định.

04. Mô hình hóa kết hợp tín hiệu văn bản, video, âm thanh, tạo đồng bộ âm thanh - hình ảnh nguyên bản

Âm thanh và hình ảnh không đồng bộ là một căn bệnh phổ biến của các mô hình tạo video AI. Điều này là do hầu hết các mô hình video hiện nay sử dụng lộ trình kỹ thuật ghép nối hậu kỳ: tạo hình ảnh từng khung hình trước, sau đó mới quay lại phối âm thanh và hiệu ứng, khiến âm thanh rất khó giữ được sự đồng nhất với hình ảnh.

HD-V1 sử dụng kiến trúc toàn phương thức nguyên bản, thực hiện mô hình hóa kết hợp cho tín hiệu văn bản, video và âm thanh. Cả ba ràng buộc và căn chỉnh lẫn nhau trong cùng một quá trình tạo: chuyển động hình ảnh dẫn dắt nhịp điệu âm thanh, lời thoại và hiệu ứng âm thanh bồi đắp cảm xúc cho cảnh quay, điều kiện văn bản xuyên suốt từ đầu đến cuối. Việc mô hình hóa kết hợp này phục vụ trực tiếp cho sự đồng bộ âm thanh - hình ảnh và tính liên tục của câu chuyện. Khi chuyển cảnh, âm thanh môi trường và nhạc nền chuyển tiếp theo; khi nhân vật mở miệng, khẩu hình, hơi thở và cảm xúc đều đồng tần số; khi hành động vật lý xảy ra, hiệu ứng âm thanh mô phỏng và phản hồi va chạm gần với nguyên nhân - kết quả thực tế hơn.

Đây là hình ảnh một quả bóng bàn nảy trên bàn. Nhìn từ hình ảnh do ba mô hình tạo ra, chỉ có nội dung của HD-V1 là nhịp điệu rơi của quả bóng bàn phù hợp với quy luật vật lý, âm thanh mỗi lần rơi cũng thay đổi theo sự thay đổi của độ cao, hoàn toàn phù hợp với chất lượng thực tế. Để đạt được chất lượng của thế giới thực, gốc rễ nằm ở triết lý sản phẩm kỹ thuật của mô hình: lấy cảm nhận của con người làm thước đo. Vì vậy, trong giai đoạn hậu huấn luyện, mô hình sử dụng Diffusion Reinforcement Learning và thiết kế mô hình Reward đa phương thức căn chỉnh với nhận thức của con người, thực hiện đánh giá thống nhất cho nội dung âm thanh - hình ảnh từ hình ảnh đến âm thanh, từ cục bộ đến tổng thể.

05. Vòng lặp mô hình thế giới hình thành: Từ năng lực đơn lẻ đến ma trận toàn phương thức nguyên bản

Kể từ khi chính thức ra mắt kiến trúc mô hình thế giới toàn phương thức nguyên bản HiDream-O1 vào tháng 4 năm nay, HiDream đã liên tiếp phát hành gia đình các mô hình dựa trên cùng một kiến trúc. Những mô hình này cũng lần lượt đạt được vị trí dẫn đầu trên các bảng xếp hạng quốc tế uy tín trong lĩnh vực tương ứng.

Dòng mô hình tạo hình ảnh HiDream‑O1‑Image, trong đó phiên bản thương mại 1.5 đã đạt vị trí thứ nhất tại Trung Quốc và thứ hai toàn cầu trên bảng xếp hạng tạo ảnh từ văn bản của nền tảng đánh giá độc lập quốc tế Artificial Analysis; phiên bản mã nguồn mở cũng đạt vị trí thứ hai.

Mô hình thế giới tương tác HiDream‑O1‑World, đứng đầu bảng xếp hạng tổng thể của WBench - chuẩn mực mô hình thế giới tương tác đầu tiên trong ngành.

Mô hình thế giới hiện thân (Embodied) HiDream‑O1‑Embodied, liên tiếp đứng đầu các bảng xếp hạng phụ về thích ứng nhiễu và suy luận không gian của RoboColiseum.

Với việc chính thức ra mắt mô hình video, vòng lặp mô hình thế giới toàn phương thức nguyên bản đầu tiên trong ngành đã chính thức hình thành. Hình ảnh, video, tương tác 3D và hành động hiện thân giao thoa, cộng sinh và tuần hoàn trong một mô hình thế giới nguyên bản thống nhất.

Nhà sáng lập HiDream, Tiến sĩ Mei Tao, cho biết: "Dựa trên nhận thức của chúng tôi về lộ trình công nghệ trí tuệ nhân tạo thế hệ tiếp theo, HiDream cam kết xây dựng ma trận mô hình 'một nền tảng toàn phương thức nguyên bản, bốn mô hình cùng nguồn gốc tiến hóa'. Những gì chúng tôi xây dựng không phải là bốn dòng năng lực độc lập, mà là một hệ thống toàn phương thức nguyên bản với kiến trúc kỹ thuật thống nhất làm nền tảng, hướng tới sự tiến hóa liên tục của mô hình thế giới để đi vào thực tiễn."

06. Hoàn tất vòng gọi vốn C+, vốn công nghiệp quốc doanh tiếp tục gia tăng đầu tư

AI tạo videoHiDreamMô hình vật lýCông nghệ AIAI Trung Quốc
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.