Mô hình
HiDream.ai ra mắt mô hình thế giới HiDream-O1-Embodied: Bước tiến mới trong công nghệ đa phương thức
(giờ Việt Nam)
Tóm tắt AI
HiDream.ai vừa công bố HiDream-O1-Embodied, mô hình thế giới tích hợp công nghệ đa phương thức nguyên bản, đánh dấu bước tiến quan trọng trong việc hiện thực hóa trí tuệ nhân tạo cho robot và các hệ thống tự hành.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
07/09/2026 14:03:34 Nguồn: QbitAI
Hôm nay, HiDream.ai đã chính thức ra mắt mô hình thế giới hiện thân (Embodied World Model) mang tên HiDream-O1-Embodied. Với triết lý kỹ thuật "native full-modality" (đa phương thức nguyên bản), mô hình này tăng cường khả năng nhận thức vật lý và dự đoán động cho robot, hỗ trợ trí tuệ hiện thân (Embodied AI) đạt được các tương tác vật lý ở cấp độ cao hơn. Việc ra mắt mô hình hiện thân đánh dấu bước tiến của HiDream trong việc kết nối các phương thức như hình ảnh, video, 3D và hành động, xuyên suốt toàn bộ quy trình từ hiểu – suy luận – thực thi, nhằm xây dựng một vòng lặp kỹ thuật khép kín cho nền tảng mô hình thế giới thống nhất.
Cùng thời điểm ra mắt, HiDream-O1-Embodied lần đầu tiên tham gia đánh giá trên nền tảng RoboColiseum – nền tảng kiểm định mô hình trí tuệ hiện thân. Ngay lập tức, mô hình đã đứng đầu bảng xếp hạng phụ quan trọng nhất là Robustness (Khả năng thích ứng với nhiễu) với điểm trung bình 0,692.

CTO của HiDream.ai, ông Yao Ting, cho biết: "Chúng tôi tin rằng, việc xây dựng một nền tảng mô hình thế giới hoàn chỉnh đòi hỏi ba năng lực cốt lõi xoay quanh việc biểu đạt, thấu hiểu và tạo lập thế giới thực: biểu đạt đa phương thức toàn diện, suy luận nhân quả và kiến tạo thế giới vật lý. Triết lý kỹ thuật mô hình thế giới đa phương thức nguyên bản của HiDream đã được định hướng ngay từ khâu thiết kế kiến trúc ban đầu nhằm xây dựng biểu diễn thống nhất cho mọi phương thức, bao gồm cả hành động. Sự ra đời của HiDream-O1-Embodied là cột mốc quan trọng trong chiến lược kỹ thuật này, đưa chúng ta từ 'mô phỏng thế giới' tiến tới 'thế giới thực'."
Đứng đầu RoboColiseum: Đưa ra câu trả lời thuyết phục với 0,692 điểm ở hạng mục "Thích ứng với nhiễu"
RoboColiseum, nền tảng đánh giá mô phỏng trí tuệ hiện thân thường quy, hướng tới việc xây dựng một hệ thống đánh giá đa chiều. Thông qua các bài kiểm tra mô phỏng có độ nhất quán cao với hiệu suất máy thực, nền tảng giúp các nhà phát triển nhận diện ưu điểm và hạn chế của mô hình để liên tục cải tiến. Nền tảng mở cửa cho các trường đại học, viện nghiên cứu, doanh nghiệp mô hình và các nhà nghiên cứu trên toàn cầu, cập nhật kết quả theo thời gian thực, cam kết xây dựng một thước đo đánh giá mô hình hiện thân đáng tin cậy và có khả năng tái lập.
Nền tảng này được xây dựng dựa trên môi trường mô phỏng độ trung thực cao (high-fidelity), tái hiện chân thực thế giới thực. Với 4 hạng mục năng lực và 78 tác vụ đánh giá mô phỏng, nền tảng tập trung vào: tuân thủ chỉ dẫn, thấu hiểu không gian, thích ứng với nhiễu và thao tác tổng quát. Kể từ khi ra mắt bản thử nghiệm nội bộ, nền tảng đã thu hút hàng chục mô hình trọng điểm trong và ngoài nước tham gia đánh giá. Trong bốn khía cạnh này, Robustness (Khả năng thích ứng với nhiễu) được công nhận là phần thử thách nhất. Nó kiểm tra tính ổn định và khả năng tổng quát hóa của mô hình trong các môi trường không lý tưởng bằng cách thay đổi bối cảnh, ánh sáng, chất liệu, trạng thái ban đầu của robot, vị trí camera, chất lượng hình ảnh và đa dạng hóa các câu lệnh. Nói cách khác, đây không phải là bài kiểm tra trong "nhà kính" phòng thí nghiệm, mà là thử thách bản lĩnh thực sự giữa những "bất ngờ" khách quan.

HiDream-O1-Embodied đứng đầu bảng xếp hạng với 0,692 điểm, thành quả này có được nhờ nền tảng đa phương thức nguyên bản. Mô hình thế giới đa phương thức nguyên bản vốn dĩ đã cung cấp nền tảng cho việc thấu hiểu và tạo lập xuyên phương thức. Trong khâu thực thi, để đảm bảo sự ổn định trước mọi "bất ngờ" của thế giới thực, HiDream-O1-Embodied đã thực hiện những đổi mới đột phá trong ba năng lực cốt lõi, giúp việc thấu hiểu chính xác hơn, nhận thức vững vàng hơn và khả năng chống nhiễu mạnh mẽ hơn.
Thấu hiểu ngôn ngữ — Vượt qua giới hạn của việc khớp từ khóa
Robot truyền thống thường chỉ hiểu các chỉ dẫn ngôn ngữ ở mức khớp từ khóa. Khi nói "lấy cái cốc lại đây" thì hiểu, nhưng đổi thành "đưa tôi cái cốc" hoặc "chuyền cho tôi cái cốc" thì có thể bị "đơ". HiDream-O1-Embodied bao phủ không gian chỉ dẫn tương đương với đa dạng động từ, cấu trúc câu và cách diễn đạt, không bị trói buộc bởi cú pháp mà tập trung vào chính ý định. Dù chỉ dẫn có thay đổi thế nào, nó đều có thể xuyên thấu bề mặt ngôn từ để nắm bắt ý muốn thực sự của người dùng.
Nhận thức thị giác — Phối hợp đa góc nhìn, tránh tình trạng "hỏng một chỗ, liệt toàn bộ"
Trong thế giới vật lý, kênh thị giác của robot không phải lúc nào cũng ở trạng thái lý tưởng. Vị trí camera có thể bị lệch, độ chính xác của hiệu chuẩn thay đổi theo thời gian, hoặc hình ảnh đơn lẻ có thể bị che khuất hoặc nhiễu. HiDream-O1-Embodied tổng hợp thông tin từ nhiều góc nhìn, để các kênh thị giác bổ trợ cho nhau thay vì phụ thuộc vào một góc nhìn cố định. Khi một phần thông tin thị giác bị sai lệch hoặc tạm thời không khả dụng, mô hình vẫn có thể dựa vào các góc nhìn khác để hiểu bối cảnh, phán đoán tác vụ và tiếp tục thực thi, giúp hệ thống chuyển từ trạng thái "hỏng một chỗ, liệt toàn bộ" sang "hạn chế cục bộ, tổng thể vẫn vận hành".
Cơ chế chịu lỗi cao — Học cách thực thi ổn định trong sự "không hoàn hảo"
Hầu hết các mô hình được huấn luyện dựa trên "dữ liệu hoàn hảo" — hình ảnh sắc nét, khung hình đầy đủ, góc nhìn tiêu chuẩn. Nhưng thế giới thực không bao giờ như vậy. Thay đổi ánh sáng, hình ảnh bị nhòe, tầm nhìn bị che khuất, tín hiệu chập chờn đều là những tình huống robot có thể gặp phải hàng ngày khi vận hành thực tế.
HiDream-O1-Embodied chủ động đưa vào nhiều điều kiện không lý tưởng ngay từ giai đoạn huấn luyện, buộc mô hình phải liên tục đối mặt với thông tin không đầy đủ, không ổn định và học cách đưa ra phán đoán đáng tin cậy từ những manh mối hạn chế. Cách huấn luyện này giúp mô hình không chỉ theo đuổi hiệu suất tối ưu trong điều kiện lý tưởng, mà còn chú trọng hơn đến sự ổn định bền bỉ trong môi trường phức tạp. Khả năng chịu lỗi này không giới hạn ở một loại bất thường thị giác nào. Đối mặt với sự thay đổi về ánh sáng, ngoại hình và bối cảnh, mô hình có thể tận dụng thông tin sẵn có một cách linh hoạt hơn, giảm thiểu ảnh hưởng của môi trường đến việc thực thi tác vụ. Đối với HiDream-O1-Embodied, điều thực sự quan trọng không chỉ là "làm tốt khi nhìn rõ", mà là "vẫn hoàn thành nhiệm vụ ổn định ngay cả khi điều kiện không lý tưởng".

Mô hình + Dữ liệu: Kiến tạo mô hình sản xuất dữ liệu "Nền tảng thực + Tăng cường tạo lập"
Khả năng "đã thấy đủ nhiều sự không hoàn hảo trong quá trình huấn luyện" này không tự nhiên mà có. Nó chạm đến một vấn đề cốt lõi hơn: ranh giới nhận thức của mô hình bị ảnh hưởng bởi dữ liệu mà nó tiếp xúc. Dữ liệu chất lượng cao chính là biến số khan hiếm và mang tính quyết định nhất trong huấn luyện trí tuệ hiện thân. Chiến lược "Mô hình + Dữ liệu" mà HiDream nỗ lực xây dựng chính là "hào kỹ thuật" thực sự giúp họ đứng đầu bảng xếp hạng mô hình thế giới hiện thân.
Điểm đột phá của chiến lược này nằm ở việc biến chính quá trình sản xuất dữ liệu thành một phần hữu cơ trong quá trình lặp lại của mô hình. Vì vậy, HiDream đã khám phá ra mô hình sản xuất dữ liệu "Nền tảng thực + Tăng cường tạo lập". Mô hình không còn là bên tiếp nhận dữ liệu thụ động, mà chủ động tham gia vào việc tạo ra dữ liệu.
Lấy ví dụ về sự hợp tác với Noitom: Dữ liệu bắt chuyển động (motion capture) người thật độ chính xác cao của họ đóng vai trò là nền tảng thực, HiDream tận dụng năng lực đa phương thức nguyên bản để thực hiện việc tinh chỉnh và mở rộng dữ liệu gấp hàng trăm lần. Dựa trên một mẫu hành động thực tế, mô hình có thể tạo ra các video biến thể: trong khi vẫn tuân thủ nghiêm ngặt các ràng buộc vật lý, nó thay đổi các biến số như môi trường nền, điều kiện ánh sáng, hình thái vật thể... để tạo ra khối lượng lớn các mẫu huấn luyện đa dạng.
Chìa khóa của cơ chế này nằm ở chỗ mô hình vừa là "thí sinh", vừa là "người ra đề" — nó chủ động tạo ra các mẫu huấn luyện nhắm mục tiêu dựa trên nhu cầu của chính mình, tạo thành một vòng lặp tăng trưởng nơi dữ liệu và mô hình thúc đẩy lẫn nhau. Cuối cùng, điều này giúp HiDream-O1-Embodied thể hiện khả năng chống nhiễu (robustness) vượt trội khi đối mặt với những nhiễu loạn mạnh từ thế giới thực.
Ma trận mô hình thế giới đa phương thức nguyên bản ngày càng hoàn thiện
Chỉ chưa đầy một tháng trước, HiDream vừa ra mắt mô hình thế giới tương tác HiDream-O1-World và đứng đầu bảng xếp hạng Navi của chuẩn đánh giá mô hình thế giới video tương tác WBench với điểm trung bình 80,9.
Mô hình thế giới tương tác giải quyết vấn đề "thấu hiểu và suy luận", giúp AI có nhận thức hoàn chỉnh về không gian, thời gian, chuyển động và mối quan hệ giữa các vật thể trong thế giới kỹ thuật số. Trong khi đó, mô hình thế giới hiện thân giải quyết vấn đề "thao tác và thực thi", giúp AI hoàn thành các tác vụ thực tế trong thế giới vật lý. Cả hai sẽ bổ trợ mạnh mẽ cho nhau, củng cố nền tảng vững chắc cho sự phát triển của mô hình thế giới đa phương thức nguyên bản.
Đúng như lời của Tiến sĩ Mei Tao, nhà sáng lập kiêm CEO của HiDream.ai, cuộc cạnh tranh của các mô hình lớn thế hệ tiếp theo không nằm ở sự tăng trưởng năng lực của một phương thức đơn lẻ, mà là sự chuyển dịch từ đơn phương thức sang đa phương thức, và tiến tới đa phương thức thống nhất nguyên bản. Từ HiDream-O1-Image đến HiDream-O1-World, và nay là HiDream-O1-Embodied, HiDream với tư cách là một doanh nghiệp mô hình lớn sáng tạo, đang kiên định hình thành ma trận gia đình mô hình bao phủ từ mô hình thị giác, mô hình thế giới tương tác đến mô hình thế giới hiện thân. Đây không chỉ là sự lan tỏa năng lực của công nghệ đa phương thức nguyên bản trên nhiều lĩnh vực, mà còn thể hiện khả năng tự tiến hóa mạnh mẽ từ bên trong.
Đứng trước bước ngoặt của thời đại khi các công nghệ tiên phong về mô hình thế giới đang phát triển tăng tốc, HiDream đang đẩy nhanh sự đổi mới để tiến về phía trước.
Bài viết này do HiDream.ai cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.
Bản quyền thuộc về đơn vị sở hữu, không được phép sao chép hoặc sử dụng dưới mọi hình thức khi chưa được ủy quyền, mọi hành vi vi phạm sẽ bị xử lý theo quy định.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.