Mô hình
Dyna Robotics ra mắt Dyna-2: Mô hình thế giới-hành động huấn luyện từ 1 triệu giờ video con người
(giờ Việt Nam)
Tóm tắt AI
Dyna-2 là mô hình thế giới-hành động (WAM) đột phá, được huấn luyện trên 1 triệu giờ video góc nhìn thứ nhất để tối ưu hóa khả năng điều khiển robot. Công nghệ này giúp giảm đáng kể sai số vận hành và cho phép robot thực hiện các tác vụ mới mà không cần huấn luyện lại.
Bản dịch AI

Dyna Robotics vừa ra mắt Dyna-2, một mô hình thế giới-hành động (world-action model) dành cho thao tác robot. Mô hình này được huấn luyện trước trên hơn một triệu giờ video góc nhìn thứ nhất (egocentric) của con người. Con số này tương đương với khoảng 170 năm trải nghiệm thức tỉnh liên tục. Việc học của robot từ lâu đã bị nghẽn do thiếu dữ liệu được gắn nhãn hành động, vốn là thứ đòi hỏi phải được tạo ra một cách có chủ đích thông qua điều khiển từ xa (teleoperation). Dyna-2 kiểm chứng liệu video thông thường của con người có thể thay thế được nguồn dữ liệu này hay không. Nhóm nghiên cứu đã xây dựng một thang đo dữ liệu từ 1.000 đến 1.000.000 giờ và đo lường hiệu quả theo quy mô. Ba kết quả thu được bao gồm: quy luật mở rộng (scaling law) trên dữ liệu con người, lần đầu tiên chuyển đổi thành công quy luật đó sang dữ liệu robot chưa từng thấy, và bằng chứng cho thấy dự đoán video thúc đẩy quá trình chuyển đổi này.
Liệu mô hình này có thể triển khai được không?
Có, nhưng dưới dạng hệ thống do nhà cung cấp vận hành, không phải dưới dạng trọng số (weights) có thể tải xuống. Dyna Robotics chưa công bố checkpoint công khai, API hay giấy phép nào cho Dyna-2. Triển khai hiện nay đồng nghĩa với việc mua một cell robot của Dyna, thay vì tự lưu trữ mô hình.
Dyna-2 là gì?
Dyna-2 là một mô hình thế giới-hành động (WAM): một mô hình tạo sinh có khả năng khử nhiễu video tương lai và một chuỗi hành động tương lai, đồng thời hoặc riêng biệt, dựa trên nền tảng khuếch tán video (video-diffusion backbone). Nó được huấn luyện trước trên hơn một triệu giờ video góc nhìn thứ nhất của con người, tương đương khoảng 170 năm trải nghiệm thức tỉnh liên tục.
Về kiến trúc, đây là sự kết hợp của các transformer. Video và hành động được token hóa riêng biệt và có các chồng lớp DiT (Diffusion Transformer) riêng biệt chú ý lẫn nhau. Dữ liệu cảm thụ bản thể (proprioception) được đưa trực tiếp vào transformer hành động. Các token video sử dụng cơ chế che giấu nhân quả (causal masking); các token hành động sử dụng cơ chế tự chú ý hai chiều (bidirectional self-attention) và chú ý đến các token video ngữ cảnh. Các token video chú ý chéo (cross-attend) đến văn bản, nhưng văn bản không ảnh hưởng trực tiếp đến các token hành động.
Quá trình huấn luyện sử dụng phương pháp khớp dòng (flow matching). Một hàm mất mát video và một hàm mất mát hành động chia sẻ chung một thân (trunk) dưới dạng hai trường vận tốc biên riêng biệt. Vì mạng lưới hành động không bao giờ lấy video tiềm ẩn bị nhiễu làm đối số, chính sách (policy) vẫn giữ tính phản ứng khi suy luận — nó không tạo ra cũng không chú ý đến video tương lai được dự đoán. Transformer hành động được thiết kế cố ý nông hơn và kết nối với luồng video từ sớm, điều mà nhóm nghiên cứu cho biết giúp cải thiện độ trễ thời gian thực mà không làm giảm hiệu suất.
Ba kết quả về quy mô
Dyna Robotics đã cắt các tập con lồng nhau với dung lượng chính xác là 1.000, 10.000, 100.000 và 1.000.000 giờ, giữ nguyên tỷ lệ từ mỗi nguồn. Ngân sách lớn hơn chỉ đơn thuần là thêm dữ liệu, vì vậy sự khác biệt về đường cong không thể quy cho sự thay đổi phân phối. Một tập kiểm chứng cố định, tách biệt gồm 100 giờ được dùng để chấm điểm cho mỗi nấc thang.
Kết quả trên robot
Mỗi nấc thang được huấn luyện bổ sung (post-trained) trên 14 tác vụ, mỗi tác vụ tối đa 10 giờ dữ liệu robot, trên ba loại hình thể: cánh tay YAM 6-DOF với kẹp song song, cùng loại cánh tay đó với bàn tay khéo léo WUJI-2 20-DOF, và một nguyên mẫu bán hình người. Quá trình huấn luyện bổ sung chỉ sử dụng dữ liệu robot — không có sự căn chỉnh người-robot, không huấn luyện đồng thời.
Điểm chuẩn hóa trung bình tăng từ 20% → 28% → 45% → 53% trên thang đo, đạt kết quả tốt nhất ở 9 trên 14 tác vụ tại mốc một triệu giờ. Tác vụ xoay chìa khóa trong hộp khóa (Lockbox Key Turning) là trường hợp ngưỡng: 0% cho đến 100.000 giờ, sau đó đạt 90%. Tác vụ vặn nắp chai (Bottle Cap Untwisting) được huấn luyện bổ sung trên khoảng 10 phút trình diễn và vẫn đạt mức 50%.
So với Dyna-1 — mô hình VLA sản xuất của công ty được khởi tạo từ Qwen3-VL-4B — một phiên bản Dyna-2 sớm đã đạt tỷ lệ thành công gấp 1,55 lần và điểm số gấp 1,12 lần, tổng hợp trên 7 tác vụ và 3 checkpoint. Tại các địa điểm khách hàng chưa từng thấy, Dyna-2 vượt qua các tiêu chí sản xuất với tỷ lệ 87% so với 46% của Dyna-1, mặc dù cả hai đều đạt gần 100% trong môi trường nội bộ. Một quy trình chưng cất (distillation pipeline) cũng giúp cắt giảm thời gian lấy mẫu video từ 10.203 ms xuống còn 110 ms trên một card H100.
Công cụ giải thích tương tác
Những điểm chính cần lưu ý
Đọc báo cáo kỹ thuật đầy đủ: Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models and Announcement. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia cộng đồng ML SubReddit với hơn 150 nghìn thành viên của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Bạn cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới ra mắt hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, đảm bảo cả về mặt kỹ thuật lẫn sự dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.