QbitAI
85

Sản phẩm

ra mắt giải pháp thị giác cho robot thông minh, đặt nền móng cho AI vật lý

(giờ Việt Nam)

Tóm tắt AI

vừa giới thiệu giải pháp cảm biến thị giác chuyên dụng cho robot thông minh, giúp các hệ thống AI vật lý có khả năng quan sát và tương tác với môi trường thực tế chính xác hơn.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-07-20 13:52:15 Nguồn: QbitAI

Với sự phát triển không ngừng của các mô hình đa phương thức lớn (multimodal large models) và VLA, trí tuệ thể chất (embodied AI) đang tăng tốc tiến tới công nghiệp hóa. Robot ngày càng sở hữu khả năng hiểu, suy luận và ra quyết định mạnh mẽ hơn, nhưng khi thực sự bước vào các môi trường thực tế như gia đình, nhà máy hay thương mại, yếu tố quyết định năng lực ứng dụng của chúng không chỉ nằm ở việc "bộ não" có đủ thông minh hay không, mà còn ở khả năng cảm nhận và thấu hiểu thế giới vật lý một cách chính xác.

Các năng lực như điều hướng tự chủ, gắp vật thể tinh vi, tương tác người-máy đều được xây dựng trên nền tảng cảm biến thị giác 3D đáng tin cậy. Cảm biến thị giác không chỉ là việc xuất dữ liệu chiều sâu, mà còn là nền tảng quan trọng để robot hiểu môi trường và thực hiện nhiệm vụ. Làm thế nào để liên tục xuất ra thông tin thị giác chính xác, ổn định và hiệu quả trong các bối cảnh phức tạp đang trở thành nền tảng quan trọng để trí tuệ thể chất tiến tới ứng dụng quy mô lớn.

Dựa trên xu hướng này, Lumotive (Guangjian Technology) chính thức ra mắt giải pháp cảm biến thị giác cho trí tuệ thể chất. Giải pháp này lấy công nghệ thị giác song nhãn (binocular vision) AI làm cốt lõi, kết hợp thuật toán cảm biến thông minh và kiến trúc tính toán hiệu quả, cung cấp cho robot năng lực thị giác bao phủ các kịch bản cốt lõi như cảm nhận môi trường, hiểu không gian, định vị điều hướng và thao tác tinh vi, giúp trí tuệ thể chất tăng tốc tiến vào thế giới thực.

Tại sao trí tuệ thể chất cần cảm biến thị giác mạnh mẽ hơn?

Khi trí tuệ thể chất liên tục tiến vào thế giới thực, thị giác robot đang đối mặt với những thách thức mới.

Trước hết, môi trường thực tế phức tạp hơn nhiều. Các bối cảnh phức tạp như kính trong suốt, kim loại phản quang cao, bề mặt tường ít vân, vật thể màu đen... xuất hiện phổ biến, đặt ra yêu cầu cao hơn về tính toàn vẹn và ổn định của thông tin chiều sâu. Các giải pháp khớp lập thể song nhãn truyền thống dễ gặp các vấn đề như mất dữ liệu chiều sâu, nhiễu đám mây điểm trong những bối cảnh này, ảnh hưởng đến khả năng hiểu môi trường chính xác của trí tuệ thể chất, từ đó ảnh hưởng đến hiệu quả thực hiện các nhiệm vụ như tránh vật cản, gắp vật thể và điều hướng.

Thứ hai, các nhiệm vụ mà trí tuệ thể chất đảm nhận ngày càng đa dạng. Từ điều hướng, tránh vật cản đến gắp vật thể, thao tác và tương tác người-máy, một hệ thống thị giác không chỉ cần xuất ra thông tin chiều sâu chất lượng cao mà còn phải hỗ trợ đồng thời nhiều loại nhiệm vụ như định vị SLAM, phát hiện mục tiêu, suy luận VLA, nhằm đạt được sự phối hợp hiệu quả giữa cảm nhận và trí tuệ.

Cuối cùng, sức mạnh tính toán tại biên (edge computing) ngày càng quý giá. Khi các mô hình lớn dần được triển khai vào trí tuệ thể chất, tài nguyên tính toán hạn chế cần phải hỗ trợ đồng thời nhiều khâu như cảm nhận, định vị, lập kế hoạch và suy luận. Làm thế nào để giảm mức tiêu thụ tài nguyên tính toán trong khi vẫn đảm bảo chất lượng cảm nhận, giải phóng thêm sức mạnh tính toán cho suy luận thông minh, đã trở thành hướng phát triển quan trọng của cảm biến thị giác robot.

Cuộc cạnh tranh về cảm biến thị giác robot không còn giới hạn ở hiệu suất phần cứng đơn lẻ, mà là tìm kiếm sự cân bằng mới giữa chất lượng cảm nhận, sự phối hợp hệ thống và hiệu quả tính toán. Điều mà trí tuệ thể chất thực sự cần không phải là nhiều phần cứng thị giác hơn, mà là xây dựng một bộ năng lực thị giác hiệu quả, đáng tin cậy và thống nhất hơn.

Câu trả lời của Lumotive: Giúp robot cảm nhận chính xác hơn, ổn định hơn và hiệu quả hơn.

Xoay quanh nhu cầu phát triển và những điểm đau thực tế của trí tuệ thể chất, Lumotive công bố giải pháp cảm biến thị giác trí tuệ thể chất hoàn toàn mới, thông qua thị giác song nhãn AI, thiết kế cảm nhận tổng quát toàn vùng và kiến trúc tính toán hiệu quả để xây dựng năng lực thị giác bao phủ các kịch bản ứng dụng khác nhau của robot. Câu trả lời của Lumotive không chỉ là một camera chiều sâu có hiệu suất mạnh hơn, mà là một giải pháp cảm biến thị giác có khả năng hỗ trợ sự tiến hóa liên tục của trí tuệ thể chất.

Thị giác song nhãn AI, giúp nhìn chuẩn hơn trong các bối cảnh phức tạp.

Lumotive đưa thuật toán AI vào thị giác song nhãn, thông qua thuật toán khớp lập thể hiệu suất cao tự phát triển, đạt được sự nâng cấp toàn diện về năng lực cảm nhận không gian.

So với thị giác song nhãn truyền thống phụ thuộc vào khớp vân bề mặt cục bộ, thị giác song nhãn AI có thể hiểu sâu hơn về cấu trúc bối cảnh và mối quan hệ giữa các vật thể. Khi đối mặt với các vật liệu phức tạp như kính trong suốt, phản quang cao, màu đen..., nó vẫn duy trì khả năng phục hồi chiều sâu ổn định, xuất ra thông tin chiều sâu chất lượng cao với các cạnh liên tục, chi tiết phong phú và cấu trúc hoàn chỉnh, đạt được khả năng tái tạo ổn định các chi tiết ở mức milimet.

Trình diễn hiệu ứng đám mây điểm của Libra 1000 đối với các vật liệu khác nhau.

Đối với việc tái tạo các vật thể nhỏ ở cự ly gần, giải pháp cảm biến thị giác trí tuệ thể chất của Lumotive có thể cung cấp chi tiết thị giác phong phú hơn và các ràng buộc song nhãn chính xác, giúp đám mây điểm tái tạo có đường viền vật thể rõ ràng hơn, cạnh sắc nét hơn và cấu trúc bề mặt trơn tru, liên tục hơn, đáp ứng tốt hơn các yêu cầu ứng dụng như thao tác tinh vi, tránh vật cản và hiểu không gian của robot.

Trình diễn hiệu ứng đám mây điểm của Libra 1000 đối với các vật thể nhỏ.

(0,1cm chỉ điểm hẹp nhất của tay cầm kẹp giấy, 0,5cm và 1,5cm chỉ đường kính của bút chì và bút dạ).

Trong bối cảnh phức tạp với kính trong suốt, giải pháp cảm biến thị giác trí tuệ thể chất của Lumotive có thể kết hợp hiệu quả các đặc trưng hình ảnh và thông tin cấu trúc không gian, giảm thiểu nhiễu khớp do vật liệu trong suốt gây ra, nâng cao tính toàn vẹn và ổn định của chiều sâu trong các vùng trong suốt, cung cấp thông tin chiều sâu đáng tin cậy hơn cho việc tránh vật cản và lập kế hoạch đường đi của robot trong môi trường thực tế.

Trình diễn hình ảnh hiệu quả của Libra 3000 đối với bối cảnh phức tạp có kính trong suốt.

Trong các bối cảnh như ít vân bề mặt, giải pháp cảm biến thị giác trí tuệ thể chất của Lumotive vượt qua sự phụ thuộc vào các đặc trưng vân cục bộ, thông qua việc đánh giá tổng hợp kết hợp cạnh vật thể, cấu trúc hình học và mối quan hệ không gian, giảm thiểu hiệu quả các bất thường về chiều sâu do thiếu vân, giúp các cạnh bậc thang, cấu trúc mặt đứng và sự thay đổi độ cao được thể hiện chính xác hơn, nâng cao năng lực hiểu không gian của robot trong môi trường phức tạp.

Trình diễn hình ảnh hiệu quả của Libra 3000 đối với bối cảnh phức tạp ít vân bề mặt.

Cảm nhận tổng quát toàn vùng, giúp một hệ thống thị giác bao phủ nhiều nhiệm vụ hơn.

Giải pháp cảm biến thị giác trí tuệ thể chất của Lumotive áp dụng thiết kế cảm nhận tổng quát toàn vùng, sử dụng nền tảng phần cứng thống nhất để hỗ trợ nhiều loại nhiệm vụ như cảm nhận chiều sâu, định vị SLAM, phát hiện mục tiêu..., giúp một hệ thống thị giác bao phủ các nhu cầu kịch bản và nhiệm vụ khác nhau của robot, đồng thời hỗ trợ nâng cấp liên tục qua OTA. So với các giải pháp truyền thống cấu hình phần cứng cảm biến riêng biệt cho từng chức năng, thiết kế cảm nhận tổng quát toàn vùng nâng cao hơn nữa tính phổ quát và khả năng phối hợp đa nhiệm của hệ thống thị giác, xây dựng năng lực thị giác thống nhất và hiệu quả hơn cho trí tuệ thể chất.

Kiến trúc tính toán hiệu quả, giúp nhiều sức mạnh tính toán phục vụ cho quyết định thông minh.

Giải pháp cảm biến thị giác trí tuệ thể chất của Lumotive thông qua việc tối ưu hóa kiến trúc tính toán cảm biến, giảm đáng kể nhu cầu về sức mạnh tính toán. Với tài nguyên tính toán ít hơn, nó có thể xuất ra ổn định hình ảnh chiều sâu chất lượng cao, tốc độ khung hình cao, giúp nhiều tài nguyên tính toán hơn phục vụ cho các nhiệm vụ cốt lõi như suy luận VLA, định vị SLAM, dành ra không gian lớn hơn cho việc nâng cấp trí tuệ của trí tuệ thể chất.

Dòng sản phẩm Libra: Bao phủ thao tác và cảm nhận không gian.

Nhằm vào hai nhu cầu thị giác cốt lõi là thao tác và di chuyển của robot, Lumotive ra mắt dòng mô-đun thị giác song nhãn AI Libra, bao phủ các ứng dụng cốt lõi của trí tuệ thể chất từ thao tác tinh vi cự ly gần đến cảm nhận không gian cự ly trung bình và xa.

Libra 1000: Hướng tới thao tác tinh vi cự ly gần.

Libra 1000 sử dụng thiết kế khoảng cách cơ sở (baseline) 2cm, định vị cho cảm biến thao tác tại cổ tay, phù hợp với các kịch bản như gắp bằng cánh tay robot, thao tác bằng tay khéo léo, điều khiển từ xa và thu thập dữ liệu, cung cấp năng lực thị giác cự ly gần đáng tin cậy cho thao tác tinh vi của trí tuệ thể chất. Ngoài ra, sản phẩm hỗ trợ tương thích với ống kính mắt cá song nhãn, có thể đạt được trường nhìn ngang hơn 180°, mở rộng hiệu quả phạm vi quan sát trường gần, đáp ứng tối đa các yêu cầu khắt khe về FOV cảm biến cho các nhiệm vụ gắp cự ly gần.

Libra 3000: Hướng tới cảm nhận không gian cự ly trung bình và xa.

Libra 3000 sử dụng thiết kế khoảng cách cơ sở 7cm, định vị cho cảm biến không gian tại đầu robot, chủ yếu ứng dụng trong các kịch bản như tránh vật cản cự ly trung bình và xa, định vị SLAM và lập bản đồ không gian. Nhờ năng lực cảm nhận không gian ổn định và xuất đám mây điểm chất lượng cao, nó cung cấp sự hỗ trợ đáng tin cậy cho việc di chuyển tự chủ, hiểu môi trường và tương tác không gian của trí tuệ thể chất. Đồng thời, Libra 3000 có thể tích hợp thuật toán cảm nhận không gian bên trong, kết hợp năng lực hiểu không gian trên nền tảng phần cứng thị giác 3D, hiện thực hóa việc tích hợp thu thập thị giác, tính toán chiều sâu và cảm nhận không gian.

Robot thông minhThị giác máy tínhAI vật lýCông nghệ cảm biến
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.