OmniEchoBench là bộ tiêu chuẩn mới giúp đánh giá khả năng nhận diện âm thanh không gian và điều hướng đa phương thức cho các tác nhân AI trong môi trường thực tế, kết hợp cùng mô hình OmniEcho giúp robot hiểu sâu hơn về sự tương quan giữa âm thanh và hình ảnh.
There is an awkward compute problem hiding inside AI glasses: the agent should always be available, …
DịchNewEyes là trợ lý AI thị giác trên kính Meta, sử dụng kiến trúc lai giữa thiết bị và đám mây để tối ưu hóa hiệu suất. Người dùng có thể tương tác rảnh tay thông qua cơ chế "nhìn, hỏi, làm" trong các hoạt động hàng ngày như nấu ăn hay phối đồ.
Nhà phát triển Thijs đã kết hợp GPT-6 Astra với cánh tay robot giá rẻ để vẽ tranh. Thông qua phản hồi thị giác, mô hình tự điều chỉnh nét vẽ, minh chứng cho tiềm năng đột phá của trí tuệ hiện thân (Embodied AI).
Ant Group và inclusionAI vừa mã nguồn mở Ling-3.0-flash-VL, mô hình MoE 124B với khả năng xử lý thị giác chuyên sâu, tối ưu cho các tác vụ điều khiển giao diện, lập trình front-end và y tế.
Alibaba phát hành Qwen-Drive-1.0-4B, mô hình ngôn ngữ thị giác dựa trên Qwen3.5-4B, hỗ trợ nhận diện 3D và lập kế hoạch quỹ đạo cho xe tự hành theo giấy phép Apache 2.0.
Đội ngũ Qwen của Alibaba vừa giới thiệu Qwen-Drive-1.0-4B, mô hình mã nguồn mở kết hợp khả năng hiểu bối cảnh giao thông và lập kế hoạch di chuyển cho xe tự hành, dựa trên nền tảng Qwen3.5-4B.
Giám đốc nghiên cứu ứng dụng tại OpenAI khẳng định, với sự ra đời của Astra, AI đã chính thức bắt kịp con người trong lĩnh vực suy luận không gian - một trong những lợi thế cuối cùng của trí tuệ nhân loại.
From a single prompt to a finished film. No studio. No crew. Just AI. We're walking through the full…
DịchAlibaba Cloud ra mắt bộ công cụ AI thị giác toàn diện: Qwen-Image 3.0 hỗ trợ tạo ảnh đa ngôn ngữ, Wan 3.0 tạo video 30 giây sống động và WonderClip tự động hóa quy trình từ kịch bản đến hậu kỳ.
Startup Perceptron vừa giới thiệu Isaac 0.5, mô hình AI thị giác mã nguồn mở giúp robot công nghiệp tự động điều hướng và xử lý dữ liệu video trong môi trường nhà xưởng, sau khi huy động thành công 21 triệu USD.
WorldToken tối ưu hóa việc học của robot bằng cách hợp nhất dữ liệu đa phương thức thành một 'world token' duy nhất, giúp mô hình Transformer xử lý trình tự hiệu quả hơn. Phương pháp này đạt tỷ lệ thành công ấn tượng 59,45% trên 23 tác vụ RoboCasa phức tạp.
Grok Build is incredible 🔥 I just built this interactive visual that I can control with my hands. …
DịchGrok Build cho phép người dùng tương tác trực tiếp với các hiệu ứng hình ảnh thông qua camera máy tính, biến cử chỉ bàn tay thành công cụ điều khiển sáng tạo đầy ấn tượng.
EditBridge tối ưu hóa việc chỉnh sửa ảnh độ phân giải cao bằng cách chuyển đổi từ bản thấp phân giải, giúp giữ trọn chi tiết gốc. Công nghệ này tăng tốc xử lý lên đến 8,4 lần, cho phép chỉnh sửa ảnh 4K chỉ trong 61 giây.
StreamOPD giới thiệu phương pháp hậu huấn luyện không cần bộ nhớ suy luận, giúp cải thiện đáng kể hiệu suất hiểu video trên các bộ dữ liệu chuẩn, tiệm cận kết quả của các mô hình lớn hơn.
Đoạn video rò rỉ từ macOS Tahoe cho thấy AirPods thế hệ mới có khả năng nhận diện vật thể qua camera và tích hợp Visual Intelligence, cho phép Siri tương tác trực tiếp với những gì người dùng đang nhìn thấy.