IT Home
88

Mô hình

Alibaba ra mắt Qwen-UI-Agent: Bước tiến mới giúp AI 'thao túng' mọi giao diện màn hình

(giờ Việt Nam)

Tóm tắt AI

Alibaba vừa giới thiệu Qwen-UI-Agent, mô hình nền tảng cho phép AI tương tác trực tiếp với giao diện người dùng trên cả di động, máy tính và trình duyệt một cách thông minh.

Bản dịch AI

Theo thông tin từ tài khoản chính thức của mô hình ngôn ngữ lớn Qwen vào ngày 20 tháng 8, IT đưa tin Alibaba đã chính thức ra mắt Qwen-UI-Agent, một mô hình nền tảng tác nhân GUI (giao diện người dùng đồ họa) lấy thế giới thực làm trung tâm, bao phủ các môi trường thiết bị di động, máy tính, trình duyệt web và tìm kiếm chuyên sâu (DeepSearch).

Theo giới thiệu, Qwen-UI-Agent đã đối chuẩn toàn diện và thậm chí vượt qua các mô hình hàng đầu trong ngành về các tác vụ GUI:

Thiết bị di động: Đạt 82,1% trên MobileWorld, dẫn trước GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro lần lượt là 12,0, 14,6 và 8,9 điểm phần trăm; đạt 92,2% trên chuẩn đánh giá thực tế MobileWorld-Real, vượt qua Gemini 1.5 Pro, Claude 3.5 Sonnet, GPT-4o; đạt 97,5% trên AndroidDaily, gần như đạt điểm tuyệt đối.

Máy tính: Đạt 79,5% trên OSWorld-Verified, vượt qua GPT-4o, Gemini 1.5 Pro; đạt 40,0% trên OSWorld-v2 Partial, đồng thời tiết kiệm 58% số bước thực hiện so với mô hình cơ sở.

Trình duyệt & DeepSearch: Đạt 73,6% trên WebArena, đứng đầu trong tất cả các mô hình so sánh; đạt 75,0% trên BrowseComp-ZH.

GUI Grounding: Đạt 81,5% trên ScreenSpot-Pro, đồng thời thiết lập kỷ lục SOTA mới trên cả 4 chuẩn đánh giá grounding còn lại.

Khả năng tổng quát: Duy trì hoặc vượt qua mô hình nền tảng huấn luyện về cả khả năng tổng quát lẫn khả năng tác nhân (Agentic), đồng thời dẫn trước đáng kể các mô hình chuyên dụng cho GUI trong cả hai loại tác vụ này, giúp xử lý linh hoạt các nhu cầu dài hạn (long-tail) trong thế giới thực.

Qwen-UI-Agent xây dựng môi trường di động thực tế bao phủ hơn 100 điện thoại thật và hơn 150 ứng dụng để phục vụ việc xây dựng tác vụ, thu thập quỹ đạo, huấn luyện và đánh giá mô hình, đồng thời tự xây dựng chuẩn đánh giá thực tế MobileWorld-Real (hơn 400 tác vụ, hơn 100 ứng dụng), hoàn thiện "chặng đường cuối" từ mô phỏng đến thực tế.

Prompt: Hôm nay tôi có hẹn với bạn ở Tianmuli để uống cà phê, hãy giúp tôi tìm kiếm địa chỉ chi tiết trên Amap, mở Dazhong Dianping để tìm các quán cà phê trong bán kính 1 km, tìm quán được yêu thích nhất và ghi lại tên quán, sau đó vào Xiaohongshu tóm tắt 5 bài đăng đầu tiên để xem mọi người gợi ý món cà phê nào tại quán này.

Prompt: Thứ Tư tuần sau tôi từ Bắc Kinh trở về, hãy giúp tôi xem chuyến tàu cao tốc sớm nhất đến Hàng Châu Tây đến lúc mấy giờ. Sau đó kiểm tra xem đi tàu điện ngầm từ Hàng Châu Tây đến khuôn viên Alibaba Xixi mất bao lâu, tính toán xem tôi có thể đến công ty lúc mấy giờ. Cuối cùng, hãy đặt một cuộc họp trên DingTalk vào đúng giờ tôi đến. Chủ đề là "Đồng bộ dự án sau chuyến công tác", người tham gia là tôi và Zhang San. Cuộc họp kéo dài một giờ, thiết lập nhắc nhở trước 5 phút.

Prompt: Tìm tất cả các biên lai trong thư viện ảnh điện thoại, di chuyển chúng vào thư mục receipts trên máy tính để bàn từ xa, đổi tên theo ngày tháng và tạo một tệp Excel trong thư mục đó để tổng hợp hóa đơn.

Qwen-UI-Agent tích hợp khả năng đánh giá an toàn vào toàn bộ quá trình thực thi tác vụ: Đối với các yêu cầu bất hợp pháp hoặc có rủi ro cao, mô hình sẽ không thực hiện bất kỳ thao tác giao diện nào, từ chối trực tiếp và chấm dứt tác vụ; đối với các tình huống nhạy cảm như thanh toán, xóa dữ liệu, cấp quyền riêng tư, mô hình sẽ chủ động dừng lại ở các bước quan trọng, giải thích tình hình cho người dùng và chỉ tiếp tục sau khi nhận được xác nhận rõ ràng. Không thực hiện yêu cầu nguy hiểm, không tự ý quyết định các thao tác nhạy cảm, giúp mô hình vừa có khả năng thực thi, vừa biết khi nào cần dừng lại.

Ngoài các thao tác GUI, mô hình còn có thể thực hiện trực tiếp các lệnh dòng lệnh (CLI) và xuất ra nhiều hành động hàng loạt trong một lần ra quyết định. Trong các tác vụ máy tính, các hành động CLI chiếm gần một nửa, khoảng 40% hành động được xuất ra dưới dạng batched actions, giúp rút ngắn đáng kể quỹ đạo thực thi, mở rộng biên độ khả năng và nâng cao hiệu quả thực thi. Ví dụ: nghiên cứu sản phẩm trên nhiều trang web, đối chiếu giá cả và tạo phương án so sánh giá.

Mô hình hỗ trợ huấn luyện RL trực tuyến trên các quỹ đạo siêu dài hơn 100 bước, với khoảng 10.000 môi trường đồng thời được triển khai (rollout), kết hợp với học tập theo chương trình thích ứng của mô hình để liên tục chinh phục các tác vụ dài hạn.

IT đính kèm các liên kết liên quan như sau:

Báo cáo kỹ thuật: https://arxiv.org/abs/2607.28227

Trang chủ dự án: https://tongyi-mai.github.io/Qwen-UI-Agent

GitHub: https://github.com/Tongyi-MAI/MAI-UI

Tuyên bố quảng cáo: Các liên kết ngoài có trong bài viết (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian sàng lọc, kết quả chỉ mang tính chất tham khảo. Các bài viết của IT có chứa liên kết ngoài đều bao gồm tuyên bố này.

AlibabaQwenAI AgentTự động hóaGiao diện người dùng
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.