MarkTechPost
85

Sản phẩm

UC Berkeley ra mắt CUA-Lite: Nền tảng mã nguồn mở thống nhất cho tác nhân AI điều khiển máy tính

(giờ Việt Nam)

Tóm tắt AI

CUA-Lite là nền tảng toàn diện từ UC Berkeley giúp chuẩn hóa môi trường, dữ liệu và đánh giá cho các tác nhân AI điều khiển máy tính, hỗ trợ đa nền tảng từ desktop đến di động.

Bản dịch AI

UC Berkeley Researchers Release CUA-Lite, an Open Platform Unifying Sandboxes, Data, Evaluation and RL for Computer-Use Agents

Một nhóm các nhà nghiên cứu từ UC Berkeley vừa ra mắt CUA-Lite, một nền tảng mở dành cho các tác nhân sử dụng máy tính (computer-use agents - CUA). Lập luận đằng sau nền tảng này mang tính hạ tầng hơn là tập trung vào mô hình: việc huấn luyện và đánh giá một CUA đòi hỏi bốn thành phần: tác nhân, môi trường, dấu vết (traces) và một khung làm việc để đánh giá cũng như huấn luyện chúng. Hiện tại, cả bốn thành phần này đang bị phân mảnh trên các kho lưu trữ riêng biệt với các giao diện không tương thích. CUA-Lite hợp nhất chúng đằng sau một không gian hành động, một lược đồ dữ liệu và một câu lệnh duy nhất, áp dụng cho cả máy tính để bàn, trình duyệt và thiết bị di động.

Nền tảng này có khả năng triển khai không? Có. Bộ công cụ này cài đặt bằng lệnh `uv sync --all-extras` trên Python 3.12, và các sandbox nhẹ của nó chạy trên bất kỳ máy chủ Docker nào mà không cần `/dev/kvm`, vì vậy các instance trên đám mây, CI runner và các container lồng nhau đều hoạt động tốt.

Thuế VM (VM tax) và cách Lite.OSWorld loại bỏ nó

Đóng góp cụ thể nhất chính là Lite.OSWorld. OSWorld cung cấp một môi trường máy tính để bàn Ubuntu chân thực, nhưng nó được phân phối dưới dạng một máy ảo QEMU/KVM đầy đủ cho mỗi tác vụ, đòi hỏi ảo hóa lồng nhau (nested virtualization) mà hầu hết các hạ tầng được quản lý không hỗ trợ. CUA-Lite tái tạo bộ tác vụ và các trình đánh giá tương tự trên môi trường máy tính để bàn GNOME bên trong một container Docker thông thường.

Độ trung thực là mối quan tâm hiển nhiên khi bạn thay thế máy ảo bằng container, và nhóm nghiên cứu đã giải quyết trực tiếp vấn đề này: trên 13 mô hình, điểm số của Lite.OSWorld khớp với máy ảo OSWorld, vì vậy điểm số hoặc tín hiệu huấn luyện thu được trong container có thể chuyển đổi ngược lại cho các benchmark thực tế. Nền tảng cơ sở này hiện hỗ trợ một loạt các sandbox: Lite.ScaleCUA, Lite.CUAGym và Lite.CUAWorld, trong đó Lite.CUAWorld mở rộng ra khoảng 40 ứng dụng bao gồm Blender, QGIS và VS Code. Tổng cộng, nền tảng này tuyên bố có hơn 30.000 tác vụ có thể kiểm chứng.

Một lược đồ cho dữ liệu, một bộ chuyển đổi (adapter) cho mỗi mô hình

Lớp thứ hai của CUA-Lite là LiteSample, một lược đồ học có giám sát duy nhất được chia sẻ trên mọi môi trường, tác nhân và loại tác vụ, được phân phối dưới dạng tệp parquet kèm theo hình ảnh. Hơn mười bộ dữ liệu CUA hiện có đã được tiền xử lý theo định dạng này và xuất bản miễn phí trên Hugging Face, bao gồm Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey và Multimodal-Mind2Web. Bên cạnh các kho dữ liệu đó là các bộ dữ liệu rollout mới được tạo ra bằng cách chạy một mô hình giáo viên tiên tiến thông qua các sandbox, nhằm mục đích chưng cất (distillation) kiến thức cho các mô hình học sinh nhỏ hơn.

Vì các dòng mô hình khác nhau yêu cầu các cấu trúc hỗ trợ khác nhau, khung làm việc này cung cấp một bộ chuyển đổi (adapter) cho mỗi mô hình, giúp đóng gói LiteSample thống nhất vào định dạng huấn luyện riêng của từng mô hình, bao gồm cả việc thu gọn lịch sử (history collapsing) để nhiều bước có thể chia sẻ chung một lượt truyền xuôi (forward pass).

Đánh giá, SFT và RL chỉ với một câu lệnh

Các tác nhân và môi trường kết nối với nhau trong lite.gym: ảnh chụp màn hình được gửi lên, hành động được gửi xuống, với một không gian hành động duy nhất cho mỗi nền tảng. Hơn 10 tác nhân được tích hợp bao gồm GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI và các tác nhân khác; cùng hơn 15 benchmark được tích hợp, bao gồm các lĩnh vực: định vị (ScreenSpot-Pro, OSWorld-G), máy tính để bàn (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), trình duyệt (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) và thiết bị di động (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Việc thay đổi `--model-id` và `--env-id` trong các tệp `scripts/rollout.py` là toàn bộ giao diện cần thao tác.

Vòng lặp tương tự cũng phục vụ cho việc huấn luyện. Đối với SFT, tệp README ghi lại quá trình tinh chỉnh (fine-tuning) Qwen3-VL-2B-Instruct trên các quỹ đạo máy tính để bàn của Lite.ScaleCUA, giúp nâng mức lợi nhuận trung bình của tập (mean episode return) từ 0,138 lên 0,237 trên tập đánh giá 332 tác vụ của lite.osworld. Đây là một cấu hình được báo cáo trên hai GPU, không phải là kết quả được tái lập độc lập. Đối với RL, các kết quả rollout được ghi điểm trong môi trường sẽ thúc đẩy các cập nhật GRPO trên nền tảng Slime, với một ví dụ thực tế về MobileGym bao phủ 416 tác vụ di động trên 28 ứng dụng.

Giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem Trang dự án, Kho lưu trữ GitHub và các Bộ dữ liệu trên Hugging Face. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML với hơn 150.000 thành viên của chúng tôi cũng như Đăng ký nhận Bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Bạn cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về các tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

AICUA-LiteUC BerkeleyTác nhân AINghiên cứu AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.