Sản phẩm
Berkeley RDI ra mắt CUA-Lite: Nền tảng mã nguồn mở chuẩn hóa cho AI điều khiển máy tính
(giờ Việt Nam)
Tóm tắt AI
Berkeley RDI giới thiệu CUA-Lite, nền tảng mã nguồn mở cung cấp các bộ tiêu chuẩn hóa về môi trường, dữ liệu và quy trình huấn luyện cho các tác nhân AI có khả năng sử dụng máy tính (CUA).
Bản dịch AI

Tháng 9 năm 2026
Giới thiệu CUA-Lite, một nền tảng mở để phát triển các tác nhân sử dụng máy tính (computer-use agents). Nền tảng này được xây dựng dựa trên ba thành phần trừu tượng hóa tiêu chuẩn — Lite.Gym cho môi trường, Lite.Sample cho dữ liệu có giám sát, và một bộ harness (bộ khung kết nối) cho mỗi mô hình dùng chung cho đánh giá (eval), SFT và RL. Hơn 15 benchmark, hơn 10 bộ dữ liệu và hơn 30.000 tác vụ có thể kiểm chứng đã được tích hợp sẵn.
Code ↗ · Trang dự án ↗
Tại sao chọn CUA-Lite
Các tác nhân sử dụng máy tính vận hành các ứng dụng trên máy tính để bàn, trình duyệt và thiết bị di động. Việc phát triển một tác nhân như vậy đòi hỏi các môi trường có tác vụ kiểm chứng được, dữ liệu có giám sát, các mô hình, cùng với bộ harness để chạy mô hình trong môi trường đó. Các nỗ lực mã nguồn mở cho cả ba thành phần này đã tồn tại nhưng vẫn còn phân mảnh: mỗi môi trường có giao diện và runtime riêng; mỗi bộ dữ liệu có giám sát có định dạng riêng; mỗi mô hình có không gian hành động, định dạng prompt và mã thực thi (rollout code) riêng.
Nếu không có một tiêu chuẩn chung, việc kết nối các mô hình với môi trường đồng nghĩa với việc phải viết lại cùng một loại mã: ánh xạ hành động, cửa sổ ngữ cảnh và vòng lặp thực thi — khiến cho tài nguyên không thể được gộp chung và mở rộng, đồng thời việc đánh giá, SFT và RL cũng không thể chia sẻ chung một cơ sở hạ tầng.
CUA-Lite giải quyết cả ba vấn đề này tại một nơi duy nhất:
Lite.Gym: Giao diện môi trường thống nhất
Bất kỳ tác nhân nào cũng có thể kết nối với bất kỳ môi trường nào thông qua một giao diện duy nhất. lite.gym hiển thị môi trường dưới dạng vòng lặp reset / step / close theo phong cách Gym. Vòng lặp này tiêu chuẩn hóa một định dạng quan sát trên các môi trường — ảnh chụp màn hình, văn bản hoặc cả hai cho mỗi lần gọi công cụ — và một không gian hành động GUI cho mỗi nền tảng, được thực hiện dưới dạng các lệnh gọi công cụ: nhấp và gõ trên máy tính để bàn và trình duyệt, chạm và vuốt trên thiết bị di động, cùng các công cụ bổ sung cho từng môi trường như bash trong các sandbox máy tính để bàn của chúng tôi. Nó bao bọc runtime riêng của môi trường: máy ảo (VM), trình duyệt hoặc trình giả lập di động.
lite.gym
CUA-Lite cũng cung cấp các sandbox máy tính để bàn không cần VM, nhẹ và tùy chọn: các container Docker mô phỏng máy tính để bàn của OSWorld với chi phí thấp hơn nhiều và chứa hơn 30.000 tác vụ có thể kiểm chứng để huấn luyện. Chúng không cần /dev/kvm, loại ảo hóa phần cứng mà các benchmark dựa trên VM yêu cầu, vì vậy chúng chạy trên bất kỳ máy chủ nào có Docker — và Lite.OSWorld (của chúng tôi) chạy các tác vụ và trình đánh giá của OSWorld mà không cần thay đổi.
OSWorld
Ubuntu.qcow2
QEMU · KVM
/dev/kvm
Vượt ra ngoài OSWorld: các sandbox huấn luyện có khả năng mở rộng
Container không cần VM không chỉ dành cho OSWorld — đó là nền tảng cho hệ sinh thái sandbox của CUA-Lite. Cơ sở này đã chạy được các tác vụ trình duyệt, máy tính để bàn và các phần mềm khoa học thực tế: GMAT để điều khiển tàu vũ trụ, PyMOL để xoay các cấu trúc protein.
Kêu gọi đóng góp sandbox. Một sandbox chỉ có giá trị khi có người sử dụng nó. Hãy thêm sandbox của bạn vào CUA-Lite, và mọi tác nhân sẽ được huấn luyện và đánh giá trên đó — ngay bây giờ và trong tương lai. Một lần tích hợp, cả lĩnh vực sẽ cùng phát triển dựa trên đó.
Các môi trường Lite.* ↗ · Hướng dẫn môi trường ↗ · Bảng xếp hạng ↓
Lite.Sample: Định dạng dữ liệu có giám sát thống nhất
Chỉ cần chuyển đổi bộ dữ liệu một lần, mọi tác nhân đều có thể huấn luyện trên đó. LiteSample là lược đồ duy nhất, được chia sẻ trên mọi môi trường, tác nhân và loại tác vụ, miễn phí trên Hugging Face.
Một cấu trúc chung cho tất cả, bất kể nguồn gốc từ đâu: các thông điệp mà các lệnh gọi công cụ là hành động của giao diện và kết quả của công cụ là các quan sát — từ nhãn định vị GUI đến toàn bộ quá trình thực thi.
LiteSample{ }
CUA-Lite cung cấp một bộ chuyển đổi (adapter) cho mỗi mô hình, đóng gói LiteSample thống nhất thành định dạng huấn luyện chính xác mà mỗi mô hình cần. Hình trên cho thấy một ví dụ, cùng với các khối xây dựng để bạn tự thêm bộ chuyển đổi của riêng mình.
Hơn 10 bộ dữ liệu đã có mặt trên Hugging Face: các tập dữ liệu CUA hiện có — định vị · hiểu biết · sử dụng — đã được tiền xử lý thành Lite.Sample, cùng với các dữ liệu thực thi mới từ các CUA tiên tiến. Hãy duyệt qua các tập dữ liệu và kết quả thực thi; bên dưới là một trong số đó, WebGym:
huggingface.co/datasets/cua-lite/ mở ↗
Kêu gọi đóng góp dữ liệu. Dữ liệu chỉ có giá trị khi các mô hình có thể huấn luyện trên đó. Hãy chia sẻ dữ liệu của bạn với CUA-Lite, và mọi tác nhân sẽ được huấn luyện trên đó — ngay cả với những mô hình chưa tồn tại. Một lần chuyển đổi, cả cộng đồng sẽ cùng huấn luyện trên đó.
Hướng dẫn tiền xử lý ↗ · Bộ harness cho tác nhân ↗ · Hướng dẫn SFT ↗
Bộ harness cho mô hình: dùng chung cho đánh giá, SFT & RL
Mỗi mô hình có một bộ harness, là đoạn mã giúp điều chỉnh mô hình đó phù hợp với giao diện và định dạng. Thông qua bộ harness, một mô hình có thể chạy trong mọi môi trường tích hợp, và quá trình đánh giá cũng như RL sẽ sử dụng các kết quả thực thi mà nó tạo ra; với cùng bộ harness đó, bất kỳ LiteSample nào được lưu trữ đều được chuyển đổi sang định dạng huấn luyện riêng của mô hình để thực hiện SFT — ở đây là của Qwen3.5:
bước 1 instr · img1act1
bước 2 instr · img1act1img2act2
bước 3 instr · img1act1img2act2img3act3
bước 4 instr · img1act1img2act2img3act3img4act4 1 forward · loss ×4
bước 5 hist ×4img5act5
bước 6 hist ×4img5act5img6act6 1 forward · loss ×2
Đánh giá, bất kỳ tác nhân nào trên bất kỳ benchmark nào
Thiết lập --model-id cho tác nhân và --env-id cho benchmark:
evaluate.sh
Bài viết được AI dịch và tổng hợp tự động từ Berkeley RDI: Blog (an toàn và đánh giá AI). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.