IT Home
92

Thủ thuật

Giải mã tham vọng của OpenAI: Biến AI thành 'trợ lý ảo' thao tác máy tính như người thật

(giờ Việt Nam)

Tóm tắt AI

OpenAI đang tiến gần đến mục tiêu tạo ra các AI Agent có khả năng tự vận hành trình duyệt và thao tác máy tính thông qua việc học từ dữ liệu thực tế và phản hồi của con người. Dù vẫn còn độ trễ trong xử lý, hệ thống đang dần hoàn thiện khả năng tự sửa lỗi và xử lý tác vụ phức tạp.

Bản dịch AI

Theo tin từ IT ngày 20 tháng 8, tờ Business Insider hôm nay đưa tin rằng các nhân viên OpenAI đang lạc quan cho rằng công ty đang tiến gần đến mục tiêu đã đặt ra từ những ngày đầu thành lập: giúp các AI agent (tác nhân AI) có khả năng thao tác máy tính thành thạo như con người, đặc biệt là trong việc sử dụng trình duyệt web.

Kể từ khi thành lập vào năm 2015, OpenAI luôn mong muốn hiện thực hóa khả năng này, và một trong những thách thức lớn nhất chính là việc thu thập đủ dữ liệu huấn luyện. Sau nhiều năm phát triển, công ty hiện đã tự tin bắt đầu dần mở khóa tính năng thao tác máy tính cho khách hàng.

Ali Weinstein, quản lý nhóm thao tác máy tính tại OpenAI, cho biết: "Một khi ChatGPT có thể thao tác máy tính và phần mềm nhanh hơn bạn và tôi, nó sẽ thay đổi cách con người mặc định tương tác với máy tính."

Các mô hình mới nhất của OpenAI đã được bổ sung các quy trình huấn luyện và dữ liệu chuyên biệt nhằm nâng cao khả năng thao tác máy tính trong mọi giai đoạn, từ đầu đến cuối quá trình huấn luyện. Zhou Yu, nhà nghiên cứu AI tại Đại học Columbia, người tham gia phát triển các bộ tiêu chuẩn đánh giá (benchmark) cho các AI agent thao tác máy tính phổ biến, giải thích rằng những bài huấn luyện này được xây dựng dựa trên năng lực sẵn có của các mô hình AI tổng quát, giúp mô hình học cách hoàn thành nhiều tác vụ máy tính hơn. Trong giai đoạn huấn luyện nền tảng quy mô lớn ban đầu, rất có thể OpenAI đã thêm vào các ảnh chụp màn hình theo từng khung hình (frame-by-frame), giúp mô hình tiếp cận sớm với các thông tin hữu ích cho việc thao tác máy tính.

Bước vào giai đoạn huấn luyện tiếp theo, các nhà phát triển sẽ trình diễn cho mô hình thấy các thao tác chính xác cần thiết để hoàn thành một tác vụ cụ thể. Ví dụ, để điền xong một biểu mẫu thuế hoặc hoàn thiện một mô hình 3D của một vật thể, cần phải để mô hình học chuỗi các thao tác máy tính tương ứng.

Một phần dữ liệu huấn luyện này đến từ các thao tác thực tế của con người. Khi công bố tính năng thao tác máy tính phiên bản 2025, OpenAI từng tiết lộ rằng công ty đã sử dụng các tập dữ liệu từ quá trình con người thực hiện các tác vụ, nhưng không tiết lộ chi tiết về dữ liệu huấn luyện mới nhất. Zhou Yu chỉ ra rằng loại dữ liệu này rất đắt đỏ vì khó thu thập, đồng thời việc xử lý chúng thành dạng có thể sử dụng trực tiếp để huấn luyện cũng đòi hỏi rất nhiều công sức.

OpenAI rất có thể cũng đã sử dụng học tăng cường (reinforcement learning) để tiếp tục cải thiện khả năng thao tác máy tính của mô hình, cho phép mô hình thử đi thử lại các tác vụ ảo và nhận phần thưởng cho những hành vi hoàn thành tác vụ thành công. Zhou Yu cho rằng, mô hình có thể học được nhiều hơn cách thực hiện các "thao tác đã từng được nhận thưởng" này.

OpenAI cũng đã thay đổi cách mô hình thu thập thông tin khi thực tế thao tác trên máy tính. Weinstein cho biết, trước đây ChatGPT cần phải chụp màn hình liên tục, phân tích điểm ảnh, gửi lệnh thao tác, rồi lại chụp màn hình để phân tích tiếp. Còn hiện tại, sau khi mở trang web, hệ thống có thể trực tiếp đọc nhanh thông tin tầng dưới của trang web, từ cấu trúc bộ nhớ, thông tin hỗ trợ tiếp cận (accessibility) cho đến các liên kết.

Ảnh chụp màn hình vẫn là một phần trong quy trình làm việc. Khi người dùng bật tính năng thao tác máy tính, họ cần cho phép ChatGPT ghi màn hình để hệ thống có thể nhận diện nhanh nội dung đang hiển thị. Weinstein cho biết, khi kết hợp các khả năng này, Codex có thể tự kiểm tra mã nguồn được tạo ra, phát hiện lỗi và tiếp tục sửa đổi, tạo thành một "vòng lặp khép kín hoàn chỉnh".

Weinstein và James Sun, người phụ trách khả năng trình duyệt của OpenAI, tin rằng một giá trị lớn của công nghệ thao tác máy tính là cho phép các agent ChatGPT có thể truy cập vào vô số dịch vụ độc lập và các trang web "long-tail" (thị trường ngách) trên internet.

Từ các trang web đặt lịch hẹn, hệ thống kho bãi nội bộ doanh nghiệp cho đến các nền tảng mạng xã hội, nhiều công cụ trực tuyến ban đầu được thiết kế để con người nhấp chuột và nhập liệu thủ công. Cả hai tiết lộ rằng đã có người dùng sử dụng tính năng thao tác máy tính để tự động hóa việc nhập liệu, thực hiện các tác vụ tuân thủ và sắp xếp lịch trình.

Weinstein chỉ ra rằng sau khi năng lực của mô hình OpenAI được nâng cao, nó ngày càng có khả năng chủ động phát hiện lỗi và tự sửa chữa, do đó dễ dàng hoàn thành tác vụ hơn và ít bị xao nhãng bởi các nội dung không liên quan trong môi trường mạng.

Zhou Yu cho rằng, tốc độ của công nghệ thao tác máy tính hiện nay vẫn còn khoảng cách đáng kể so với kỳ vọng của người tiêu dùng phổ thông. "Trong các lĩnh vực hạn chế với dữ liệu huấn luyện rất đầy đủ, các agent thao tác máy tính thực sự có thể hoạt động rất tốt. Nhưng để nó thích nghi với bất kỳ trang web, bất kỳ ứng dụng và bất kỳ hệ điều hành nào thì vẫn còn rất khó khăn."

Hiện tại, tính năng thao tác máy tính vẫn chưa thể xử lý hàng loạt email phản hồi một cách nhanh chóng, và khi duyệt các luồng tin trên mạng xã hội cũng tỏ ra khá chậm chạp. James Sun và Weinstein hy vọng rằng, cùng với việc nâng cấp các mô hình của OpenAI, thao tác máy tính cuối cùng sẽ đạt được hiệu suất như lập trình AI hiện nay, giúp AI thao tác trực tiếp trên các công cụ mạng nhanh hơn cả khi người dùng tự tay làm.

James Sun cho biết: "Đối với nhiều kỹ sư, hiện nay việc để agent viết mã đã nhanh hơn tự viết. Không cần phải cân nhắc gì cả, cứ để nó làm thôi. Tôi nghĩ thao tác máy tính sau này cũng sẽ ngày càng tiến gần đến trạng thái đó."

Năm 2025, CEO Sam Altman của OpenAI khi nói về tính năng thao tác máy tính giai đoạn đầu đã từng công khai cảnh báo: "Giá trị thực tiễn rất lớn, nhưng rủi ro tiềm ẩn cũng không hề nhỏ. Chúng tôi khuyến nghị chỉ nên cung cấp cho agent quyền hạn tối thiểu cần thiết để hoàn thành tác vụ nhằm giảm thiểu rủi ro về quyền riêng tư và bảo mật."

James Sun cho biết OpenAI vẫn luôn nghiên cứu về "chiến lược xác nhận", tức là trước khi AI thực hiện thao tác tiếp theo, cần phải yêu cầu người dùng cấp quyền trong những trường hợp nào. Nguyên tắc hiện tại là, bất cứ khi nào agent chuẩn bị truyền dữ liệu ra ngoài hoặc xóa nội dung, bắt buộc phải có sự đồng ý của người dùng. Công việc trên mạng thường đòi hỏi phải đưa ra quyết định liên tục và nhanh chóng, vì vậy OpenAI vẫn đang tìm kiếm sự cân bằng giữa tính dễ sử dụng và tính bảo mật.

Ông thẳng thắn chia sẻ: "Bạn có thể làm cho một thứ gì đó an toàn 100%, nhưng khi đó nó sẽ cực kỳ khó sử dụng. Bạn cũng có thể làm cho nó rất dễ sử dụng, nhưng đồng thời lại rất nguy hiểm. Vì vậy, vấn đề thực sự mà chúng tôi muốn giải quyết là làm sao để tạo ra một sản phẩm vừa hữu ích, vừa dễ sử dụng."

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.