Microsoft Research
85

Nghiên cứu

Echoverse: Môi trường tiến hóa chuyên sâu cho các tác nhân AI điều khiển máy tính

(giờ Việt Nam)

Tóm tắt AI

Echoverse giúp các tác nhân AI cải thiện khả năng xử lý quy trình phức tạp bằng cách huấn luyện trong môi trường mô phỏng thực tế có khả năng tự tiến hóa, thay vì chỉ tăng số lượng bài tập đơn thuần.

Bản dịch AI

Echoverse: Deep, evolving environments for computer-use agents

Ưu tiên độ trung thực hơn là số lượng đơn thuần, nhắm vào những năng lực mà các tác nhân (agents) thực sự còn thiếu, và phát triển cùng với các mô hình mà chúng được huấn luyện.

Diagram of an iterative training loop where a model generates a world, the world produces a graded run, and feedback updates both the world and the model.

Sơ lược

Chúng tôi đã xây dựng mười hai thế giới huấn luyện cho các tác nhân sử dụng máy tính: mười thế giới thuộc lĩnh vực chuyên sâu và hai thế giới năng lực, mỗi thế giới tập trung vào một cơ chế điều khiển duy nhất được thể hiện dưới nhiều hình thức (như bộ chọn ngày và bộ lọc lồng nhau). Chính độ sâu là yếu tố khiến chúng trở nên giá trị để huấn luyện: những thế giới này tái tạo hành vi thực tế của một ứng dụng, được nạp sẵn dữ liệu thực tế và duy trì trạng thái nhất quán giữa các màn hình và người dùng. Khi được huấn luyện trên cả mười hai thế giới này, một mô hình 9B gần như tăng gấp đôi điểm số cơ sở (từ 36,5% lên 67,1%), chỉ còn kém GPT-5.4 mười bốn điểm. Thí nghiệm này đã mang lại cho chúng tôi một vài bài học:

Một tác nhân sử dụng máy tính chỉ học được kết quả từ các hành động của nó ở những nơi mà chúng tạo ra hậu quả thực sự. Một cú nhấp chuột làm thay đổi trạng thái đã lưu, một tin nhắn gửi đến một người thật, hoặc một trang web từ chối chuyển hướng sẽ cho tác nhân biết rằng hành động cuối cùng của nó không có tác dụng. Ảnh chụp màn hình có thể cho thấy giao diện trông như thế nào, nhưng chỉ có một thế giới đang hoạt động mới cho thấy hành động đó đã gây ra điều gì.

Những hậu quả đáng để học hỏi đều có tính trạng thái (stateful), và hầu hết chúng nằm sau một lớp đăng nhập. Những công việc mà con người muốn tự động hóa đều nằm trong các hệ thống đóng: email và chat, ngân hàng, hồ sơ sức khỏe, các bảng điều khiển nội bộ cho đám mây và ML. Bạn không thể huấn luyện một tác nhân trên các phiên bản thực tế của những hệ thống này. Mỗi lần thử nghiệm đều ghi dữ liệu vào một tài khoản thật, không có nút đặt lại giữa các lần thử, và trạng thái thực sự vẫn bị ẩn sau màn hình. Vì vậy, bạn xây dựng lại hệ thống dưới dạng một thế giới tổng hợp (synthetic world) nơi cơ sở dữ liệu thuộc về bạn: trạng thái là thật và thay đổi thật, nhưng nó an toàn để phá vỡ, nhanh chóng để đặt lại và được chấm điểm dựa trên dữ liệu thay vì ảnh chụp màn hình.

decorative image and the text

Azure AI Foundry Labs

Khám phá thoáng qua về các hướng đi tiềm năng trong tương lai của AI với những công nghệ thử nghiệm từ Microsoft Research.

Với khái niệm "thế giới", chúng tôi muốn nói đến ba yếu tố gắn kết với nhau: một môi trường (ứng dụng, trạng thái của nó và các hành động làm thay đổi nó), các tác vụ đặt ra mục tiêu trong môi trường đó, và một bộ kiểm chứng (verifier) chấm điểm kết quả dựa trên sự thật khách quan (ground truth). Cộng đồng hiện nay đã rất giỏi trong việc tạo ra chúng: các quy trình (pipelines) thiết lập ứng dụng, nạp dữ liệu, tạo tác vụ và đính kèm bộ kiểm chứng, tạo ra hàng trăm môi trường và hàng ngàn tác vụ có thể kiểm tra được. Công trình này được xây dựng dựa trên sự tiến bộ đó. Tuy nhiên, khi các thế giới đã trở nên phong phú, cấu trúc nội tại của chúng lại trở thành nút thắt cổ chai: bất kể trạng thái có nhất quán giữa người dùng và màn hình hay không, các quy trình làm việc vẫn giữ nguyên sự phụ thuộc, một kỹ năng yếu kém lặp lại dưới đủ hình thức để khái quát hóa, và sự thành công được đánh giá bằng kết quả hoặc bằng hình thức bên ngoài.

Đặt cược của chúng tôi, điều mà Echoverse kiểm chứng, là đòn bẩy thực sự không đến từ việc thêm nhiều thế giới mà đến từ một vòng lặp liên tục cải thiện những thế giới bạn đã có. Nó coi việc xây dựng môi trường và huấn luyện mô hình là một quy trình duy nhất, không phải hai giai đoạn tách biệt: chạy một mô hình trong một thế giới, tìm ra nơi nó thất bại, cải thiện thế giới đó, các tác vụ và bộ kiểm chứng của nó trở nên trung thực hoặc khắt khe hơn, huấn luyện trên tín hiệu sắc bén hơn, và lặp lại. Việc tinh chỉnh (fine-tuning) thông thường chỉ cải thiện mô hình. Ở đây, cùng một lượt chạy được chấm điểm dùng để đo lường mô hình cũng đồng thời cải thiện thế giới đã đánh giá nó, vì vậy một điểm chuẩn tĩnh (static benchmark) sẽ bão hòa trong khi vòng lặp này lại tích lũy giá trị.

Ba đòn bẩy giữ cho vòng lặp đó hiệu quả, không cái nào trong số đó là số lượng môi trường thô. Độ sâu: các thế giới trung thực về hành vi cho các lĩnh vực quan trọng, bao gồm cả các hệ thống đóng và độc quyền. Nhắm mục tiêu năng lực: các thế giới hẹp được xây dựng xung quanh chính xác tương tác mà mô hình liên tục thất bại. Đồng tiến hóa: cải thiện môi trường, các tác vụ và bộ kiểm chứng của nó trong mỗi lượt chạy được chấm điểm, không chỉ riêng mô hình.

Circular diagram of the learning loop. A model runs a task in a world and every rollout is graded against database ground truth. Two arrows branch from the graded run: surviving failures flow to model

Tại sao lại là thế giới tổng hợp, và tại sao lại cần độ sâu?

Các trang web mở, không cần đăng nhập có vẻ như loại bỏ nhu cầu về thế giới tổng hợp, nhưng chúng lại là môi trường huấn luyện kém hiệu quả vì một lý do khác: chúng không đứng yên. Các trang web được thiết kế lại, danh sách và ngày tháng thay đổi, và các máy chủ hạn chế hoặc chặn lưu lượng truy cập tự động, vì vậy một điểm chuẩn gắn liền với chúng sẽ bị lệch, và không có hai lượt chạy nào đối mặt với cùng một trang web. Một đánh giá không thường xuyên có thể chấp nhận điều đó; nhưng huấn luyện thì không, vì nó chạy cùng một tác vụ hàng ngàn lần và cần cùng một thế giới mỗi lần. Một thế giới tổng hợp được cố định về thời gian và dữ liệu: lịch không thay đổi, dữ liệu nạp sẵn không biến động, và một tác vụ có ý nghĩa như nhau ở lần chạy thứ ngàn cũng như lần đầu tiên. Chúng tôi đánh đổi một chút tính chân thực về bề mặt để lấy một thế giới mà chúng tôi kiểm soát hoàn toàn.

Kiểm soát chỉ là nền tảng cơ bản. Một thế giới có thể hoàn toàn ổn định nhưng vẫn rỗng tuếch, vì vậy điều tạo nên giá trị thời gian huấn luyện chính là độ sâu: không phải số lượng trang mà là cách nó bảo tồn trung thực cấu trúc nhân quả của công việc. Năm thuộc tính đặt ra tiêu chuẩn: độ trung thực về hành vi (các điều khiển, quyền hạn và lỗi tuân theo logic của sản phẩm); trạng thái nhất quán (một tin nhắn được gửi sẽ xuất hiện cho người nhận, một cuộc họp bị hủy sẽ xóa khỏi cả hai lịch); độ sâu quy trình làm việc (một lựa chọn ban đầu ràng buộc những gì xảy ra sau đó); xác minh có thẩm quyền (trạng thái ứng dụng, không phải pixel); và giá trị lĩnh vực (quy trình làm việc đáng để cải thiện). Trong các hệ thống quan trọng nhất, độ khó nằm ở quyền hạn, trạng thái chia sẻ và lịch sử kiểm toán: chính xác là cấu trúc mà một bản sao nông bỏ qua. Trên ngưỡng này, nhiều môi trường hơn sẽ tăng thêm sự đa dạng; dưới ngưỡng này, chúng chỉ thêm nhiễu.

Nhà máy Echoverse hoạt động như thế nào?

Echoverse là một quy trình duy nhất với hai đầu ra: các thế giới lĩnh vực đầy đủ bảo tồn độ sâu quy trình làm việc, và các thế giới năng lực thay đổi một tương tác cụ thể đã được chẩn đoán. Cả hai đều dựa trên thực tế là chúng tôi sở hữu cơ sở dữ liệu bên dưới, vì vậy sự thành công là một thuộc tính của chính trạng thái ứng dụng, không phải cách mô hình đọc ảnh chụp màn hình.

Xây dựng thế giới

Quy trình mở rộng một vài kịch bản hạt giống thành một đặc tả, sau đó biên dịch nó thành các khẳng định có thể kiểm tra bằng máy về các đường dẫn, trạng thái và hành vi. Chỉ sau đó nó mới tạo ra ứng dụng: một backend FastAPI và SQLite dưới giao diện React. Một ứng dụng mới chỉ là một giả thuyết, không phải một thế giới: trình xây dựng chạy mọi khẳng định so với môi trường đang chạy, sửa chữa cơ sở dữ liệu, backend hoặc frontend cho đến khi mỗi phần đều vượt qua, sau đó viết một bản ghi sẵn sàng phân tách các rào cản cứng khỏi các rủi ro khuyến nghị. Một thế giới có các rào cản mở sẽ không tiến triển. Độ sâu ở đây không phải là một lời hứa trong câu lệnh (prompt); đó là danh sách các khẳng định mà thế giới đã được chứng minh là vượt qua.

Phát triển kho dữ liệu (corpus)

Một thế giới được xây dựng sạch sẽ vẫn chưa phải là dữ liệu huấn luyện. Chúng tôi tái thiết lập mỗi tác vụ trên cơ sở dữ liệu thực tế, rút ra các mục tiêu từ các thực thể thực sự tồn tại, sau đó gửi mọi mục tiêu qua một hội đồng phân tích: các thực thể có thật không, mục tiêu có hợp lý không, độ khó có phù hợp với công việc không, và bài kiểm tra sắc bén nhất: liệu một tác nhân điều khiển giao diện người dùng thực có thể hoàn thành nó không? Kiểm tra cuối cùng đó chạy trong trình duyệt, bắt được các mục tiêu mà không giao diện nào có thể đáp ứng trước khi mô hình nhìn thấy chúng. Một mục tiêu được tạo ra là một khẳng định; một giải pháp trên ứng dụng thực là bằng chứng.

Mọi thất bại đều trở thành một vấn đề được gắn thẻ bởi lớp cần thay đổi: cơ sở dữ liệu, backend, frontend, văn bản tác vụ hoặc bộ kiểm chứng. Các trình sửa lỗi cụ thể theo lớp sẽ áp dụng sửa chữa, kiểm tra lại so với ứng dụng đang chạy và hoàn tác nếu nó bị hồi quy. Vòng lặp chấm điểm lại so với sự thật khách quan của cơ sở dữ liệu cho đến khi tỷ lệ vượt qua ngừng tăng, và mỗi tác vụ còn lại được xuất ra kèm theo chính xác bài kiểm tra đánh giá nó. Những tác vụ đó trở thành dữ liệu huấn luyện thông qua một quy trình: GPT-5.4 giải từng tác vụ, một bộ kiểm chứng giữ lại các quỹ đạo vượt qua sự thật khách quan, và chúng trở thành dữ liệu tinh chỉnh có giám sát (SFT) đằng sau mọi thí nghiệm dưới đây.

Xây dựng thế giới và phát triển kho dữ liệu không phải là hai giai đoạn mà là một vòng lặp: hầu hết các khiếm khuyết thuộc về thế giới, vì vậy chúng tôi tạo phiên bản mới cho môi trường sau mỗi lần lặp. Các tác vụ khó hơn bộc lộ những khoảng trống trong thế giới, và một thế giới vững chắc hơn có thể mang các tác vụ khó hơn, vì vậy mỗi vòng lặp đều làm cho cả hai mạnh mẽ hơn.

Two-phase pipeline diagram. Phase 1 expands seed scenarios into an app and repairs its database, backend, and frontend until it passes machine-checkable claims. Phase 2 regrounds tasks on live data an

Bộ kiểm chứng được dựa trên cơ sở dữ liệu

Mỗi tác vụ mang theo khóa đáp án riêng, một giá trị hoặc một thay đổi trạng thái được tạo ra từ cơ sở dữ liệu thực bằng một truy vấn SQL tại thời điểm tạo, đúng theo cấu trúc và được kiểm tra lại sau khi tác nhân hoàn thành. Một thao tác đọc được chấm điểm dựa trên sự tương đương về ngữ nghĩa với giá trị được lưu trữ ($288 cho $287.62 là đạt); một thao tác ghi dựa trên sự khác biệt thực tế trước/sau của cơ sở dữ liệu, vì vậy việc khẳng định một vé đã được đóng sẽ thất bại trừ khi hàng đó đã thay đổi; một thao tác read_write sẽ lấy điểm thấp hơn trong hai giá trị. Việc chấm điểm rất khó để gian lận, dựa trên thực tế thay vì nhãn dán, và đồng nhất trên khắp các dịch vụ như đặt phòng EchoStay, vấn đề EchoForge và chuyển khoản EchoBank.

Các lĩnh vực đầy đủ mang theo quy trình làm việc

Các lĩnh vực có công việc quan trọng nhất là những lĩnh vực khó tiếp cận nhất đối với các điểm chuẩn công cộng: các hệ thống đóng, độc quyền nơi độ khó nằm ở quyền hạn, trạng thái chia sẻ và lịch sử, không phải bố cục. Một bản sao trung thực phải tái tạo được điều đó. Điều quan trọng không phải là các pixel mà là hậu quả của một hành động lan tỏa qua các màn hình và người dùng, vì vậy một tác vụ có thể chạy một quy trình làm việc thực và được chấm điểm dựa trên trạng thái mà nó để lại.

Mười lĩnh vực Echo bao gồm truyền thông, công việc kỹ thuật, hồ sơ quy định, cộng đồng, phương tiện truyền thông và du lịch. Nơi nào có tập dữ liệu công cộng phong phú, chúng tôi xây dựng dựa trên đó: EchoStay được nạp dữ liệu từ InsideAirbnb, vì vậy danh sách, chủ nhà, đánh giá và tiện nghi của nó là thật chứ không phải hư cấu, và EchoForum dựa trên một kho dữ liệu diễn đàn công cộng gồm 2,55 triệu bình luận. Nơi nào không có, như với thư điện tử, lịch, ngân hàng và hồ sơ sức khỏe, một quy trình nạp dữ liệu sẽ tạo ra trạng thái theo các ràng buộc nghiêm ngặt, dày đặc và nhất quán nội tại, không phải chỉ là vài hàng giữ chỗ.

Trạng thái tích lũy đó là thứ khiến hậu quả của một hành động lan tỏa qua các màn hình và người dùng. Một lượt đặt phòng trong EchoStay di chuyển qua tìm kiếm, danh sách, tình trạng sẵn có và thanh toán qua khoảng 87 đường dẫn và 23 bảng, nhưng không có một màn hình xác nhận đơn lẻ nào; một chuỗi EchoMail mang theo ý định từ bản nháp qua gửi, trả lời và trạng thái nhãn; một đơn hàng EchoCare ghi lại mỗi thay đổi vào một dấu vết kiểm toán. Các tác vụ trở nên đắt đỏ vì điều đó, thường sâu từ năm đến hai mươi hành động, và chỉ hoàn thành khi trạng thái cơ bản đã thay đổi.

Grid of per-domain cards for the Echo suite. Each card names an environment and lists grounded database counts for its backend, seeded data, and feature surface, showing each is a self-contained inter

Các thế giới năng lực cô lập một kỹ năng

Không phải mọi điểm yếu đều đại diện cho một lĩnh vực bị thiếu; một số là do một cơ chế điều khiển duy nhất mà tác nhân không thể vận hành một cách đáng tin cậy. Hãy hình dung một tác nhân đặt một chuyến đi: nó tìm kiếm, lọc, mở danh sách phù hợp, sau đó bị đình trệ tại bộ chọn ngày, không thể biến “tuần thứ hai của tháng Ba” thành các cú nhấp chuột đúng trên một cuốn lịch lạ. Xây dựng một trang đặt phòng khác sẽ không giải quyết được điều đó. Kỹ năng chỉ được học khi chính cơ chế điều khiển đó xuất hiện dưới đủ hình thức, và bộ chọn ngày cùng bộ lọc-và-tìm kiếm lồng nhau là phổ biến trên web thực tế, được hiển thị theo hàng trăm cách khác nhau, chính xác là sự biến đổi mà một ứng dụng chuyên sâu đơn lẻ không thể cung cấp.

Vì vậy, chúng tôi cô lập cơ chế điều khiển và mở rộng tương tác, sản xuất hàng loạt nó trên các bố cục, trạng thái và ràng buộc, sau đó tạo ra các tác vụ dựa trên thực tế cho từng cái. Thế giới bộ chọn ngày hiển thị một điều khiển ngày dưới dạng sáu widget cốt lõi trên 10 ngữ cảnh và giữ lại 10 cái mới chưa từng thấy, từ bản đồ nhiệt lịch đến bánh xe cuộn và bộ chọn quý tài chính; các tác vụ khó nhất của nó biến việc phiên mã thành suy luận, giải quyết “ngày thứ Năm cuối cùng của tháng 1 năm 2026” hoặc “10 ngày làm việc sau ngày bắt đầu” thành một ngày chính xác, có thể chọn được trên widget. Thế giới bộ lọc lồng nhau thay đổi 20 họ widget và giữ lại chín họ bảng điều khiển phức hợp như là dữ liệu ngoài phân phối (out-of-distribution), chấm điểm mọi bài nộp bằng việc liệu các kết quả được lọc có thực sự đáp ứng các điều kiện yêu cầu hay không, được đánh giá bởi logic của chính ứng dụng thay vì bằng hình thức bên ngoài.

Những gì các thế giới chuyên sâu, có mục tiêu thay đổi

Nhiều quỹ đạo hơn không tự động cung cấp nhiều tín hiệu huấn luyện hơn. Điều quan trọng là độ sâu: liệu một tập (episode) có thực hiện một tác vụ qua các bước phụ thuộc của một quy trình làm việc thực hay không, thay vì chỉ diễn tập một hành động một cách cô lập. Hai thí nghiệm làm cho sự khác biệt trở nên cụ thể từ các đầu đối diện: một thí nghiệm đi sâu hơn vào toàn bộ lĩnh vực, thí nghiệm kia thu hẹp vào một kỹ năng bị hỏng duy nhất.

Các thế giới nông phản tác dụng; các thế giới sâu có khả năng chuyển đổi

Một thế giới nông là lựa chọn rẻ tiền. Nó thiết lập nhanh và trông có vẻ thuyết phục, nhưng nó chỉ diễn tập các cú nhấp chuột cô lập, trông có vẻ đúng. Huấn luyện trên đó và mô hình sẽ học các phản xạ sai, vượt quá giới hạn, lặp vòng và lặp lại các hành động chết, bởi vì không có gì trong thế giới dễ dàng đó trừng phạt chúng. Một thế giới sâu tốn kém hơn, nhưng các quỹ đạo của nó mang cấu trúc phụ thuộc có thể chuyển đổi sang trang web thực tế.

AI AgentsMicrosoft ResearchTự động hóaHọc máyEchoverse
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Microsoft Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.