MarkTechPost
85

Nghiên cứu

Google AI ra mắt EnvHarness: Biến môi trường tĩnh thành thế giới huấn luyện AI thích ứng

(giờ Việt Nam)

Tóm tắt AI

EnvHarness là lớp lập trình mới từ Google Cloud AI giúp tùy biến các môi trường huấn luyện tác nhân AI thông qua giao diện chuẩn, cho phép thay đổi nhiệm vụ mà không cần can thiệp vào trình mô phỏng gốc.

Bản dịch AI

Google AI Introduces EnvHarness: A Programmable Layer That Turns Static Agent Environments Into Adaptive Training Worlds

Một nhóm các nhà nghiên cứu từ Google Cloud AI Research, Đại học Washington tại St. Louis và UNC Chapel Hill đã phát hành EnvHarness, một lớp lập trình có khả năng biến các bộ benchmark (điểm chuẩn) tác nhân tĩnh thành các bộ benchmark thích ứng với quá trình huấn luyện chính sách trên đó. Các tác nhân LLM hiện nay học ít hơn từ văn bản được biên soạn sẵn và học nhiều hơn từ các môi trường tương tác, nhưng những môi trường này thường được xây dựng thủ công và cố định: chúng hoạt động giống hệt nhau bất kể tác nhân nào đang thực hiện hay tác nhân đó đã cải thiện đến mức nào. Giải pháp thông thường là tạo ra các môi trường mới, điều này khiến bạn bị phụ thuộc vào các quy trình đặc thù theo từng lĩnh vực và các bộ kiểm chứng (verifiers) do LLM viết, vốn cần phải được tạo dư thừa và lọc lại. EnvHarness đảo ngược cách tiếp cận này. Nó bao bọc một môi trường hiện có bằng các thành phần plug-in hoạt động nghiêm ngặt thông qua giao diện reset / step tiêu chuẩn, thay đổi điểm bắt đầu của một tập (episode), những gì tác nhân có thể làm và những gì nó nhìn thấy, trong khi trình mô phỏng, các tác vụ và bộ kiểm chứng do con người xây dựng bên dưới vẫn được giữ nguyên. Một trình thiết kế LLM có tên là EnvRigger sẽ tự động viết các trình bao bọc (wrappers) này dựa trên những lỗ hổng mà nó chẩn đoán được trong quá trình thực thi (rollouts) của chính sách. Trên năm bộ benchmark thuộc bốn lĩnh vực, các kỹ năng được khai thác theo cách này đạt mức tăng tới 9,0 điểm trong các tác vụ chưa từng thấy (held-out tasks) với số bước thực thi ít hơn 9,8%.

Nó có thể triển khai được không?

Có, nếu bạn đã vận hành một vòng lặp đánh giá tác nhân. EnvHarness được phát hành dưới dạng Python theo giấy phép Apache-2.0 với các trình điều khiển tái lập cho sáu môi trường. Một bộ benchmark mới có thể tham gia bằng cách triển khai một giao diện duy nhất (reset / step / observe / evaluate / get_env_state / save_state / from_state); không có gì ở hạ nguồn bị thay đổi. Điều kiện tiên quyết bắt buộc là một môi trường có khả năng reset, điều này loại trừ các tài khoản người dùng trực tiếp và robot vật lý.

Những môi trường ngừng giảng dạy

Các tác nhân LLM hiện nay học ít hơn từ văn bản được biên soạn sẵn và học nhiều hơn từ các môi trường tương tác. Những môi trường đó được xây dựng thủ công và tĩnh: chúng hoạt động giống hệt nhau bất kể tác nhân nào thực hiện hay tác nhân đó đã cải thiện đến mức nào, vì vậy chúng không thể nhắm vào điểm yếu của một chính sách và không còn gì để dạy một khi đã được giải quyết.

Câu trả lời thông thường là tạo ra nhiều môi trường hơn. Bài báo về EnvHarness chỉ ra hai chi phí: các quy trình tạo môi trường mang tính đặc thù theo lĩnh vực và không thể chuyển đổi, và các bộ kiểm chứng do LLM viết phải được tạo dư thừa và lọc kỹ lưỡng mà vẫn không bao giờ hoàn toàn đáng tin cậy.

Bao bọc, không phải tạo mới

Nhóm nghiên cứu đề xuất một cách tiếp cận ngược lại. Một bộ công cụ tác nhân (agent harness) giúp một LLM cố định trở nên có năng lực thông qua các công cụ plug-in, bộ nhớ và kỹ năng. EnvHarness áp dụng ý tưởng đó vào phía bên kia của vòng lặp, bao bọc một môi trường cố định trong các thành phần plug-in hoạt động nghiêm ngặt thông qua giao diện reset / step tiêu chuẩn.

Về mặt hình thức, một thành phần là một phép biến đổi E' = w(E) giúp viết lại các thuật ngữ về trạng thái, hành động, quan sát và chuyển đổi. Thuật ngữ phần thưởng (reward) cố tình bị loại bỏ. Vì không có sự can thiệp nào chạm đến phần backend của trình mô phỏng, mọi tác vụ được định hình lại đều giữ nguyên bộ kiểm chứng gốc do con người xây dựng, và vì không có gì chạm vào mã nguồn đặc thù của benchmark, một bản triển khai duy nhất có thể bao phủ mọi lĩnh vực.

Ba thành phần được cung cấp và chúng có thể kết hợp tự do:

EnvRigger: vòng lặp thiết kế

Các thành phần không phụ thuộc vào chính sách; nhưng việc lựa chọn chúng thì có. EnvRigger coi chính sách như một hộp đen và thực hiện bốn giai đoạn: quan sát năm lần thực thi cơ sở, chẩn đoán một lỗ hổng hệ thống, viết các thành phần dưới dạng mã Python thực tế và xác thực trên năm lần thực thi mới. Các ứng viên không thể giải quyết hoặc giải quyết quá dễ dàng đều bị loại bỏ, với tối đa năm vòng sửa đổi cho mỗi tác vụ. Các hook được tạo ra sẽ biên dịch trong một tiến trình con biệt lập, vì vậy một đột biến xấu sẽ trở thành một dấu vết được ghi lại thay vì một lần chạy thất bại.

Hiệu suất

Trên các bộ benchmark ALFWorld, WebArena, SWE-bench Verified, OfficeQA và SpreadsheetBench, các kỹ năng được khai thác bằng phương pháp quy nạp kiểu ReasoningBank đã vượt qua cả hai nhóm đối chứng trên các tác vụ chưa từng thấy.

Điểm trung bình của ALFWorld tăng từ 62,4 lên 68,3 so với các kỹ năng từ môi trường gốc, với +9,0 điểm trên tập phân tách ngoài phân phối (out-of-distribution). Tỷ lệ giải quyết của SWE-bench Verified tăng từ 49,88 lên 52,58 trong khi số bước trung bình giảm từ 55,01 xuống 49,61, đúng như tuyên bố về hiệu suất 9,8% của bài báo. Trên SpreadsheetBench và WebArena, các kỹ năng từ môi trường không sửa đổi đạt kết quả thấp hơn mức cơ sở không có kỹ năng; việc định hình lại chính là điều làm cho quá trình khai thác trở nên đáng giá. So với các trình tạo đặc thù theo lĩnh vực, EnvHarness vượt qua SWE-smith 2,46 điểm với số bước ít hơn 5,11.

Dưới thuật toán GRPO trên mô hình Qwen3-8B-base, RL trong các môi trường được định hình lại vượt qua RL trong các môi trường gốc ở ba trong bốn chỉ số (ALFWorld trong phân phối tăng từ 81,4 lên 87,9), với một sự suy giảm nhỏ trên tập OOD (89,6 xuống 88,8). Việc mở rộng môi trường đạt mức 54,79 tại 300 môi trường so với 52,13 đối với môi trường gốc và 50,37 đối với môi trường được tạo ra, bởi vì trình thiết kế cùng tiến hóa mỗi lô (batch) dựa trên chính sách hiện tại. Và khi được yêu cầu điều hướng tỷ lệ thành công trên mỗi tác vụ vào khoảng [0,4, 0,6], độ bao phủ trong băng thông tăng từ 6% lên 80%.

Những điểm chính cần lưu ý

Hãy xem Bài báo, Kho lưu trữ GitHub và Trang dự án. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub HOẶC Trang Hugging Face HOẶC Bản phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.