Apple Machine Learning Research
85

Tin ngành

REVERSAL-BENCH: Apple nghiên cứu 'vực thẳm' trong học tăng cường không cần reset

(giờ Việt Nam)

Tóm tắt AI

Apple giới thiệu REVERSAL-BENCH, bộ công cụ đo lường khả năng phục hồi trạng thái của AI trong môi trường vật lý, giúp xác định giới hạn an toàn khi huấn luyện các tác nhân học tăng cường mà không cần thiết lập lại trạng thái ban đầu.

Bản dịch AI

REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff

Tác giả: Riyaaz Shaik, Chandru Venkataraman

Một mục tiêu trọng tâm của học tăng cường tự động (autonomous reinforcement learning) là huấn luyện chính sách liên tục mà không cần thiết lập lại (reset) từ bên ngoài. Tuy nhiên, các mô hình hiện tại phần lớn phụ thuộc vào khả năng đảo ngược của môi trường, một đặc tính không tồn tại trong các thao tác thực tế, nơi mà những sự kiện như đẩy vật thể khỏi bàn hoặc làm đổ các chất dạng hạt không thể hoàn tác. Chúng tôi giới thiệu REVERSAL-BENCH, một bộ tiêu chuẩn kiểm định (benchmark) kiểm soát khả năng đảo ngược thông qua một tham số liên tục ρ∈ [0, 1] và cung cấp một reset oracle, một cơ chế xác thực dựa trên sự thật cơ sở (ground-truth) để kiểm tra khả năng phục hồi trạng thái trên tám thiết lập thao tác trong năm công cụ mô phỏng vật lý. Việc đánh giá một loạt các kiến trúc chính sách—bao gồm các thuật toán actor-critic tiêu chuẩn, RL an toàn (safe RL) và các khung làm việc chuyên biệt không cần reset—cho thấy một "vực thẳm đảo ngược" rõ rệt: các tác nhân không cần reset liên tục bị rơi vào các trạng thái không thể phục hồi khi ρ tăng lên, trong khi các tác nhân theo tập (episodic agents) vẫn duy trì việc học ổn định. Chúng tôi nhận thấy kiểu lỗi này xuất hiện trên khắp các mô hình cơ sở (baselines) tự động không cần reset và RL có ràng buộc. Vì các tác nhân không cần reset thiếu cơ chế thiết lập lại từ bên ngoài, bất kỳ sự chuyển đổi nào sang trạng thái không thể phục hồi đều dẫn đến sự hấp thụ vĩnh viễn, khiến tác nhân bị mắc kẹt và quá trình học tập bị đình trệ. Chúng tôi chứng minh rằng hiện tượng hấp thụ này vẫn tồn tại trong các mô phỏng vật lý đầy đủ dưới các chính sách thao tác đã học. Bằng cách đánh giá dựa trên các đối tượng tương đương về mặt hình học nhưng có khả năng đảo ngược, chúng tôi xác nhận rằng sự đổ vỡ này có nguyên nhân trực tiếp từ tính không thể đảo ngược thay vì độ phức tạp của vật cản. Chúng tôi công bố bộ tiêu chuẩn này, cùng với một tập dữ liệu đa mô phỏng lớn được gắn nhãn về khả năng phục hồi và một reset oracle. Chúng tôi cũng đánh giá một lá chắn an toàn (safety shield) can thiệp trước khi các lỗi không thể đảo ngược xảy ra, cho thấy rằng mặc dù khả năng phục hồi có thể được dự đoán chính xác, nhưng việc phục hồi chủ động chủ yếu chỉ thành công khi tác nhân có thể tránh xa cái bẫy về mặt vật lý.

Các bài đọc liên quan và cập nhật.

Các tác nhân giao diện được vận hành bởi các mô hình AI tạo sinh (gọi tắt là "tác nhân") có thể tự động hóa các hành động dựa trên lệnh của người dùng. Một khía cạnh quan trọng trong việc phát triển tác nhân là trải nghiệm người dùng (tức là trải nghiệm tác nhân). Ngày càng có nhu cầu cung cấp các khung hỗ trợ cho nhiều đối tượng hơn ngoài các kỹ sư AI để tạo mẫu trải nghiệm tác nhân, vì họ có thể đóng góp những góc nhìn giá trị vào việc thiết kế trải nghiệm tác nhân. Trong nghiên cứu này, chúng tôi khám phá…

Đọc thêm

Việc đưa ra các quyết định tuần tự tinh vi, mạnh mẽ và an toàn là cốt lõi của các hệ thống thông minh. Điều này đặc biệt quan trọng đối với việc lập kế hoạch trong các môi trường đa tác nhân phức tạp, nơi các tác nhân cần dự đoán ý định và các hành động có thể xảy ra trong tương lai của những tác nhân khác. Các phương pháp truyền thống xây dựng bài toán này dưới dạng Quá trình quyết định Markov (Markov Decision Process), nhưng các giải pháp thường dựa vào nhiều giả định khác nhau và trở nên kém ổn định khi gặp các trường hợp biên (corner cases). Trong…

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.