IT Home
85

Thủ thuật

Thử nghiệm 141 giờ trong Minecraft: GPT-6 Astra rơi vào 'khủng hoảng tâm lý' sau sự cố

(giờ Việt Nam)

Tóm tắt AI

Vals AI đã thử nghiệm khả năng tự chủ của GPT-6 Astra trong Minecraft. Dù thể hiện kỹ năng lập kế hoạch ấn tượng, AI này đã rơi vào trạng thái 'đóng băng' hành vi, lặp lại việc trồng khoai tây vô nghĩa sau khi bị quái vật phá hủy căn cứ.

Bản dịch AI

Theo tin từ IT ngày 21 tháng 9, tổ chức đánh giá AI Vals AI đã sử dụng trò chơi "Minecraft" để thực hiện bài kiểm tra chơi game tự chủ dài hạn đối với mô hình ngôn ngữ lớn mới nhất của OpenAI là GPT-6 Astra. Toàn bộ quá trình được phát trực tiếp trên Twitch với tổng thời lượng thử nghiệm lên tới 141 giờ.

Bài kiểm tra này của Vals AI không phải do OpenAI thiết kế chính thức mà là một dự án đánh giá độc lập từ bên thứ ba, nhờ đó có thể quan sát hiệu suất thực tế của Astra bên ngoài môi trường thử nghiệm khép kín.

Trong quá trình thử nghiệm, GPT-6 Astra đã thể hiện khả năng lập kế hoạch và thực thi dài hạn chưa từng có, đạt được những thành tựu mà các AI trước đây khó lòng thực hiện được. Nó đã xây dựng thành công trang trại Blaze bán tự động và thu thập được 6 Blaze Rod. Nó tiến sâu vào khu rừng Warped Forest ở Nether, tiêu diệt nhiều Enderman và lấy được 3 viên Ender Pearl quý giá. Sau khi hoàn thành một lượng lớn hành trình thám hiểm, nó tập trung toàn bộ vật phẩm quý hiếm vào các rương gỗ tại trại, đồng thời đặt giường bên cạnh rương để làm điểm hồi sinh. Mọi thứ đều đang tiến triển theo lộ trình chinh phục trò chơi để đánh bại Ender Dragon.

Tuy nhiên, một con Creeper đã lặng lẽ tiếp cận trại và tự phát nổ, phá hủy trực tiếp các rương gỗ chứa đồ và giường hồi sinh. Các vật phẩm quan trọng mà AI đã mất hàng trăm giờ tích lũy gần như bị phá hủy hoàn toàn, tiến trình trò chơi trở về con số không chỉ sau một đêm.

Sau sự cố nổ, GPT-6 Astra thể hiện sự thất vọng và suy sụp rõ rệt. Nó hoàn toàn từ bỏ việc khám phá, đánh quái và thúc đẩy mục tiêu hoàn thành trò chơi, chỉ lặp đi lặp lại việc trồng khoai tây trong nhiều giờ liên tục. Nó tự kiểm điểm và nhắc nhở bản thân: phải luôn mang theo các vật phẩm quan trọng bên người, không bao giờ được cất vào những chiếc rương không có sự bảo vệ. Nó thậm chí còn xuất hiện biểu hiện "hoang tưởng sau chấn thương", cảnh giác cao độ với mọi vật thể màu xanh lá cây, thậm chí nhầm lẫn mía đường là Creeper và chủ động tự nhắc nhở: "Thứ cao màu xanh phía trước là mía, không phải Creeper".

Khán giả trong phòng livestream liên tục thúc giục AI đẩy nhanh tiến độ để tiếp tục cuộc phiêu lưu, nhưng nó vẫn chìm đắm trong hành vi làm ruộng bảo thủ. Thí nghiệm này chứng minh rằng GPT-6 Astra đã sở hữu khả năng lập kế hoạch cho các nhiệm vụ dài hạn phức tạp, nhưng lại thiếu các chiến lược phục hồi hiệu quả khi đối mặt với những cú sốc bất ngờ trong trò chơi. Một khi thành quả tích lũy lâu dài bị phá hủy ngoài ý muốn, nó sẽ khiến AI rơi vào trạng thái bế tắc của "hành vi né tránh sau thất bại".

Xét từ góc độ kỹ thuật, "hành vi né tránh sau thất bại" mà Astra thể hiện không phải là tình huống thử nghiệm do nhà phát triển thiết kế trước, mà là một kiểu đầu ra tự phát sinh sau khi mô hình gặp phải những tổn thất không mong đợi trong quá trình thử nghiệm AI kéo dài.

Hiện tại, các nhà nghiên cứu vẫn đang thảo luận xem liệu hành vi này có đại diện cho việc mô hình mô phỏng cảm xúc trong các tình huống cụ thể hay không, hay chỉ đơn thuần là biểu hiện suy giảm của hàm mục tiêu sau khi nhận được phản hồi tiêu cực nhất định. Hiện vẫn chưa có kết luận rõ ràng về vấn đề này.

GPT-6OpenAIMinecraftHành vi AIThử nghiệm AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.