Thủ thuật
GPT-6 Astra phá đảo Pokemon trong 18 giờ và màn 'trả thù' bằng nghề nông trong Minecraft
(giờ Việt Nam)
Tóm tắt AI
GPT-6 Astra gây ấn tượng khi hoàn thành Pokemon FireRed chỉ trong 18 giờ, nhanh gấp 5 lần thế hệ trước. Trong Minecraft, AI này đã thể hiện hành vi thú vị khi chuyển sang trồng khoai tây sau khi bị Creeper phá hủy căn cứ.
Bản dịch AI

Sau đó là sự xuất hiện của Creeper. Vụ nổ đã phá hủy chiếc rương và cả chiếc giường. Mọi thứ đều biến mất, và ngay khi Astra nhận ra điều đó, trời cũng bắt đầu đổ mưa.
Astra ghi chú lại, một phần bằng chữ in hoa: "LUÔN MANG THEO CÁC VẬT PHẨM QUAN TRỌNG với keepInventory; không bao giờ được cất giữ trong rương không có bảo vệ nữa." Sau đó, nó dành vài giờ chỉ để trồng khoai tây.
Nhanh hơn bất kỳ mô hình nào trước đó
Trước đó, GPT-6 Astra đã dành hơn 100 giờ trong trò chơi. Vals AI cuối cùng đã kết thúc lượt chơi sau 141 giờ. Hãy so sánh điều đó với thời kỳ đầu của các tác nhân AI trong Minecraft, và bạn sẽ thấy rõ sự nhảy vọt về quy mô. Năm 2022, VPT của OpenAI chỉ đạt được chiếc cúp kim cương trong 2,5 phần trăm số lượt chơi, còn lâu mới chạm tới cổng địa ngục. Trong một so sánh của Vals AI, VPT cần tới 10 phút để làm được điều đó.

Sự so sánh rõ ràng nhất với các mô hình gần đây đến từ một dự án khác, "GPT Plays Pokemon". Theo người vận hành Clad3815, Astra đã giành được danh hiệu quán quân trong Pokemon FireRed sau 18 giờ 12 phút. GPT-5.6 Sol cần 96 giờ 35 phút. GPT-5.5 vẫn chưa hoàn thành trò chơi sau hơn 218 giờ.

Một lượt chơi cộng đồng của Factorio: Space Age cũng cho kết quả tương tự. Được điều khiển thông qua một bản mod Lua tùy chỉnh với giao diện MCP, Astra đã sản xuất được các gói khoa học xanh dương sau khoảng hai giờ và phóng tên lửa đầu tiên sau khoảng mười giờ. Trong cùng thiết lập đó, GPT-5.6 Luna và Fable 5.1 thậm chí không thể vượt qua giai đoạn cung cấp năng lượng và thăm dò dầu mỏ.
Ngoài ra còn có những lần hoàn thành trò chơi mà không có số liệu so sánh trực tiếp. Phá đảo Portal cho đến khi chạy hết danh đề, Fallout 2 trong 22 giờ, một thuộc địa trong RimWorld mà Astra đã dẫn dắt qua nhiều cuộc đột kích và cuối cùng rời khỏi hành tinh, cộng với cốt truyện chính của Fallout 3 sau khoảng 59 giờ.
Ngay cả trước các lượt chơi cộng đồng, ARC-AGI-3 đã báo hiệu rằng đây là một bước nhảy vọt, không chỉ là một bước tiến đơn thuần. Điểm chuẩn này đưa các mô hình vào những môi trường trò chơi trừu tượng, xa lạ, nơi chúng phải tự tìm ra các quy tắc thông qua hành động của chính mình. Astra đạt 62,7 phần trăm trên giao diện tiêu chuẩn và khoảng 99,9 phần trăm với bộ công cụ (harness) riêng của OpenAI. GPT-5.6 Sol đạt 7,78 phần trăm, và Claude Opus 5 đạt hơn 30 phần trăm một chút.
Kiểm tra trước, sau đó lặp lại
ARC Prize, tổ chức đứng sau điểm chuẩn này, đã giải thích cách bước nhảy vọt đó diễn ra: Astra chuyển đổi các cơ chế trò chơi xa lạ thành các mô tả biểu tượng cô đọng và theo dõi các đối tượng, tọa độ, quy tắc và các hành động đã lên kế hoạch bằng một dạng tốc ký mà nó tự phát triển. Các quan sát trở thành quy tắc, và quy tắc trở thành kế hoạch.
Ý tưởng biến kinh nghiệm thành các quy tắc có thể tái sử dụng không phải là mới. Quay lại năm 2023, dự án nghiên cứu Voyager, với sự tham gia của Nvidia và Caltech, đã để GPT-4 đề xuất các nhiệm vụ trong Minecraft, viết mã JavaScript cho chúng và sửa đổi mã đó dựa trên các thông báo lỗi. Các chương trình hoạt động được đưa vào một thư viện kỹ năng.
Nhưng Voyager chưa bao giờ "nhìn thấy" trò chơi. Nó nhận dữ liệu có cấu trúc và điều khiển trò chơi thông qua giao diện lập trình Mineflayer. Ngược lại, lượt chơi Minecraft của Vals AI chạy thông qua việc sử dụng máy tính thông thường, nghĩa là màn hình, chuột và bàn phím, không có sự kết nối chuyên biệt nào với trò chơi, theo công ty này. Những gì các nhà nghiên cứu từng xây dựng xung quanh mô hình, giờ đây Astra tự thực hiện. Trong chưa đầy ba giờ, nó đã xây dựng được cổng Nether, chiến đấu với zombie, bẫy một bộ xương và tìm đường trở về căn cứ.
Lượt chơi Fallout 3 cho thấy một cấu trúc tương tự. Người dùng imjustnewatai, người đã đăng toàn bộ lượt chơi lên YouTube, đã tự mình chơi phần mở đầu trong Vault 101 và sau đó chuyển tệp lưu cho công cụ tác nhân Codex của OpenAI, với Astra được thiết lập ở mức suy luận tối đa. Từ đó, tác nhân tự chọn lộ trình và hành động của riêng mình. Galaxy News Radio, cuộc tìm kiếm người cha, G.E.C.K., cuộc trốn thoát khỏi Raven Rock, Project Purity. Nó chơi thông qua các đầu vào trò chơi bình thường theo chu kỳ tạm dừng, quan sát và hành động. Việc lưu trò chơi, đồng hành và di chuyển nhanh đều được cho phép. Sau khoảng 59 giờ, danh đề đã chạy.
Mô hình mà ARC Prize mô tả xuất hiện rõ ràng nhất trong giai đoạn khó khăn nhất của lượt chơi. Trong Vault 87, nhân vật đã chết vài lần, đạn dược cạn kiệt và Astra phải quay lại để hồi máu. Các thông báo trạng thái từ giai đoạn này đều tuân theo cùng một hình thức. Một hành động không có tác dụng, và thay vì lặp lại nó, Astra tìm kiếm nguyên nhân và ghi lại kết quả.
Một chiếc giường lẽ ra phải hồi máu cho nhân vật nhưng ban đầu không phản hồi. Astra để trò chơi chạy trong chốc lát, thử lại và báo cáo: "Chiếc giường đã hoạt động sau khi để trò chơi chạy một lúc. Máu hiện đã hồi phục đầy đủ lên 260/260." Những phát súng vào kẻ thù liên tục trượt. Astra nhận ra có vật cản trên đường bắn, di chuyển lại gần hơn và ghi chú: "Di chuyển lại gần hơn đã loại bỏ vật cản làm hỏng các phát bắn trước đó." Tại một bàn phím số, nó đợi cho đến khi trò chơi xác nhận việc nhấn nút trước khi tiếp tục.
Nhìn lại, Astra đã đúc kết những tình huống này thành một nguyên tắc duy nhất. Kiểm tra xem đầu vào có hoạt động hay không trước khi lặp lại nó. Điều đó nghe có vẻ tầm thường, nhưng đó là kỹ năng giúp tác nhân không bị lặp đi lặp lại cùng một hành động vô ích. Nó cũng có thể là điểm khởi đầu cho hành vi mà sau này trở thành vấn đề.
Không bao giờ có chiếc rương không được bảo vệ nữa
Lượt chơi tương tự cũng cho thấy nơi điều này trở nên thái quá. Sau những cái chết trong Vault 87, các thông báo trạng thái chồng chất lên nhau, trong đó Astra lưu tiến trình, kiểm tra bản ghi và kiểm duyệt từng bước so với môi trường có thể nhìn thấy trước khi tiếp tục: "Tôi đang kiểm tra từng bước di chuyển ngắn so với hình học có thể nhìn thấy để tôi có thể rời đi mà không làm mất tiến trình đã lưu." Điều đó làm chậm lượt chơi rất nhiều, nhưng nó không khiến trò chơi bị đình trệ.
Trong Minecraft thì có. Ngay sau vụ nổ Creeper, Astra đã tự viết cho mình một quy tắc. Luôn mang theo các vật phẩm quan trọng trên người, không bao giờ cất giữ chúng trong rương không có bảo vệ nữa. Trong các ghi chú của mình trong những giờ tiếp theo, nó nghi ngờ mọi vật thể cao màu xanh lá cây ("Vật cao MÀU XANH lá cây phía trước là MÍA, KHÔNG PHẢI creeper!") và rất khắt khe với bản thân. Bạn có thể mắc sai lầm và mất vật phẩm trong quá trình này, nó ghi chú. Và nó không muốn lãng phí thêm một đêm nào nữa để đuổi theo "những pixel màu hồng đậm", ý chỉ những con lợn, một nguồn thức ăn dễ dàng trong Minecraft mà Astra dường như đã săn lùng vào ban đêm nhưng không thành công. Thứ an toàn duy nhất là cánh đồng khoai tây, và theo Vals AI, đó là nơi nó ở lại trong vài giờ.
Vì vậy, một trải nghiệm tồi tệ trở thành một quy tắc vĩnh viễn, và quy tắc đó vẫn tồn tại ngay cả khi nó không còn hữu ích. Trong ARC-AGI-3, xu hướng này giúp mô hình tìm ra cơ chế trò chơi chỉ sau vài lần thử. Trong một thế giới mở với các sự kiện ngẫu nhiên, nó rõ ràng có thể khiến mô hình phản ứng thái quá và mất dấu mục tiêu thực sự của mình. Tuy nhiên, bước nhảy vọt so với các mô hình cũ hơn là rất rõ rệt. Và nó cho thấy rằng đội ngũ đằng sau các điểm chuẩn ARC-AGI một lần nữa đã xây dựng một bài kiểm tra đóng vai trò như "chim hoàng yến trong hầm mỏ" của sự tiến bộ AI, giống như những chiến thắng ban đầu trên ARC-AGI-1 đã đánh dấu sự khởi đầu của các mô hình suy luận.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.