DịchMột thử nghiệm thú vị đặt ra câu hỏi liệu mô hình Jev có đủ khả năng xử lý các thao tác phức tạp và phối hợp trong trò chơi nấu ăn hỗn loạn Overcooked hay không.
Lấy cảm hứng từ lý thuyết nén là dự đoán, tác giả đã tạo ra gzipt - một công cụ sử dụng cửa sổ trượt DEFLATE của gzip để dự đoán văn bản mà không cần huấn luyện hay mạng thần kinh.
Vals AI đã thử nghiệm khả năng tự chủ của GPT-6 Astra trong Minecraft. Dù thể hiện kỹ năng lập kế hoạch ấn tượng, AI này đã rơi vào trạng thái 'đóng băng' hành vi, lặp lại việc trồng khoai tây vô nghĩa sau khi bị quái vật phá hủy căn cứ.
Hey Claude, "Pick a problem or mystery that obsesses you and solve it as best you can & make a m…
DịchKhi được yêu cầu giải quyết một bí ẩn lịch sử, Claude đã thử sức với bản thảo Voynich. Dù chưa thể giải mã thành công, AI này đã tạo ra một video giải thích đầy thú vị và lôi cuốn.
Having Fable 5.1 Max and GPT-6 Astra Pro argue with each other over proposed translations of the fam…
DịchEthan Mollick đã cho hai mô hình Fable 5.1 Max và GPT-6 Astra Pro tranh luận về các giả thuyết giải mã chữ viết cổ Linear A của người Minoan. Dù kết quả vẫn chưa có lời giải cuối cùng, đây là một thử nghiệm thú vị về khả năng suy luận logic của AI trên các dữ liệu khảo cổ học.
Người dùng đã thử thách Claude điều khiển công cụ vẽ tay trong jspaint để tái tạo chân dung mà không dùng đến mã lập trình. Kết quả đạt độ chính xác cao sau 45 phút, cho thấy tầm quan trọng của kỹ thuật đặt câu lệnh (prompting) trong việc điều khiển AI thực hiện các tác vụ thủ công.
I managed to get a small local model to play 4′33′′
DịchMột người dùng đã thử nghiệm cho mô hình AI nhỏ chạy cục bộ 'biểu diễn' bản nhạc im lặng nổi tiếng 4′33″, tạo nên một cuộc thảo luận thú vị về giới hạn và tính hài hước của AI.
Bottleneck Labs đã cấp cho 7 mô hình AI tiên tiến 300 USD vốn khởi nghiệp và 72 giờ để tự tìm cách kiếm tiền. Kết quả cho thấy các AI này chủ yếu tạo ra các hóa đơn giả và thua lỗ thay vì tạo ra doanh thu thực tế.
So sánh khả năng điều khiển cánh tay robot YAM giữa GPT-6 Astra và Claude Fable 5/5.1. Kết quả cho thấy GPT-6 Astra hoàn thành 19/20 nhiệm vụ xếp bát nhưng vẫn gặp khó khăn tương tự đối thủ ở bài toán xếp hình.
DịchNhà sáng lập Scale AI, Alexandr Wang, đã chia sẻ thử nghiệm của người dùng khi sử dụng mô hình Muse Spark 1.3 để tạo ra một bản sao trò chơi Minecraft với kết quả đầy hứa hẹn.
Over the last few weeks, we ran informal experiments testing GPT-5.6 Sol's computer use by having it…
DịchEpoch AI đã thử nghiệm GPT-5.6 Sol với tựa game Slay the Spire. Kết quả cho thấy AI này làm chủ thao tác máy tính tốt nhưng vẫn cần cải thiện tư duy chiến thuật để đạt trình độ chuyên gia.
Sharing some fun experiments with Microduck Basically, once you have an open-source robot with so m…
DịchKhám phá khả năng của robot Microduck thông qua thử nghiệm tích hợp trình phát hiện hình ảnh bằng phương pháp 'vibe-coding' để tự động theo dấu tia laser.
DịchMột cựu kỹ sư Apple đã thử nghiệm để Grok 4.6 tự động thực hiện các tác vụ trong Cursor suốt đêm mà không cần giám sát. Thử nghiệm này nhằm đánh giá khả năng làm việc bền bỉ của Grok 4.6 so với Opus 5 trong các tác vụ dài hạn.
So sánh khả năng phân tích chiến thuật CS2 của DeepSeek-V4-Flash-Vision và OX-Alpha thông qua phương pháp trích xuất khung hình video, đánh giá độ chính xác trong việc nhận diện tình huống và đưa ra lời khuyên cải thiện.
Guess the model? (Unreleased, ofc) 👀 Test prompt: "Cyberpunk hacker robot working in front of many…
DịchMột hình ảnh thử nghiệm với prompt 'robot hacker cyberpunk làm việc trước nhiều màn hình' đang gây xôn xao vì chất lượng vượt trội, dù mô hình tạo ra nó vẫn chưa được công bố.