WhatWorkedBench là bộ benchmark mới giúp đo lường khả năng dự đoán hiệu quả các thay đổi thành phần trong điều kiện ngân sách hạn chế của AI Agent, thông qua phân tích 1.248 bản ghi cấu hình và 108 tập dữ liệu thực nghiệm.
Since people were asking, here's GPT-6 Astra, highest setting: "create a visually interesting shader…
DịchEthan Mollick thử nghiệm GPT-6 Astra để tạo mã shader cho twigl.app, tái hiện khung cảnh thành phố Gothic chìm trong bão biển. Tác giả cũng so sánh kết quả này với các phiên bản Fable trước đó để thấy rõ sự tiến bộ của mô hình.
Given 6 days and $3K AI agents, produced 2 research papers, and both were rejected. The people who …
DịchDù hoàn thành xuất sắc các tác vụ kỹ thuật, các AI agent vẫn bị từ chối đăng bài do thiếu khả năng tư duy chiến lược để cải tiến thực nghiệm, thay vì chỉ biết điều chỉnh nội dung theo phản hồi tiêu cực.
Apodex 1.1 sử dụng 8 Agent chạy song song để kiểm chứng các dự án kiếm tiền từ AI, kết quả cho thấy không có trường hợp cá nhân nào đạt tiêu chuẩn thu nhập thực tế, đập tan những lời quảng cáo làm giàu nhanh chóng. Dự án đã mã nguồn mở toàn bộ kiến trúc đa Agent để người dùng tự triển khai.