02/09

Thứ Tư · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnClawBench: Khi các siêu AI 'bó tay' trước những tác vụ thực tế trên web

Nghiên cứu mới từ TIGER Lab cho thấy các mô hình hàng đầu như Claude, GPT và Gemini đều thất bại thảm hại khi thực hiện các tác vụ thực tế trên web, với tỷ lệ thành công chỉ đạt khoảng 33%.


Vì sao đáng đọc: Bài viết bóc trần sự thật về khả năng thực thi của AI agent trong môi trường thực tế, thách thức những kỳ vọng quá mức về khả năng tự động hóa hiện nay.
Tổng 1 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (11 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “ClawBench” | AIHOT.vn