Elvis Saravia@omarsar0, DAIR.AI
85

Tin ngành

AutoResearchExam: Bộ tiêu chuẩn mới đánh giá năng lực nghiên cứu của AI Agent

(giờ Việt Nam)

Tóm tắt AI

AutoResearchExam đánh giá khả năng tự nghiên cứu của AI trong 24 giờ qua 7 lĩnh vực chuyên sâu. Kết quả cho thấy Fable 5.1 đang dẫn đầu, trong khi Qwen, Gemini và Grok chiếm ưu thế về hiệu suất chi phí.

AI AgentAutoResearchExamĐánh giá AINghiên cứu AICông nghệ mới
Xem nguyên văn trên X

Bài viết được AI dịch và tổng hợp tự động từ X: Elvis Saravia (@omarsar0, DAIR.AI). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.