T5 · 30/07

HuggingFace Daily Papers (Nổi bậtBài nghiên cứu)
Nghiên cứu85

OmegaUse-OfficeVal: Bộ tiêu chuẩn đánh giá hiệu quả kinh tế của AI Agent trong tác vụ văn phòng

Baidu giới thiệu OmegaUse-OfficeVal, bộ benchmark gồm 100 tác vụ văn phòng thực tế giúp đo lường khả năng hoàn thành công việc và giá trị kinh tế thực tiễn của các AI Agent thông qua hệ thống kiểm chứng bằng mã nguồn.

AI AgentĐánh giá AITự động hóaHiệu quả kinh tếNghiên cứu AI
HuggingFace Daily Papers (Nổi bậtBài nghiên cứu)
Nghiên cứu88

HumanCLAW: Khung đánh giá khả năng thực thi hành động của mô hình ngôn ngữ thị giác (VLM)

HumanCLAW tách biệt việc ra quyết định và điều khiển vận động, cho phép VLM thực thi các kỹ năng vật lý. Kết quả thử nghiệm cho thấy các mô hình SOTA hiện nay vẫn thất bại do thiếu nhận thức về vị trí và tương tác vật lý trong không gian thực.

Robot họcVLMAI thực tếĐánh giá AIĐiều khiển vận động
HuggingFace Daily Papers (Nổi bậtBài nghiên cứu)
Nghiên cứu85

Tinh chọnAI Agent có thể tự thực hiện nghiên cứu khoa học? Những bằng chứng thực tế từ hai thử nghiệm

Nghiên cứu mới đánh giá khả năng tự chủ của AI Agent trong việc thực hiện các đề tài khoa học. Kết quả cho thấy dù AI xử lý tốt các tác vụ kỹ thuật, nó vẫn thất bại trong việc tạo ra đột phá sáng tạo và bị các chuyên gia từ chối vì thiếu tư duy phản biện.

AI AgentNghiên cứu AITự động hóaĐánh giá AIKhoa học dữ liệu
Oran Ge@oran_ge
Thủ thuật75

Khi con người trở thành 'thú cưng' của AI: Cơn sốt reset và hội chứng Pavlov thời đại số

Nhiều người dùng đang tỏ ra phấn khích thái quá trước các tính năng 'reset' của AI, thậm chí tôn sùng các công cụ như Tibo như một vị thần. Hiện tượng này đặt ra câu hỏi liệu con người có đang dần mất đi tư duy độc lập và trở thành những chú chó Pavlov trước sự điều khiển của thuật toán.

Tâm lý học AIGóc nhìn công nghệPhản biện xã hộiTiboHành vi người dùng

30 tin mỗi trang · lọc và sắp xếp ngay trên máy chủ (70 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả