16/09

Thứ Tư · 1 tin
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 41/100

Ra mắt Apodex 1.1: Bước tiến mới cho các tác vụ AI dài hạn

Apodex has released Apodex 1.1, a model family for long-horizon work that moves reasoning out of res…

DịchApodex 1.1 vừa trình làng, tối ưu hóa cho các quy trình làm việc phức tạp với khả năng xử lý tài liệu, tìm kiếm và lập trình. Mô hình này vượt trội hơn phiên bản cũ gấp đôi trong các bài kiểm tra về tác nhân tự hành và nghiên cứu khoa học.

29/08

Thứ Bảy · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Benchmark mới chỉ ra các mô hình AI hàng đầu chỉ đạt tỷ lệ thành công 6,4% trong các tác vụ dài hạn

Another paper that so clearly exposes AI's long-horizon problem. Long-Horizon-Terminal-Bench, where…

DịchKết quả từ Long-Horizon-Terminal-Bench cho thấy 17 mô hình AI tiên tiến nhất hiện nay gặp khó khăn lớn với các tác vụ phức tạp, khi phần lớn thất bại do quá tải thời gian và không thể duy trì logic qua hàng trăm bước thực hiện.

18/08

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 40/100

AI lập trình thiếu cảm nhận thời gian: Cần thay đổi cách đánh giá hiệu suất

AI coding agents can spend hours on a task without a calibrated sense of time passing. Long-horizon…

DịchChuyên gia cảnh báo các AI lập trình thường làm việc liên tục mà không kiểm soát được thời gian. Do đó, các bài kiểm tra cần đo lường trực tiếp khả năng quản lý thời gian thay vì chỉ dựa vào kết quả công việc để đánh giá hiệu quả.

Tổng 3 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (21 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Tác vụ dài hạn” | AIHOT.vn