Nghiên cứu giới thiệu phương pháp Elo-per-token sử dụng mô hình Bradley-Terry để đánh giá hiệu quả của việc tăng cường tài nguyên tính toán trong quá trình suy luận của LLM Agent, từ đó chỉ ra quy luật lợi nhuận giảm dần.
PlannerForge là khung làm việc dựa trên LLM giúp hợp nhất toàn bộ quy trình kiểm thử xe tự lái, từ tạo kịch bản, đánh giá đến tối ưu hóa hệ thống, thay thế các công cụ rời rạc hiện nay.
New Microsoft paper. Long agent runs expose failures that short benchmarks miss. Agents can look rel…
DịchNghiên cứu mới từ Microsoft chỉ ra rằng các LLM Agent mất khả năng xử lý khi số bước thực hiện tăng lên, với tỷ lệ thành công giảm từ gần 100% xuống còn 0-33% ở bước thứ 16. Vấn đề nằm ở số lượng bước thay vì độ dài ngữ cảnh, đòi hỏi các giải pháp kiểm soát lỗi theo từng giai đoạn.
Good measurement work on whether retrieved agent skills actually help. They report that agent skill…
DịchBài báo giới thiệu chỉ số RAE giúp đánh giá chính xác khả năng sử dụng kỹ năng thực tế của các LLM Agent, thay vì chỉ dựa vào các chỉ số tổng hợp vốn thường che giấu những hạn chế trong quá trình truy xuất.
Different LLMs may behave more similarly inside an agent harness than their raw traces suggest. LLM…
DịchMột nghiên cứu mới đề xuất phương pháp nén chuỗi hành động của LLM Agent thành các máy trạng thái hữu hạn (FSM) nhỏ gọn, giúp dự đoán bước tiếp theo và phát hiện sớm các lỗi vận hành.
A malicious agent tool can steal context without reading memory or files at all: it can convince the…
DịchNghiên cứu mới giới thiệu phương pháp dùng học tăng cường để tạo ra các công cụ giả mạo, đánh lừa LLM Agent tự động gửi dữ liệu nhạy cảm như lịch sử trò chuyện và thông tin hệ thống ra bên ngoài.
// ContextLeak in AI Agents // The whole attack surface here is a tool name and a tool description….
DịchCác nhà nghiên cứu tại Đại học Duke đã phát triển ContextLeak, một phương pháp sử dụng học tăng cường để tạo ra các công cụ độc hại nhằm đánh cắp dữ liệu nhạy cảm từ LLM Agent, bao gồm lịch sử hội thoại và các tiến trình thực thi.
Nghiên cứu đề xuất chuyển đổi các chuỗi hành động phức tạp của LLM Agent thành mô hình trạng thái hữu hạn (FSM) nhỏ gọn, giúp dự đoán lỗi và bước tiếp theo chính xác hơn so với các phương pháp truyền thống.