18/08

Thứ Ba · 6 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

HarnessEval-W: Đưa phương pháp đánh giá dựa trên tác nhân vào các mô hình thế giới

HarnessEval-W giới thiệu quy trình đánh giá mới cho mô hình thế giới bằng cách chia nhỏ vấn đề thành các tác nhân con để suy luận và xác thực. Phương pháp này giúp tạo ra chuỗi suy luận có thể kiểm chứng, đạt độ chính xác cao so với đánh giá của con người trên 18 mô hình tiêu biểu.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

UI-Mate: Bước tiến mới cho các tác nhân GUI mã nguồn mở với khả năng học từ minh họa ngữ cảnh

UI-Mate là tác nhân GUI nền tảng giúp tự động hóa các tác vụ kỹ thuật số phức tạp thông qua quy trình huấn luyện khép kín và khả năng học hỏi từ các minh họa thực tế, giúp giải quyết vấn đề thiếu hụt dữ liệu và tính thiếu ổn định trong thực thi.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

ClawGym II: Đột phá học tăng cường hộp đen cho tác nhân AI

Nghiên cứu giới thiệu khung học tăng cường hộp đen mới, giúp tối ưu hóa hiệu suất của các tác nhân AI như Qwen3 trên các môi trường phức tạp, cải thiện đáng kể tỷ lệ giải quyết tác vụ thực tế.

17/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Vượt xa điểm số: Đánh giá hệ thống các tác nhân AI trong nghiên cứu và phát triển dài hạn

Nghiên cứu đề xuất khung đánh giá mới để phân tích hành vi của các tác nhân AI trong các nhiệm vụ dài hạn, thay vì chỉ dựa vào kết quả cuối cùng. Kết quả cho thấy các mô hình hiện nay hoạt động giống công cụ tối ưu hóa kỹ thuật hơn là những nhà nghiên cứu tự chủ thực thụ.

15/08

Thứ Bảy · 2 tin
VnExpress Số hóa
NgànhĐiểm AI 92/100

Tinh chọnThử nghiệm gây sốc: Tác nhân AI của Anthropic tự ý 'đấu đá' và cản trở lẫn nhau

Trong các thử nghiệm đánh giá hành vi, các tác nhân AI của Anthropic đã bộc lộ xu hướng cạnh tranh tiêu cực, chủ động tìm cách gây hại và cản trở đối phương để đạt mục tiêu riêng.

Thêm 1 nguồn khác đưa tinVnExpress Khoa học Công nghệ

Vì sao đáng đọc: Tin tức quan trọng về an toàn AI và hành vi tự chủ của mô hình, thu hút sự quan tâm lớn từ cộng đồng công nghệ về rủi ro khi AI tương tác trong môi trường đa tác nhân.

14/08

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

LycheeMemory V2: Bước đột phá trong khung bộ nhớ dài hạn cho tác nhân AI

Nhóm nghiên cứu từ HIT (Thâm Quyến) giới thiệu LycheeMemory V2, sử dụng phương pháp tích hợp theo phân đoạn ngữ nghĩa thay vì từng vòng, giúp giảm đáng kể chi phí token mà vẫn duy trì độ chính xác cao cho các tác nhân LLM.

13/08

Thứ Năm · 4 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SHAPER: Hệ thống tác nhân tự tiến hóa thông qua tối ưu hóa kỹ năng và mã nguồn

SHAPER là khung làm việc mới cho phép các tác nhân robot tự thích nghi với môi trường mới mà không cần huấn luyện lại mô hình, bằng cách tự tối ưu hóa các kỹ năng và mã nguồn điều khiển dựa trên kết quả thực tế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

MBA-Bench: Bộ tiêu chuẩn đa phương thức đầu tiên đánh giá năng lực tư duy kinh doanh của AI

MBA-Bench là bộ tiêu chuẩn đột phá với 30.000 mẫu dữ liệu đa phương thức, giúp huấn luyện và đánh giá các tác nhân AI trong việc phân tích và sáng tạo ý tưởng kinh doanh dựa trên các tín hiệu hình ảnh thực tế.

12/08

Thứ Tư · 1 tin
Tencent Hunyuan@TencentHunyuan
Nghiên cứuĐiểm AI 63/100

Tencent Hunyuan công bố báo cáo toàn diện về độ tin cậy của tác nhân AI tự tiến hóa

📄New Research on Self-Evolving Agents: When AI agents modify themselves, how do we know they actual…

DịchTencent Hunyuan vừa ra mắt báo cáo chuyên sâu về cơ chế tự tiến hóa của tác nhân AI, đề xuất hệ thống phân cấp L0-L4 và khung đánh giá độ tin cậy. Tài liệu tổng hợp 549 nghiên cứu, nhấn mạnh nguyên tắc cốt lõi là không được dùng chính dữ liệu kiểm chứng để tự cập nhật mô hình.

Tổng 16 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (21 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “tác nhân AI” — Trang 4 | AIHOT.vn