Agent / Tác nhân
Mô hình tự lập kế hoạch, gọi công cụ và thực thi nhiều bước: Từ Claude Code, Manus đến các framework Agent.
3.820 bài thu thập301 tinh chọncập nhật đến 28/09 04:45
- Claude: Blog (Web)T5 · 20/08 · 20:26
Cẩm nang sử dụng Claude Code cho Startup: 5 quy tắc vàng từ Anthropic
Anthropic đúc kết kinh nghiệm từ các startup tăng trưởng nhanh thành 5 quy tắc cốt lõi khi dùng Claude Code, giúp tối ưu hóa quy trình phát triển từ khâu tạo mẫu đến sản phẩm thực tế.
- QbitAIT5 · 20/08 · 18:00
Kimi K3 ra mắt: Đội ngũ 18 AI tự nghiên cứu, thách thức vị thế của Claude 3 Opus
Kimi K3 tạo bước ngoặt lớn khi sử dụng hệ thống 18 Agent tự chủ nghiên cứu thông qua cơ chế Harness, giúp hiệu suất tiệm cận với mô hình Opus 5 đình đám.
- IT HomeT5 · 20/08 · 17:24
Alibaba ra mắt Qwen-UI-Agent: Bước tiến mới giúp AI 'thao túng' mọi giao diện màn hình
Alibaba vừa giới thiệu Qwen-UI-Agent, mô hình nền tảng cho phép AI tương tác trực tiếp với giao diện người dùng trên cả di động, máy tính và trình duyệt một cách thông minh.
- WeChat: MiniMaxT5 · 20/08 · 07:36
MiniMax Design ra mắt: Bước tiến từ xử lý pixel đến thấu hiểu ý đồ và ngữ nghĩa
MiniMax Design là nền tảng tích hợp mô hình đa phương thức H3, giúp tự động hóa quy trình sản xuất nội dung từ khâu xử lý tư liệu đến dựng phim hoàn chỉnh thông qua các tác nhân AI thông minh.
- Hugging Face Daily PapersT4 · 19/08 · 15:00
Giải mã kỹ năng của AI Agent: Tại sao chúng hiệu quả và khi nào thì thất bại?
Nghiên cứu phân tích sâu về cách các gói kỹ năng (skills) hỗ trợ LLM Agent, đồng thời chỉ ra những giới hạn và nguyên nhân thất bại thông qua thực nghiệm định lượng và phân tích quỹ đạo hành động.
- Hugging Face Daily PapersT4 · 19/08 · 11:00
Cá nhân hóa nghiên cứu tự động: Hướng tới cộng sự AI thấu hiểu nhà khoa học
Nghiên cứu đề xuất mô hình AI tự động hóa quy trình nghiên cứu khoa học dựa trên hồ sơ, kinh nghiệm và phong cách làm việc riêng biệt của từng nhà khoa học, thay vì các tiêu chuẩn chung chung.
- HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)T4 · 19/08 · 10:05
StartupBench: Bộ tiêu chuẩn đánh giá AI Agent dựa trên quy trình thực tế của startup
StartupBench là bộ tiêu chuẩn đánh giá AI Agent thông qua các quy trình làm việc thực tế từ các startup, thay vì các tác vụ giả định. Kết quả cho thấy ngay cả những mô hình mạnh nhất cũng chỉ đạt tỷ lệ thành công 30%, bộc lộ hạn chế lớn trong việc tuân thủ chỉ dẫn phức tạp và kiến thức chuyên môn.
- ClaudeT4 · 19/08 · 03:30
Claude chính thức hỗ trợ quản lý Gmail và Google Drive
Claude hiện có thể soạn, gửi email trực tiếp trên Gmail và quản lý tệp tin trong Google Drive. Người dùng có thể cấp quyền cho Claude xử lý công việc với sự kiểm soát phê duyệt chặt chẽ, tính năng đã khả dụng cho tất cả các gói trả phí.
- Claude: Blog (Web)T4 · 19/08 · 02:26
Cách Anthropic dùng Claude Tag làm 'trợ lý trực chiến' xử lý sự cố CI/CD
Các kỹ sư tại Anthropic đã xây dựng tác nhân AI Claude Tag để tự động phản ứng với sự cố CI/CD, giúp rút ngắn thời gian phân tích lỗi xuống chỉ còn 3-14 phút. Giải pháp này tích hợp trực tiếp vào Slack và các công cụ giám sát, hiện đã được chia sẻ mã nguồn để cộng đồng cùng triển khai.
- Hugging Face: BlogT4 · 19/08 · 02:05
Bộ nhớ cho AI Agent: Không phải cứ nhiều là tốt, cần hiệu chỉnh theo năng lực mô hình
Nghiên cứu từ IBM cho thấy việc tối ưu bộ nhớ AI Agent cần tùy biến theo năng lực mô hình: mô hình mạnh nên dùng toàn bộ hướng dẫn, trong khi mô hình yếu đạt hiệu quả cao nhất với phương pháp truy xuất chọn lọc.
- Hugging Face Daily PapersT4 · 19/08 · 00:30
StateM: Đột phá hiệu suất tác tử AI với kiến trúc runtime mới, đạt độ chính xác 95,3% trên Terminal-Bench
StateM là hệ thống runtime mới giúp tối ưu hóa khả năng thực thi của tác tử AI mà không cần thay đổi trọng số mô hình, thông qua việc quản lý trạng thái bền vững và quy trình làm việc có thể phục hồi.
- JiQiZhiXinT3 · 18/08 · 23:00
Kỷ nguyên Harness trong đánh giá AI: 15 tổ chức học thuật ra mắt HarnessEval
HarnessEval định nghĩa lại cách đánh giá các hệ thống AI phức tạp bằng cách xây dựng một quy trình kiểm chứng có hệ thống, thay vì chỉ dựa vào các mô hình chấm điểm đơn thuần.
- Hugging Face Daily PapersT3 · 18/08 · 16:00
Tại sao các AI tự động nghiên cứu khoa học lại thất bại? Đánh giá toàn diện trên 100 tác vụ thực tế
Nghiên cứu giới thiệu AutoResearchEval, bộ dữ liệu gồm 100 tác vụ khoa học thực tế để phân tích quy trình và các điểm yếu của AI trong toàn bộ vòng đời nghiên cứu, từ lên ý tưởng đến viết báo cáo.
- PandailyT3 · 18/08 · 15:15
Doubao trên PC của ByteDance lột xác thành AI Agent toàn năng: Điều khiển máy tính và làm việc từ xa
ByteDance tích hợp khả năng điều khiển giao diện (GUI), kết nối đám mây và thực thi tác vụ từ xa vào Doubao PC, biến ứng dụng này thành một AI Agent đa năng cạnh tranh trực tiếp với các mô hình hàng đầu.
- Google AI: DEV tác giảT3 · 18/08 · 14:36
Thiết kế đánh giá AI: Ưu tiên sự minh bạch trước khi trực quan hóa dữ liệu
Bài viết hướng dẫn cách sử dụng các framework mã nguồn mở như Inspect AI và Harbor để đánh giá kỹ năng của AI Agent, kết hợp cùng Google Sheets và Data Studio để phân tích kết quả trực quan.
- PandailyT3 · 18/08 · 09:15
DeepSeek ra mắt mã nguồn mở Harness: Đặt cược vào nền tảng Agent thay vì sản phẩm đơn lẻ
DeepSeek vừa phát hành mã nguồn mở Harness (dsh), một hệ thống dựa trên microkernel Cordis nơi mọi thành phần đều là plugin. Đây là bước đi chiến lược nhằm biến Harness thành nền tảng hạ tầng tiêu chuẩn cho kỷ nguyên AI Agent.
- PandailyT3 · 18/08 · 09:15
Đột phá: Hai robot hình người tự động đấu trọn vẹn một trận bóng bàn 11 điểm
Nhóm nghiên cứu từ Đại học Hồng Kông và KAI đã tạo ra hệ thống SMASH 2.0, cho phép hai robot hình người tự động thi đấu bóng bàn hoàn chỉnh mà không cần sự can thiệp của con người.
- Hugging Face Daily PapersT3 · 18/08 · 09:00
Agentic Transaction: Hướng tới hệ thống tác nhân AI tuân thủ chuẩn ACID
Nghiên cứu đề xuất khung làm việc ACID cho các tác nhân AI, giúp đảm bảo tính nhất quán, độ tin cậy và khả năng phục hồi khi thực hiện các tác vụ phức tạp, dài hạn trong môi trường thực tế.
- Latent SpaceT3 · 18/08 · 06:30
Stripe thâu tóm OpenRouter với giá 7 tỷ USD
Không cần GPU hay các tác nhân AI phức tạp, Stripe tập trung vào việc sở hữu hạ tầng và mạng lưới phân phối cực kỳ mạnh mẽ thông qua thương vụ này.
- Google Developers BlogT3 · 18/08 · 06:22
Xây dựng AI Agent theo mô hình Zero Trust với Google ADK
Google giới thiệu bộ công cụ ADK giúp phát triển AI Agent an toàn, sử dụng cơ chế bảo mật ba lớp để ngăn chặn tấn công tiêm nhiễm câu lệnh (prompt injection) và đảm bảo tính toàn vẹn của dữ liệu.