Jiqizhixin
92

Nghiên cứu

ClawBench: Khi các siêu AI 'bó tay' trước những tác vụ thực tế trên web

(giờ Việt Nam)

Tóm tắt AI

Nghiên cứu mới từ TIGER Lab cho thấy các mô hình hàng đầu như Claude, GPT và Gemini đều thất bại thảm hại khi thực hiện các tác vụ thực tế trên web, với tỷ lệ thành công chỉ đạt khoảng 33%.

Bản dịch AI

Nội dung dưới đây được lấy từ Nền tảng công chúng WeChat (WeChat Official Accounts Platform)

Mẹo nhỏ: Sogou hỗ trợ truy vấn tối đa 40 ký tự, các văn bản từ "nguyên hình" trở đi sẽ bị bỏ qua

AI viết code thì "thần thánh", nhưng làm game lại đồng loạt "lật kèo"? GameDevBench: Benchmark đầu tiên dành cho Agent phát triển game đã ra mắt

Trong lĩnh vực AI Agent, việc đánh giá khả năng phát triển phần mềm vốn không còn mới mẻ, các nền tảng như SWE-Bench... bao gồm toàn bộ series Claude 4.5, series Gemini 3, GPT-5.1 Codex, và...

Chuyên sâu về tác nhân thông minh (Agent)

Giám đốc an ninh Meta AI "gặp nạn", Agent lập trình viết 30.000 dòng code mỗi ngày — Hóa đơn token năm 2026 của bạn sắp bùng nổ rồi

Giám đốc an ninh Meta AI bị chính robot OpenClaw của mình xóa email, GPT-5.3 một ngày... Bạn không cần phải như Summer Yue, ném một Agent không thể kiểm soát vào môi trường thực tế...

Tự động hóa Alex AI

Claude 4.6 xuất hiện đầy ấn tượng! Áp đảo GPT-5.2

Giới lập trình: 16 AI Agent, hai tuần "hạ gục" đội ngũ lập trình viên con người, lần này có lẽ thật sự... Chưa bao giờ là làm một "chatbot" — nó muốn kéo Claude ra khỏi khung chat...

Tin tức AI Tech Day

AI "cây nhà lá vườn" lọt top 5 Agent lập trình toàn cầu, bạn cần biết những ẩn ý đằng sau bảng xếp hạng này

Bạn có dám giao cho khách hàng một agent cứ 4 lần thì 3 lần "lật kèo" không?... 15 bug sản xuất thực tế, để Claude, Gemini, Codex, Qwen... thử sức

Chào buổi sáng Đại Lôi (Da Lei)

Hướng dẫn OpenClaw | Chương mở đầu: AI của bạn nên "cư trú" trên máy chủ của chính bạn

Trợ lý AI ChatGPT, Claude, Gemini — những dịch vụ này đều rất hữu ích. Mở... Định tuyến Agent │ │ │ │ Kiểm soát quyền │ │ │...

Lữ khách nghệ thuật (Art Walker)

Chấn động! GPT-4o thảm hại đứng cuối bảng, "Bảng xếp hạng năng lực làm việc" của AI mới nhất đã ra lò: Nuôi tôm hùm đắt đỏ nhất hóa ra không phải OpenAI?

Nhưng điều thực sự khiến người ta "rớt hàm" chính là thứ hạng phía sau. Hạng 4, Claude Sonnet... Chỉ cần đáp án cuối cùng đúng là cho điểm tối đa. Nhưng kịch bản Agent hoàn toàn khác biệt! AI đối mặt...

Lớp học nghề tay trái Thanh Đoàn (Qingtuan)

Hướng dẫn chọn mô hình để "nuôi tôm hùm": Nhìn vào việc lựa chọn AI Agent từ bảng xếp hạng OpenRouter

Lời mở đầu: Nếu ví công nghệ cốt lõi của AI Agent như một "trang trại": Mô hình lớn là "...", "đội ngũ", tương tác môi trường là "cảm nhận" — vậy thì, để những công nghệ này thực hiện các nhiệm vụ thực tế...

oe1019

Giải mã chuyên sâu OpenClaw v2026.3.7: Đừng chỉ chăm chăm nhìn vào GPT-5.4, 5 cập nhật này mới thực sự đánh trúng tâm lý lập trình viên Trung Quốc

33% hãy nói về dữ liệu trước: Quy trình giám sát điểm nóng của tôi: Trước khi tối ưu: mỗi yêu cầu khoảng 4.200... Những điểm nhấn ẩn giấu trong bản cập nhật lần này của GPT/Claude: Nhật ký cập nhật chính thức có đề cập đến GPT-5.4 và...

DataFunTalk

Claude xuất hiện đối thủ mới! Gemini gây bão với tính năng giọng nói, GitHub âm thầm thay đổi quy tắc

Ứng dụng cấp quốc dân với khả năng toàn diện của AI Agent mã nguồn mở. PyTorch 2.11 ra mắt... Siri, ChatGPT/Gemini/Claude đều có thể sử dụng (trừ trong nước), robot Figure tỏa sáng...

Trí Giản (Smart & Concise)

1 2 3 4 5 6 7 8 9 10 Trang sau

Tìm thấy khoảng 224 kết quả

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Jiqizhixin. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.