Sản phẩm
Trợ lý AI của Baidu vượt mặt Claude và GPT, giành ngôi vương trên bảng xếp hạng Agent quốc tế
(giờ Việt Nam)
Tóm tắt AI
Trợ lý AI (Agent) của Baidu vừa xuất sắc đứng đầu bảng xếp hạng quốc tế về khả năng thực thi tác vụ, chính thức vượt qua các đối thủ sừng sỏ như Claude và GPT để giành vị trí quán quân toàn cầu.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
22/07/2026 15:31:19 Nguồn: QbitAI
Ngày 17 tháng 7 năm 2026, Baidu Wenxin Assistant Task Agent đã đứng đầu bảng xếp hạng đánh giá AI Agent kỹ thuật toàn cầu PinchBench v2 với số điểm cao nhất là 94,6% và điểm trung bình là 94,4%. Đây là hệ thống AI Agent nội địa đầu tiên đạt vị trí số 1 trên bảng xếp hạng tổng thể của PinchBench dưới tư cách là một sản phẩm chính thức.
Trong số 59 mô hình tham gia đánh giá, Wenxin Assistant Task Agent xếp hạng nhất, vượt qua Anthropic Claude Opus 4.8-fast (93,5%), Alibaba Qwen3.7-max (92,5%), Anthropic Claude Opus 4.8 (90,5%) và OpenAI GPT-5.6-luna (88,7%).

Bảng xếp hạng này kiểm tra những năng lực khó làm giả nhất.
PinchBench được ra mắt bởi Kilo AI và được duy trì bởi cộng đồng OpenClaw. Sự khác biệt giữa nó và các tiêu chuẩn mô hình ngôn ngữ lớn (LLM) truyền thống như MMLU hay GPQA rất rõ ràng: các tiêu chuẩn truyền thống kiểm tra "mô hình có biết hay không", còn PinchBench kiểm tra "AI Agent có thể hoàn thành toàn bộ công việc và bàn giao kết quả có thể kiểm chứng được hay không".
Phiên bản hiện tại bao gồm 23 kịch bản công việc thực tế và 147 nhiệm vụ, bao phủ 7 danh mục lớn: phân tích dữ liệu, nghiên cứu và viết lách, phát triển mã nguồn, tự động hóa văn phòng, xử lý tài liệu, thao tác trên web và xử lý đa phương tiện, với tổng cộng 617 lần chạy thử nghiệm. Việc chấm điểm áp dụng cơ chế song song "xác thực tự động + đánh giá bởi LLM", hoàn toàn không có sự can thiệp của con người.

Quan trọng hơn, PinchBench được sử dụng để đo lường năng lực tổng hợp của mô hình và khung (framework) Agent. Ngay cả với cùng một mô hình nền tảng, nếu được trang bị các khung Agent khác nhau, điểm đánh giá cuối cùng vẫn sẽ có sự chênh lệch lớn. Điều này cho thấy thành tích đứng đầu của Wenxin Assistant Task Agent đại diện cho sức mạnh tổng hợp đến từ sự phối hợp giữa năng lực mô hình và kỹ thuật hệ thống.
Đội ngũ tìm kiếm AI của Baidu đã mã nguồn mở quy trình đánh giá hoàn chỉnh trên GitHub (github.com/Baidu-AI-Search/PinchBench-Evaluation). Các bản ghi thực thi, sản phẩm bàn giao và lý do chấm điểm của LLM Judge cho 147 nhiệm vụ đều được công khai toàn bộ, bất kỳ ai cũng có thể tái hiện từng bước.
Đưa AI từ "chỉ biết nói" sang "biết làm"
Ví dụ, một trong các nhiệm vụ là: "Biên độ lợi nhuận thực tế của GitLab trong quý 3 năm tài chính 2025 chênh lệch bao nhiêu điểm cơ bản so với dự báo?" Không có tệp dữ liệu nào được cung cấp, Agent cần tự tìm kiếm báo cáo tài chính gốc hoặc biên bản cuộc họp của GitLab, xác định các dự báo liên quan, tính toán biên độ lợi nhuận hoạt động phi GAAP đạt khoảng 18%, vượt dự báo khoảng 500 điểm cơ bản và ghi kết luận vào tệp được chỉ định.
Năm tiêu chí chấm điểm tự động — tạo tệp, xác định chỉ số, trích xuất giá trị thực tế và giá trị dự báo, tính toán điểm cơ bản — đều đạt điểm tối đa 1.0.
Một nhiệm vụ khác kiểm tra kỹ thuật bảo mật: phân tích nhiều lỗ hổng CVE của một ứng dụng Node.js, phân loại theo mức độ ưu tiên và lập kế hoạch khắc phục. Yêu cầu đánh giá là Agent phải xác định hai lỗ hổng mức CRITICAL là express RCE và JWT bypass là P0, trong đó JWT bypass cần được đánh dấu đặc biệt do có ghi nhận khai thác thực tế; xác định SQL injection của PostgreSQL là P1 và đưa ra ngữ cảnh kết hợp với lộ trình thanh toán PCI DSS; hạ cấp các lỗ hổng phụ thuộc chỉ ảnh hưởng đến giai đoạn xây dựng xuống P2/P3; lập kế hoạch khắc phục theo năm đợt, kèm theo cửa sổ triển khai cụ thể (vá nóng khẩn cấp ngày 12 tháng 4, đợt P1 ngày 14 tháng 4).
Kết luận đánh giá của LLM là "hiệu suất xuất sắc ở mọi khía cạnh", đạt điểm tối đa 1.0.
Ngoài ra còn có một trường hợp phân tích pháp lý hợp đồng, nhiệm vụ là đọc một thỏa thuận dịch vụ phần mềm, trích xuất các ngày quan trọng, hệ thống hóa nghĩa vụ của hai bên, xác định các điểm rủi ro và tạo tóm tắt tài chính. Những nhiệm vụ như vậy trước đây cần trợ lý luật sư mất vài giờ. Kết quả đầu ra của Wenxin Assistant Task Agent đã xác định 12 rủi ro cho phía khách hàng, 10 rủi ro cho nhà cung cấp, 5 rủi ro chia sẻ, vấn đề dòng tiền trả trước của cấu trúc thanh toán chia làm sáu kỳ, và khoảng trống quyền sở hữu trong điều kiện chuyển nhượng IP. Tất cả đều được thực hiện hoàn hảo — bốn tiêu chí đánh giá cuối cùng đều đạt điểm tối đa 1.0.
Những nhiệm vụ phức tạp trên đều nằm trong tầm tay của Wenxin Assistant Task Agent, chưa kể đến các nhu cầu văn phòng hàng ngày của người dùng phổ thông.
Ví dụ, bạn đưa cho Wenxin Assistant một bảng dữ liệu nghề nghiệp và nói: "Thống nhất định dạng tiêu đề, tạo sheet tổng hợp mới, lập bảng tổng hợp theo nhóm nghề nghiệp và danh sách Top 10/Bottom 10, tạo biểu đồ so sánh số lượng việc làm của từng nhóm nghề."
Đây là một chuỗi nhiệm vụ có sự phụ thuộc lẫn nhau, bất kỳ bước nào sai sót đều khiến các bước sau không thể thực hiện. Wenxin Assistant Task Agent tự phân tách và hoàn thành trong một lần chạy.

Hoặc nếu bạn không thể đưa ra chỉ dẫn chi tiết, muốn thử vận may: "Cuối tuần này tôi muốn đi du lịch solo 2 ngày từ Bắc Kinh đến Thanh Đảo." Không có thêm thông tin nào khác. Agent tự tìm kiếm dữ liệu thời gian thực về giao thông, chỗ ở, địa điểm tham quan, lập lịch trình hoàn chỉnh, danh sách ngân sách và hướng dẫn tránh các "bẫy" du lịch, bàn giao một bản kế hoạch mà bạn có thể chụp màn hình và lên đường ngay.

Hoặc nếu bạn không muốn phải hỏi AI mỗi lần, hãy để nó giúp bạn hoàn thành các công việc lặp đi lặp lại đòi hỏi trí tuệ, bạn có thể thiết lập các nhiệm vụ định kỳ, ví dụ: "Mỗi tối thứ Hai lúc 10 giờ, hãy giúp tôi tổng hợp các bài báo chất lượng cao về lĩnh vực AI trong tuần qua, trình bày dưới dạng HTML theo phong cách báo cáo nghiên cứu đầu tư."

7x24 giờ, người dùng không cần phải có mặt mọi lúc.
Tại sao lại là Baidu làm được điều này?
Câu trả lời thực ra rất đơn giản: Baidu là công ty đã dành hơn 20 năm để nghiên cứu về việc thấu hiểu ý định người dùng.
Wenxin Assistant Task Agent được xây dựng dựa trên khung đa Agent của công cụ tìm kiếm AI Orion của Baidu.
Xét về logic kiến trúc, bản thân công cụ tìm kiếm chính là hình mẫu sơ khai nhất của Agent — tiếp nhận ý định, phân tách nhiệm vụ, gọi công cụ, xác thực kết quả; chuỗi liên kết này Baidu đã vận hành hơn hai mươi năm.
Bộ công cụ đã nâng cấp từ trình thu thập dữ liệu (crawler) chỉ mục thành môi trường thực thi mã, bộ xử lý tệp và giao diện API thời gian thực; đầu ra đã thay đổi từ danh sách các liên kết xanh thành các báo cáo có cấu trúc và mã có thể chạy được, nhưng logic cốt lõi vẫn được kế thừa nhất quán.
Wenxin Assistant Task Agent nâng điểm đánh giá nhiệm vụ của mô hình lên trên 94%, chứng minh rằng kiến trúc hệ thống và triển khai kỹ thuật xuất sắc có thể giải phóng đáng kể tiềm năng của mô hình.
Nói cách khác, cùng một mô hình nền tảng, nếu thay bằng khung của Wenxin Assistant Task Agent, tỷ lệ hoàn thành nhiệm vụ sẽ cao hơn. Trong kỷ nguyên Agent, tầm quan trọng của năng lực kỹ thuật khung đang vượt qua việc so sánh các thông số mô hình đơn thuần.
Hiện tại, công nghệ cốt lõi của Wenxin Assistant Task Agent đã được áp dụng toàn diện trên ứng dụng Baidu và Wenxin Assistant. Bạn có thể đăng nhập vào chat.baidu.com, chọn "Nhiệm vụ" để trải nghiệm.
Bài viết này do Baidu cung cấp, QbitAI được ủy quyền đăng tải lại, quan điểm thuộc về tác giả gốc.
Bản quyền đã được bảo hộ, không được phép sao chép và sử dụng dưới mọi hình thức khi chưa được ủy quyền, những trường hợp vi phạm sẽ bị xử lý theo pháp luật.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.