QbitAI
85

Sản phẩm

Tập đoàn viễn thông Trung Quốc ra mắt AI Agent đa năng, lọt top 3 bảng xếp hạng IDC

(giờ Việt Nam)

Tóm tắt AI

China Telecom vừa trình làng TeleAgent, một AI Agent đa năng gây ấn tượng mạnh khi trực tiếp vươn lên vị trí thứ 3 trong các bài kiểm tra thực tế của IDC.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

17/09/2026 17:39:19 Nguồn: QbitAI

China Telecom, TeleAgent

Kim Lỗi đưa tin từ Aofei Temple

QbitAI | Kênh chính thức QbitAI

Thật bất ngờ, một Agent doanh nghiệp đa năng do doanh nghiệp nhà nước phát triển đã lọt vào top 3 tại Trung Quốc!

Đây là kết quả được IDC đưa ra trong báo cáo "Đánh giá công nghệ sản phẩm Agent doanh nghiệp đa năng tại Trung Quốc" lần đầu tiên được công bố.

Và doanh nghiệp nhà nước này chính là China Telecom.

Đáng chú ý, lần này IDC không tiếp tục sử dụng các Benchmark mô hình lớn quen thuộc, mà thay vào đó là gần 100 tác vụ không công khai để kiểm tra trực tiếp xem một Agent có thực sự hoàn thành công việc trong môi trường văn phòng thực tế hay không.

Cụ thể, TeleAgent đạt 3,49 điểm cho các tác vụ thông thường và 3,36 điểm cho các tác vụ phức tạp; trong chín năng lực được đánh giá, sản phẩm đạt điểm tuyệt đối 5/5 về hiệu suất tác vụ và đạt điểm cao nhất trong bài kiểm tra về hiệu quả chi phí.

Hơn nữa, thời gian ra mắt chính thức của TeleAgent chưa lâu. Vào tháng 4 năm nay, phiên bản máy tính của TeleAgent vẫn còn đang trong giai đoạn thử nghiệm nội bộ. Đến tháng 7, phiên bản V1.0 mới chính thức được tung ra thị trường. Chỉ sau hơn một tháng, quy mô người dùng hiện đã đạt gần 1,2 triệu.

Vậy câu hỏi đặt ra là:

Tại sao một Agent đa năng do doanh nghiệp nhà nước phát triển lại có thể bứt phá nhanh đến vậy trong cuộc đua này?

Kiểm tra Agent với gần 100 câu hỏi, China Telecom lọt vào top 3

Trước khi tìm hiểu sâu về cách TeleAgent giành vị trí thứ ba, chúng ta cần hiểu rõ IDC đã kiểm tra những gì trong lần này.

Các Benchmark mà chúng ta quen thuộc trước đây thường có xu hướng đơn giản hóa vấn đề thành một tập hợp các điểm số; sau khi chạy qua các hạng mục như toán học, mã nguồn, suy luận và kiến thức, người ta có thể đánh giá sơ bộ vị trí năng lực của mô hình.

Tuy nhiên, để kiểm tra năng lực của một Agent đa năng, phương pháp đánh giá lại khác biệt; xét cho cùng, nó phải đối mặt với các nghiệp vụ phức tạp và đa dạng bên trong doanh nghiệp.

Chính vì vậy, lần này IDC tập trung vào khả năng hoàn thành công việc từ đầu đến cuối (end-to-end).

Theo định nghĩa của IDC, một Agent doanh nghiệp đa năng cần có khả năng hiểu mục tiêu, gọi công cụ và kỹ năng (Skill), kết nối với kiến thức doanh nghiệp và hệ thống nghiệp vụ, đồng thời thực hiện tác vụ một cách liên tục.

Xoay quanh mục tiêu này, IDC đã thiết kế gần 100 tác vụ không công khai, bao gồm cả các công việc văn phòng hàng ngày như email, lịch trình, xử lý tài liệu, cũng như các tác vụ phức tạp như ngữ cảnh dài, chu kỳ đa bước, xử lý PPT phức tạp, bảng tính và thao tác trên trình duyệt.

Một số câu hỏi đã rất sát với công việc thực tế, chẳng hạn như yêu cầu Agent xử lý 3.755 dòng dữ liệu thô, hoặc tóm tắt nội dung từ tài liệu khoảng 30.000 chữ để tạo ra một bản PPT 11 trang.

Việc chạy xong tác vụ vẫn chưa phải là kết thúc, IDC còn tiếp tục kiểm tra trạng thái hệ thống và tệp tin cuối cùng để xác nhận xem Agent có thực sự hoàn thành công việc hay không.

Từ kết quả kiểm tra, có thể thấy hầu hết các Agent đa năng hiện nay đã có thể thực hiện các tác vụ phức tạp, nhưng khi tác vụ trở nên dài hơn và các bước thực hiện nhiều hơn, khoảng cách về chất lượng bàn giao và tiêu thụ tài nguyên sẽ càng bị nới rộng.

Chính nhờ phương pháp kiểm tra này, TeleAgent đã đạt điểm tuyệt đối về hiệu suất tác vụ, đồng thời đạt hiệu quả chi phí cao nhất trong đợt đánh giá.

Khi độ phức tạp của tác vụ, độ dài ngữ cảnh và số lần gọi công cụ liên tục tăng lên, sự khác biệt về chi phí và chất lượng bàn giao giữa các sản phẩm cũng đồng thời tăng lên.

Điều này cho thấy sự phát triển của Agent đa năng đến nay đã khiến mô hình nền tảng khó có thể giải thích cho toàn bộ sự khác biệt; một Agent có dễ dùng hay không ngày càng phụ thuộc vào toàn bộ hệ thống kỹ thuật bao quanh mô hình đó.

Một Agent có làm tốt việc hay không, mô hình chỉ là một phần

Trong báo cáo lần này, IDC đã đặc biệt nhắc đến một thuật ngữ – Agent Harness. Chúng ta có thể hiểu đơn giản đây là toàn bộ hệ thống thực thi được xây dựng xung quanh mô hình lớn.

Mô hình chịu trách nhiệm hiểu và suy luận, nhưng khi một tác vụ phức tạp thực sự bắt đầu chạy, hệ thống còn phải sắp xếp ngữ cảnh, điều phối công cụ, lưu trạng thái tác vụ và kiểm soát môi trường thực thi. Nếu xảy ra lỗi giữa chừng, nó phải quyết định xem nên thử lại, đổi hướng hay khôi phục tiến trình trước đó. Sau khi kết quả cuối cùng được tạo ra, hệ thống còn phải kiểm tra xem tác vụ đã thực sự hoàn thành hay chưa.

Những năng lực này có thể không rõ ràng trong các tác vụ ngắn, nhưng một khi tác vụ kéo dài, khoảng cách sẽ bị nới rộng nhanh chóng. Những điểm số cao mà TeleAgent đạt được lần này về cơ bản có thể được phân tích từ chuỗi kỹ thuật này.

Đầu tiên là ngữ cảnh.

Thời gian làm việc của Agent càng dài, các tệp tin được mở, kết quả trả về từ công cụ và nội dung đã trao đổi trước đó sẽ liên tục được đưa vào ngữ cảnh. Nếu hệ thống cứ liên tục nạp vào, Token sẽ nhanh chóng bị phình to; nhưng nếu nén quá mức, Agent có thể quên mất các yêu cầu mà người dùng đã đưa ra từ đầu.

TeleAgent đã xây dựng một quy trình xử lý phân cấp cho vấn đề này. Hệ thống sẽ thực hiện cắt tỉa nhẹ đối với các đầu ra từ công cụ cũ có giá trị tương đối thấp, nếu ngữ cảnh vẫn quá dài, một mô hình nén chuyên dụng sẽ xử lý toàn bộ nội dung. Đồng thời, hệ thống sẽ giám sát thời gian thực xem ngữ cảnh có gần đạt giới hạn hay không, một khi chạm ngưỡng, nó sẽ tự động nén trước khi tiếp tục thực hiện các tác vụ tiếp theo. Hiện tại, cửa sổ ngữ cảnh của TeleAgent đã vượt mốc 400K.

Tuy nhiên, chỉ duy trì một tác vụ dài không bị ngắt quãng là chưa đủ, vì công việc doanh nghiệp thường kéo dài qua nhiều ngày hoặc thậm chí nhiều dự án. Vì vậy, TeleAgent đã bổ sung bộ nhớ dài hạn autoDream.

Nó sẽ định kỳ sắp xếp các cuộc hội thoại gần đây, sau đó hợp nhất thông tin mới với bộ nhớ hiện có. Nhờ đó, bối cảnh dự án, thói quen người dùng và sở thích cá nhân có thể được lưu giữ qua các phiên làm việc, người dùng không cần phải giải thích lại từ đầu mỗi khi mở lại vào ngày hôm sau.

Ở tầng sâu hơn, China Telecom không trực tiếp áp dụng một khung Coding Agent có sẵn vào môi trường văn phòng.

Nhân cốt lõi của TeleAgent bao gồm khoảng 30.000 dòng mã Go tự phát triển, đội ngũ cũng đã xử lý riêng các vấn đề tương thích trong các hệ điều hành như Windows PowerShell, Kylin, UnionTech. Đồng thời, phía sản phẩm cũng đã thực hiện điều chỉnh lại cho phù hợp với các tác vụ văn phòng, bởi vì làm PPT, viết báo cáo, xử lý Excel và tìm lỗi trong kho mã nguồn vốn dĩ là hai phương thức làm việc hoàn toàn khác biệt.

AI AgentChina TelecomIDCCông nghệĐột phá AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.