Sierra: Blog
85

Tin ngành

Sierra ra mắt hyper-τ-bench: Bộ tiêu chuẩn đánh giá khả năng tự xây dựng AI Agent

(giờ Việt Nam)

Tóm tắt AI

Sierra vừa công bố hyper-τ-bench, bộ benchmark tiên phong đánh giá năng lực của các AI Agent trong việc tự thiết kế và xây dựng các Agent khác, mở ra tiêu chuẩn mới cho sự phát triển của hệ thống tự hành dài hạn.

Bản dịch AI

Hyper-𝜏-bench: Evaluating agents that build agents

Chúng tôi đã xây dựng 𝜏-bench vào năm 2024 để trả lời một câu hỏi vốn được coi là mới mẻ vào thời điểm đó: Liệu một mô hình có thể đóng vai trò là một nhân viên dịch vụ khách hàng đáng tin cậy? Giờ đây, đó đã là yêu cầu cơ bản. Câu hỏi khó hơn là, ai là người xây dựng nên tác nhân (agent) đó ngay từ đầu? Ngày càng nhiều, chính các mô hình đang tự thực hiện việc này.

Chúng tôi đã hợp tác chặt chẽ với một số công ty hàng đầu thế giới để ra mắt các tác nhân của họ. Trên thực tế, công việc này không giống như việc triển khai theo một thông số kỹ thuật có sẵn, mà giống như làm nghiên cứu hơn. Các yêu cầu nằm rải rác trong sổ tay hướng dẫn, bộ phận hỗ trợ, bảng tính và trong tư duy của những nhân viên tuyến đầu giỏi nhất của bạn — vì vậy bạn phải hình thành giả thuyết, tìm kiếm bằng chứng, sau đó xây dựng và thử nghiệm để xác định những yếu tố nào thực sự thúc đẩy hiệu suất.

Hôm nay, chúng tôi công bố mã nguồn mở cho hyper-𝜏-bench (được xuất bản dưới tên 𝜏^𝜏-bench), một phương pháp đánh giá tác nhân dài hạn mới, giúp đo lường khả năng của các mô hình không chỉ trong việc đóng vai trò là một tác nhân, mà còn trong việc tự xây dựng nên một tác nhân.

Bên trong môi trường sandbox

Hyper-𝜏-bench đưa một tác nhân lập trình viên (developer agent) vào một không gian làm việc sandbox với các hồ sơ của một doanh nghiệp giả lập, cùng với một khách hàng giả lập mà nó có thể nhắn tin bất cứ lúc nào. Từ đó, tác nhân lập trình viên thực hiện công việc từ đầu đến cuối — khôi phục thông số kỹ thuật từ các bằng chứng, thiết kế kiến trúc và chuyển đổi các hành động của doanh nghiệp thành các công cụ — cho đến khi có được một tác nhân dịch vụ khách hàng hoàn chỉnh. REST API của khách hàng có thể bị lỗi một cách tinh vi, vì vậy một phần công việc là phải tìm ra lỗi đó nằm ở thông số kỹ thuật hay trong mã nguồn. Tác nhân hoàn thiện phải phục vụ từ một danh mục mô hình cố định, trong phạm vi ngân sách chi phí cho mỗi cuộc hội thoại. Sau khi được bàn giao, chúng tôi triển khai nó đối với lưu lượng truy cập sản xuất giả lập bằng cách sử dụng các bài kiểm tra theo phong cách 𝜏-bench có thể xác minh đầy đủ mà lập trình viên chưa từng thấy trong quá trình xây dựng.

Vị thế hiện tại của công nghệ tiên phong

Khi làm việc độc lập, cấu hình tốt nhất của chúng tôi — Claude Opus 5 (khả năng suy luận tối đa) chạy trong Claude Code — chỉ vượt qua 23,9% các tác vụ đánh giá ẩn. Khi kết hợp với một kỹ sư có bối cảnh chuyên sâu, cùng một loại mô hình đó đạt tới 82,2% trên cùng các tác vụ.

Chúng tôi đã đọc qua các lộ trình phát triển của lập trình viên để xem các bản dựng của họ bị thất bại ở đâu. Năm mô hình nổi bật đã xuất hiện:

Bức tranh toàn cảnh

Hyper-𝜏-bench nằm cùng nhóm với các bộ tiêu chuẩn đánh giá như MLE-bench và RE-Bench, vốn đo lường khả năng nghiên cứu: thiết kế các thí nghiệm, cân nhắc các đánh đổi và lặp lại để hướng tới một hệ thống tốt hơn. Việc xây dựng một tác nhân đòi hỏi tất cả những điều đó — và bổ sung thêm một vài vấn đề riêng. Thông số kỹ thuật phải được khôi phục từ tài liệu và con người. Và vì hệ thống đang được xây dựng chính là một AI, cách duy nhất để biết liệu một thiết kế có hiệu quả hay không là chạy thử nó và đọc những gì nó phản hồi với người dùng thực, những người mà lập trình viên chưa từng thấy trong quá trình xây dựng.

𝜏-bench đặt câu hỏi liệu các mô hình có thể trở thành những tác nhân tốt hay không. Hyper-𝜏-bench đặt câu hỏi liệu chúng có thể tự xây dựng nên các tác nhân đó hay không. Khi các tác nhân đảm nhận nhiều công việc đó hơn, chúng tôi sẽ tiếp tục sử dụng hyper-𝜏-bench để theo dõi mức độ hiệu quả của chúng.

Bài báo | Cơ sở mã | Bảng xếp hạng

Đăng ký theo dõi blog của Sierra

Nhận thông báo về các tính năng sản phẩm mới, cập nhật khách hàng và nhiều nội dung khác.

Khám phá những gì Sierra có thể làm cho bạn

Tìm hiểu cách Sierra có thể giúp bạn mang lại kết quả tốt hơn với AI.

AI AgentSierraBenchmarkTự động hóaCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Sierra: Blog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.