Hacker News: AI bài nổi bật
85

Sản phẩm

Unreal Labs ra mắt Unreal Agent: Tối ưu hóa tác vụ AI, cắt giảm tới 40% chi phí vận hành

(giờ Việt Nam)

Tóm tắt AI

Unreal Agent sử dụng cơ chế xử lý bất đồng bộ để quản lý các công cụ AI, loại bỏ độ trễ và chi phí dư thừa, giúp tiết kiệm đáng kể ngân sách so với các giải pháp hiện có.

Bản dịch AI

Unreal Agent — Unreal Labs

Nếu bạn quan tâm đến việc tối ưu hóa chi phí tiên phong cho các AI agent của mình, chúng tôi rất mong được hợp tác! Hãy liên hệ với chúng tôi qua: [email protected].

Trong quá trình triển khai các agent thực tế, chúng tôi muốn chúng phản hồi người dùng nhanh chóng và vận hành với chi phí hiệu quả. Chúng tôi nhận thấy rằng các agent tiêu tốn rất nhiều thời gian và token để quản lý các lệnh gọi công cụ (tool calls), điều này đã thôi thúc chúng tôi xây dựng Unreal Agent với một bộ khung (harness) giúp giảm bớt gánh nặng quản lý công cụ cho mô hình.

Bộ khung của Unreal Agent quản lý các lệnh gọi công cụ theo cách hoàn toàn bất đồng bộ, giúp mô hình nền tảng không cần phải xử lý việc chờ đợi, thăm dò (polling) và kiểm tra trạng thái (heartbeats) cho các công cụ.

Cách tiếp cận này mang lại hai lợi ích chính. Thứ nhất, nó luôn cho phép người dùng điều hướng agent mà không cần chờ đợi các lệnh gọi công cụ hoàn tất. Thứ hai, nó cho phép agent lên lịch thực hiện nhiều công việc hữu ích hơn giữa các lần gọi mô hình, từ đó thúc đẩy hiệu quả chi phí tiên phong. Phiên bản hiện tại đạt mức tiết kiệm chi phí lên tới 40% so với Codex và lên tới 20% so với Pi trong các khối lượng công việc thực tế và trên các tiêu chuẩn đánh giá agent (agentic benchmarks), những kết quả mà chúng tôi chia sẻ tại đây.

Chúng tôi tin rằng thiết kế bộ khung là một lĩnh vực nghiên cứu độc lập, với nhiều ý tưởng hứa hẹn vẫn đang chờ được nghiên cứu và triển khai.

Động lực và Kiến trúc

Nếu bạn cố gắng xây dựng một sản phẩm ưu tiên agent (agent-first), bạn sẽ sớm nhận ra rằng không có con đường chuẩn mực nào để triển khai nó. Các nhà cung cấp thương hiệu lớn cung cấp các bộ SDK khác nhau để xây dựng agent, mỗi bộ đều có những sự đánh đổi riêng mà có thể không hiển hiện ngay lập tức.

Tại Unreal Labs, chúng tôi đã xây dựng một số sản phẩm agent và rút ra được vài bài học về các SDK phổ biến trong quá trình này.

Ví dụ, các SDK hướng CLI như Agent SDK của Claude mang theo những giả định về phiên làm việc cục bộ, tiến trình con và giới hạn tài nguyên vốn không dễ dàng chuyển đổi sang môi trường sản xuất. Việc xử lý hoàn tất, hủy bỏ và các tác vụ nền một cách đáng tin cậy thường đòi hỏi bạn phải tự xây dựng hệ thống quản lý vòng đời xung quanh chúng.

Việc hỗ trợ các nhà cung cấp khác làm tăng thêm công việc tương thích: chuyển đổi các chế độ API có thể làm hỏng các công cụ hoặc quá trình nén dữ liệu, trong khi việc nâng cấp SDK có thể thay đổi định dạng tin nhắn và buộc phải viết lại các phần tích hợp. Các cây phụ thuộc (dependency trees) cồng kềnh làm tăng rủi ro bảo trì và chuỗi cung ứng cho một runtime mà chúng ta vốn đã phải tự tìm hiểu và vá lỗi.

Theo kinh nghiệm của chúng tôi, các biện pháp bảo mật và phê duyệt dựa trên các hook của bộ khung và các công cụ chuyên biệt thường đòi hỏi nhiều công sức bảo trì hơn và kém mạnh mẽ hơn so với các ràng buộc môi trường tất định hoặc sandbox nằm ngoài bộ khung: như danh sách host cho phép/chặn, token truy cập chi tiết, và proxy với cổng phê duyệt.

Cùng với những động lực kỹ thuật này, chúng tôi cũng muốn xây dựng một bộ khung luôn có thể tiếp nhận các tin nhắn điều hướng từ người dùng mà không bị trễ, đồng thời xử lý các lệnh gọi công cụ không đồng nhất mà không gây thêm gánh nặng nhận thức cho mô hình. Ví dụ, chúng tôi muốn agent có thể khởi chạy quá trình thiết lập môi trường phát triển vốn có thể mất vài phút, trong khi vẫn đồng thời khám phá codebase và tìm kiếm trên web, tất cả mà không tốn thêm chi phí token.

Mỗi khi Unreal Agent thực hiện một lệnh gọi công cụ, chúng tôi ngay lập tức thêm một bản ghi nhật ký sự kiện cho biết công cụ đó đã trả về trạng thái “đang thực hiện” (in-progress), trong khi vẫn tiếp tục thực thi ở chế độ nền. Khi một công cụ thực sự hoàn tất, chúng tôi thêm kết quả vào nhật ký phiên và gọi LLM. Việc làm cho quy trình này hoạt động mà không phá vỡ bộ nhớ đệm (cache) là một thách thức kỹ thuật thú vị.

Hiệu quả chi phí

Về cơ bản, Unreal Agent đạt được kết quả tương tự với ít lượt gọi mô hình hơn và ít token đầu vào hơn.

Chúng tôi cho rằng việc tiết kiệm chi phí đến từ hai yếu tố:

Dấu chân bộ khung tối thiểu và kỹ thuật sử dụng đầu ra công cụ cẩn thận. Unreal Agent có các prompt đơn giản, kết quả công cụ được tối ưu hóa token, và không sử dụng các sub-agent hay quy trình làm việc phức tạp.

Nhiều công việc công cụ hơn trên mỗi lượt gọi mô hình. Unreal Agent có một mô hình gọi công cụ bất đồng bộ đơn giản, được giải thích rõ ràng cho LLM. Điều này cho phép nó thực hiện nhiều lệnh gọi công cụ nặng hơn trên mỗi lượt gọi mô hình mà không lãng phí token vào việc thăm dò hoặc chờ đợi chúng.

Các tiêu chuẩn đánh giá (Benchmarks)

Chúng tôi đã xây dựng Unreal Agent để phục vụ các quy trình sản xuất thực tế, nhưng nó cũng thể hiện tốt trong các bài kiểm tra đánh giá. Chúng tôi đã thử nghiệm nó với GPT-6 Astra xhigh và so sánh với Codex và Pi. Dưới đây là một số kết quả.

Có những khác biệt nhỏ về tỷ lệ thành công, mà chúng tôi cho là do sự biến thiên của các tiêu chuẩn đánh giá.

Terminal-Bench 4.0

GPT-6 Astra · xhigh. Codex (lb) là tiêu chuẩn cơ sở trên bảng xếp hạng; các lượt chạy của Unreal Agent và Pi được liên kết bên dưới.

SWE-Atlas Codebase QnA

DeepSWE 1.1

Agents’ Last Exam · ALE-CLI

Tỷ lệ thành công đầy đủ và điểm trung bình được liệt kê bên dưới. Các lượt chạy này không thực hiện trên Harbor.

Chúng tôi chủ yếu chạy các tiêu chuẩn đánh giá về lập trình vì chúng có sẵn trên Harbor, giúp việc tái lập và xác minh dễ dàng hơn, nhưng bộ khung này không phụ thuộc vào lĩnh vực cụ thể.

Bắt đầu với Unreal Agent

Unreal Agent SDK hiện cung cấp:

Hãy xem kho lưu trữ github của chúng tôi nếu bạn muốn tự mình trải nghiệm.

Tài liệu tham khảo

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.