Sản phẩm
Prime Agent: Tác nhân AI tự cải tiến với khả năng lập trình linh hoạt
(giờ Việt Nam)
Tóm tắt AI
Prime Agent là tác nhân mã hóa tự cải tiến dựa trên mô hình ngôn ngữ đệ quy (RLM), cho phép AI tự quản lý và tối ưu hóa các kỹ năng, bộ nhớ và quy trình làm việc thông qua các lệnh gọi hàm trực tiếp.
Bản dịch AI

Prime Agent: Một tác nhân RLM tự cải tiến
Hôm nay, chúng tôi ra mắt Prime Agent, bộ khung lập trình tự cải tiến được thiết kế dựa trên hai khái niệm trừu tượng: Recursive Language Model (RLM) [trích dẫn] và Continual Harness [trích dẫn]. Các thiết kế bộ khung hiện đại được xây dựng dựa trên năng lực của các thế hệ mô hình cũ và không phản ánh được những gì các mô hình tiên phong (frontier models) có thể làm ngày nay: các lược đồ gọi công cụ cố định và việc nén ngữ cảnh buộc mô hình phải làm việc xung quanh chính cấu trúc hỗ trợ của nó thay vì tận dụng nó. Các tác nhân phụ, lời nhắc (prompt), kỹ năng và bộ nhớ tĩnh, được thiết kế thủ công, chỉ được thiết lập một lần tại thời điểm thiết kế và không bao giờ thích nghi với những gì tác nhân học được trong quá trình vận hành. Chúng tôi tin rằng thay vào đó, các bộ khung nên ngoại suy dựa trên năng lực hiện tại của mô hình để hướng tới biên giới tiếp theo của các mô hình suy luận.
Prime Agent được xây dựng dựa trên nguyên lý này thông qua hai khái niệm trừu tượng chính:
Những khái niệm trừu tượng này rất mạnh mẽ trong việc khởi tạo năng lực cho mô hình. Prime Agent được xây dựng để trở thành một trợ lý lập trình đa năng hiệu quả, một môi trường thực thi mặc định cho việc đánh giá tự hành dài hạn, và là cộng sự cho nghiên cứu cũng như tự nghiên cứu (autoresearch).
Prime Agent hoàn toàn là mã nguồn mở và có thể được cài đặt thông qua:
Prime Agent
Hiệu suất của các bộ khung tác nhân gắn liền với cả thiết kế của bộ khung và năng lực của mô hình được huấn luyện xung quanh bộ khung đó. Chúng tôi thiết kế Prime Agent để có thể sử dụng ngay lập tức với các mô hình tiên phong hiện đại (cả mã nguồn mở và đóng), đồng thời cung cấp một bộ tính năng mà chúng tôi kỳ vọng sẽ mang lại hiệu suất cao hơn nữa khi các thế hệ mô hình mới hơn được huấn luyện dựa trên nó.
Về cốt lõi, Prime Agent được thiết kế xoay quanh việc gọi công cụ và tác nhân phụ theo chương trình. Các mô hình trong Prime Agent sử dụng nhân IPython bền vững làm công cụ duy nhất của chúng. Các tính năng tiêu chuẩn khác của bộ khung được gọi dưới dạng các hàm trong nhân, bao gồm cả các tác nhân phụ, mỗi tác nhân được triển khai như một thực thể prime-agent khác.
Kiến trúc của Prime Agent
Daemon nền và Chế độ xem Tác nhân (Agents View). Chế độ xem mặc định là giao diện người dùng văn bản (TUI) tương tự như các bộ khung tác nhân lập trình khác. Theo mặc định, các hành động IPython do tác nhân thực hiện được rút gọn để ngắn gọn, nhưng có thể mở rộng để xem các hành động do bộ khung thực hiện. Các tác nhân phụ được khởi chạy trong REPL cũng có thể được truy cập bên dưới khung chat của người dùng.
Prime Agent chạy một daemon nền quản lý tất cả các phiên tác nhân trực tiếp thông qua một socket cục bộ. Bạn có thể gắn và tách khỏi phiên mà không ảnh hưởng đến vòng lặp tác nhân bên dưới. Mỗi cây phiên gốc chạy trong một tiến trình worker có thể phục hồi; nếu một worker bị treo, daemon sẽ khôi phục nó từ tệp JSONL phiên và ảnh chụp nhanh trạng thái nhân.
Chế độ xem Tác nhân cho phép bạn xem và chọn các phiên trực tiếp khác từ daemon. Nó có thể được mở bằng cách nhấn phím Mũi tên trái (←) tại một dòng nhắc trống, và liệt kê các phiên đang chạy, các phiên nhàn rỗi với daemon vẫn hoạt động, và các phiên không hoạt động hiện không được tải vào bộ nhớ. Bất kỳ cuộc trò chuyện nào trong số này đều có thể được truy cập và tương tác ngay lập tức, và việc nhấn phím cách cho phép người dùng trò chuyện với một phiên ở bất kỳ trạng thái nào, bao gồm cả việc điều hướng và xếp hàng các lời nhắc và lệnh như /compact.
Chế độ xem Tác nhân được xây dựng như điểm kết nối trung tâm giữa các tác nhân và tác nhân phụ, một cách đệ quy. Bất kỳ tác nhân nào cũng có thể được khám phá trong Chế độ xem Tác nhân. Người dùng điều hướng từ Chế độ xem Tác nhân vào cuộc trò chuyện của một tác nhân, sau đó vào Chế độ xem Tác nhân của các tác nhân phụ của nó, vào cuộc trò chuyện của tác nhân phụ, và cứ tiếp tục như vậy.
Vì các tác nhân phụ chia sẻ cùng một máy trạng thái Running-Idle-Inactive như các tác nhân gốc, chúng có thể bị xóa khỏi bộ nhớ sau 30 phút không hoạt động, và ngay khi người dùng hoặc tác nhân gọi đến bất kỳ tác nhân nào trong số đó, chúng sẽ được tải lại từ đĩa. Trong các cuộc trò chuyện lồng ghép sâu, điều này có thể tiết kiệm rất nhiều bộ nhớ.
Quản lý Phiên và Ngữ cảnh. Toàn bộ lịch sử phiên của tác nhân được lưu trữ dưới dạng các tệp JSONL chỉ ghi thêm trên đĩa. Mỗi dòng là một mục JSON, có thể bao gồm tin nhắn, chuyển đổi mô hình, tóm tắt nén hoặc các mục mở rộng. Việc phân nhánh, tách nhánh và sao chép đều diễn ra trong cùng một tệp bằng cách di chuyển con trỏ lá. Toàn bộ lịch sử luôn có thể khôi phục thông qua lệnh /tree.
Quá trình nén (Compaction) diễn ra khi ngữ cảnh đạt đến ngưỡng hoặc trực tiếp bởi tác nhân trong REPL với lệnh compact.run. Việc nén chủ yếu được sử dụng để làm sạch ngữ cảnh chính của tác nhân, nhưng toàn bộ lịch sử, bao gồm cả các lần nén trước đó, có thể được truy cập theo chương trình trong nhân IPython khi cần.
Việc giới thiệu REPL đòi hỏi thêm công việc để quản lý trạng thái IPython. Chúng tôi nén và làm sạch nhân một cách bất đồng bộ đồng thời, sử dụng một tác nhân được tạo ra để đóng vai trò như một bộ thu gom rác (garbage collector). Điều này là cần thiết để tránh việc bộ nhớ REPL tích tụ cho mỗi tác nhân.
RLM và Gọi công cụ theo chương trình (PTC)
Prime Agent dựa vào nhân IPython làm REPL bền vững trong suốt phiên, mà nó có thể gọi mỗi lượt. Khi khởi tạo, nhân sẽ nhập trước (pre-import) từng kỹ năng/công cụ dưới dạng một mô-đun, bao gồm cả rlm để gọi tác nhân phụ theo chương trình một cách đệ quy.
rlm là một hàm bất đồng bộ, nghĩa là mô hình có thể tự do gọi và chạy song song các lệnh gọi tác nhân phụ trong mã. Việc tạo một tác nhân phụ (ví dụ: await rlm("sub-task")) sẽ khởi chạy một phiên đầy đủ với mô hình, nhân IPython, cây phiên và lịch sử hội thoại riêng của nó. Nó trả về ngay lập tức, vì mọi giao tiếp tiếp theo giữa các tác nhân đều diễn ra thông qua công cụ agent_message.send(...).
Có một số nguyên hàm hữu ích mà Prime Agent có thể chọn để khởi chạy theo cách này, chẳng hạn như phân tán các tác nhân phụ song song hoặc khởi chạy công việc nền.
Khi các mô hình tiếp tục cải thiện, các mô hình gọi lệnh mới thông qua các lệnh gọi công cụ và tác nhân phụ sẽ xuất hiện. Chúng tôi kỳ vọng các thế hệ mô hình tương lai sẽ ít dựa vào các lời nhắc cầm tay hơn và dựa nhiều hơn vào kiểu kiểm soát trực tiếp, theo chương trình này.
Điều phối và Giao tiếp Đa tác nhân
Daemon nền quản lý tất cả các phiên Prime Agent đang hoạt động. Prime Agent cũng cho phép nhắn tin Tác nhân-đến-Tác nhân (A2A) thông qua daemon, cho phép bất kỳ phiên Prime Agent nào nhắn tin cho bất kỳ phiên Prime Agent nào khác bằng cách sử dụng cùng cơ chế được dùng để nhắn tin cho các tác nhân phụ bền vững. Điều này cho phép điều phối dễ dàng để quản lý tiến độ của các bầy tác nhân phụ và giao tiếp liên quan đến tài nguyên chia sẻ trực tiếp giữa các tác nhân bị ảnh hưởng. Để ngăn chặn giao tiếp không mong muốn giữa các phiên độc lập, giao tiếp đa tác nhân trong Prime Agent bị giới hạn trong phạm vi gia đình hạt nhân của nó, nghĩa là các tiến trình cha, anh em hoặc con.
Prime Agent hỗ trợ các tác nhân phụ bền vững thông qua môi trường thực thi RLM-native, nghĩa là thư mục phiên, ngữ cảnh, nhân IPython và lịch sử phiên của tác nhân phụ vẫn tồn tại ngay cả sau khi lệnh gọi tác nhân phụ ban đầu đã kết thúc. Prime Agent có thể gửi thêm tin nhắn để tiếp tục một tác nhân phụ bền vững bằng cách truy cập định danh phiên duy nhất của nó, tất cả đều từ nhân IPython của nó.
Tự cải tiến thông qua Continual Harness
Trạng thái bộ khung của Prime Agent nằm trong nhân IPython bền vững dưới dạng rlm.harness, có thể đọc và gọi ngay lập tức bởi tác nhân giữa chừng tác vụ, và mọi thay đổi cũng được ghi vào đĩa, vì vậy nó tồn tại qua các lượt và các phiên. Continual Harness chính thức hóa trạng thái này thành H=(ρ,G,K,M), bao gồm lời nhắc, tác nhân phụ, kỹ năng và bộ nhớ, được tinh chỉnh trực tuyến từ quỹ đạo của chính tác nhân mà không cần đặt lại.
Mỗi thành phần trong bốn thành phần này đều cung cấp cùng một bề mặt tạo, đọc, cập nhật, xóa (CRUD). create_prompt_note(...), create_memory(...), create_skill(...) và create_subagent(...) mỗi lệnh thêm một mục thuộc loại đó, update_X(...) và delete_X(...) phản chiếu chúng, và list(kind) hoặc get(kind, id) đọc chúng trở lại. Các kỹ năng tuân theo bề mặt này: việc tạo một kỹ năng dựa trên Python là một lệnh gọi create_skill(...) mang theo tham chiếu kiểu SKILL.md, cùng một thao tác với việc thêm một bộ nhớ hoặc một ghi chú lời nhắc.
/refine là quy trình tự cải tiến được xây dựng trên bề mặt CRUD này. Nó đọc quỹ đạo của chính tác nhân, bản ghi về những gì đã được thử và những gì đã xảy ra, và áp dụng chỉnh sửa CRUD liên quan nhỏ nhất giúp cải thiện bộ khung hướng tới kết quả tốt hơn: cập nhật ghi chú lời nhắc, bộ nhớ, kỹ năng hoặc đặc tả tác nhân phụ, thay vì viết lại toàn bộ bộ khung. Mỗi lần tinh chỉnh đều ghi lại tác nhân kích hoạt và kết quả mà nó tạo ra, vì vậy sự cải thiện được hỗ trợ bằng bằng chứng thay vì tùy tiện. Tinh chỉnh chạy trong hai giai đoạn. Lập kế hoạch, lệnh gọi LLM đề xuất chỉnh sửa, chạy trong nền và không chặn cuộc trò chuyện đang diễn ra. Áp dụng chỉnh sửa, ghi vào đĩa và xây dựng lại lời nhắc hệ thống, diễn ra nhanh chóng và chỉ chặn trong thời gian ngắn tại ranh giới lượt tiếp theo. Tác nhân có thể gọi refine.run trực tiếp bất cứ khi nào nó nhận thấy lỗi lặp lại hoặc một chiến thuật có thể tái sử dụng, không chỉ theo lịch trình cố định.
Lời nhắc hệ thống cơ sở vẫn không thay đổi. /refine chỉ chỉnh sửa lớp bộ khung xung quanh nó. Việc khôi phục (rollback) được hỗ trợ thông qua lịch sử tinh chỉnh trước đó, cho phép hoàn tác một bản cập nhật bộ khung lỗi theo ID.
Chế độ Tự hành cho Đánh giá (Evals)
Chế độ đánh giá của Prime Agent kết hợp ba cơ chế bổ sung. Một mục tiêu (goal) thiết lập mục tiêu tổng thể: một mục tiêu bền vững với ngân sách token tùy chọn mà bộ khung liên tục nhắc nhở tác nhân theo đuổi qua các lượt, được theo dõi cho đến khi tác nhân gọi rõ ràng goal.complete. Heartbeats là các tin nhắn được lên lịch theo kiểu cron được đưa vào phiên theo khoảng thời gian cố định, được sử dụng để kiểm tra thường xuyên như giám sát tiến độ của tác nhân phụ hoặc thăm dò cập nhật huấn luyện. Chế độ tự hành là chính cơ chế tiếp tục, đảm bảo tác nhân tiếp tục làm việc hướng tới mục tiêu thay vì dừng lại sớm khi một lượt không tạo ra kết quả nào nữa. Cùng với nhau, những điều này cho phép một phiên chạy không cần giám sát trong thời gian dài trong khi vẫn bị giới hạn bởi ngân sách rõ ràng và có thể kiểm tra thông qua Chế độ xem Tác nhân.
Chế độ tự hành có sẵn trực tiếp từ CLI với --autonomous, không cần viết kịch bản. Một lần chạy có thể đặt mục tiêu hoàn thành và giới hạn lượt trong cùng một lệnh:
Lệnh gate chạy trước khi phiên được phép kết thúc. Một gate thất bại sẽ trả về kết quả bị giới hạn của nó cho tác nhân để thử lại, và Prime Agent bỏ qua việc chạy lại một gate thất bại khi không gian làm việc không thay đổi kể từ lần thử cuối cùng. --autonomous-max-turns, --autonomous-max-tokens và --autonomous-timeout-ms giới hạn các lần tiếp tục, token và thời gian thực tương ứng.
Đánh giá Prime Agent
Prime Agent đóng vai trò vừa là một tác nhân lập trình để sử dụng, vừa là một thiết kế bộ khung để đánh giá cho nghiên cứu. Chúng tôi đặc biệt lưu ý rằng trong khi nhiều mô hình tiên phong hiện đại được huấn luyện xung quanh một bộ khung cụ thể, hiện tại chưa có mô hình nào được huấn luyện xung quanh Prime Agent hoặc bộ tính năng cốt lõi của nó.
ARC-AGI 3. ARC-AGI 3 là một tiêu chuẩn trí tuệ phổ biến đo lường khả năng của một tác nhân trong việc thực hiện suy luận biểu tượng và học các quy tắc của các thế giới mô phỏng. Chúng tôi đánh giá Prime Agent với chế độ tự hành trên một số mô hình tiên phong khác nhau và so sánh với các bộ khung gốc của chúng. Prime Agent được phát triển như một tác nhân lập trình CLI, vì vậy những thay đổi cụ thể duy nhất cho ARC AGI 3 là đối với lời nhắc tác vụ, lấy cảm hứng từ thiết lập lời nhắc tiêu chuẩn được sử dụng trong PRO-LONG.
Kết quả tốt nhất của chúng tôi sử dụng Opus 5 trong Prime Agent để đạt 95.5% RHAE Best@1, vượt qua mức cơ sở chuyên gia con người được báo cáo của ARC là 95.4%. Qua ba lần chạy, chúng tôi thấy rằng Prime Agent hoạt động ổn định [95.0, 95.2, 95.5] và 99.97% Best@3 với tất cả 183/183 cấp độ hoàn thành. Bản phát lại hành động thẻ điểm trung bình của chúng tôi (95.2%) cho ARC-AGI-3 có thể được tìm thấy tại đây.
Ngoài việc đạt được điểm số tối đa cao hơn so với bộ khung gốc của mỗi mô hình, chúng tôi nhận thấy rằng Prime Agent cũng thực hiện điều đó với mức sử dụng token tổng thể thấp hơn. Prime Agent tiết kiệm token bằng cách chạy các hàm theo chương trình trên dữ liệu thay vì tiêu tốn token để đọc dữ liệu bằng các công cụ.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.