Apple Machine Learning Research
92

Tin ngành

Apple giới thiệu kiến trúc bộ nhớ bền vững chọn lọc cho hệ thống AI Agent

(giờ Việt Nam)

Tóm tắt AI

Apple phát triển kiến trúc bộ nhớ mới giúp AI Agent tối ưu hóa ngữ cảnh, tăng tỷ lệ hoàn thành nhiệm vụ lên 96% đồng thời giảm 14 lần thời gian xử lý và 97 lần chi phí token so với phương pháp truyền thống.

Bản dịch AI

Shared Selective Persistent Memory for Agentic LLM Systems

Tác giả: Sanjana Pedada, Aditya Dhavala, Neelraj Patil

Các hệ thống Agentic LLM tạo mã thông qua việc sử dụng công cụ qua nhiều lượt hội thoại đang đối mặt với một vấn đề cốt lõi về ngữ cảnh: mỗi phiên làm việc đều bắt đầu từ con số không, loại bỏ các lựa chọn cấu hình, ràng buộc miền, lược đồ dữ liệu và các mô hình sử dụng công cụ đã giúp các phiên trước đó đạt hiệu quả. Việc lưu giữ toàn bộ lịch sử hội thoại một cách đơn thuần vừa gây lãng phí token vừa phản tác dụng—ngữ cảnh không liên quan sẽ làm giảm chất lượng tạo mã. Chúng tôi giới thiệu bộ nhớ bền vững chọn lọc chia sẻ (shared selective persistent memory), một kiến trúc bộ nhớ cho các hệ thống agentic giúp xác định và lưu giữ bốn loại ngữ cảnh có thể tái sử dụng—thông số kỹ thuật tác vụ, lược đồ dữ liệu, cấu hình công cụ và ràng buộc đầu ra—trong khi loại bỏ các dấu vết suy luận đặc thù của từng phiên. Quan trọng hơn, bộ nhớ này được chia sẻ: các không gian làm việc đóng gói bộ nhớ chọn lọc có thể được chuyển giao giữa những người dùng với quyền kiểm soát truy cập dựa trên vai trò, cho phép tái sử dụng ngữ cảnh tích lũy một cách cộng tác mà không cần phải chỉ định lại dư thừa. Chúng tôi triển khai kiến trúc này trên một nền tảng không gian làm việc cộng tác đã được đưa vào sử dụng, nơi các LLM agent tạo, chỉnh sửa và duy trì các artifact được quản lý bằng git—bao gồm bảng điều khiển tương tác, báo cáo có cấu trúc và tài liệu dựa trên dữ liệu—từ các nguồn dữ liệu không đồng nhất được truy cập thông qua nhiều loại kết nối (tải lên CSV, SQL, REST APIs và MCP servers). Việc quản lý phiên bản dựa trên Git với tính năng cô lập bản nháp cho phép người dùng khám phá các sửa đổi mà không gặp rủi ro và khôi phục về bất kỳ trạng thái nào trước đó mà không cần gọi lại mô hình. Một cơ chế làm mới dữ liệu zero-token bổ sung giúp tách biệt các chương trình đã tạo khỏi dữ liệu thời gian chạy, cho phép tái sử dụng artifact mà không cần gọi lại. Qua ba kịch bản triển khai tại doanh nghiệp, bộ nhớ bền vững chọn lọc chia sẻ đạt tỷ lệ hoàn thành tác vụ 96% (so với 79% khi không có bộ nhớ và 71% khi sử dụng toàn bộ lịch sử). Cơ chế làm mới dữ liệu zero-token bổ sung giúp loại bỏ hoàn toàn việc gọi lại LLM cho các cập nhật dữ liệu định kỳ (giảm 14 lần thời gian thực hiện tác vụ), trong khi việc tạo mã dựa trên tóm tắt giúp giảm chi phí token mỗi lần gọi tới 97 lần so với việc nạp dữ liệu thô. Việc tái lập trên bốn tập dữ liệu công khai xác nhận khả năng tổng quát hóa, với cơ chế làm mới zero-token thành công trong 12/12 thử nghiệm. Đáng chú ý, việc lưu giữ toàn bộ lịch sử một cách đơn thuần thực sự làm giảm tỷ lệ hoàn thành tác vụ do làm chệch hướng agent bằng các dấu vết suy luận cũ, trong khi bộ nhớ chọn lọc vượt trội hơn cả hai thái cực trên.

Các bài đọc và cập nhật liên quan.

Việc đánh giá các AI agent sử dụng công cụ bên ngoài đòi hỏi các kịch bản kiểm thử thực tế, nắm bắt được cách người dùng kết hợp các công cụ và lặp lại qua các lượt hội thoại. Việc xây dựng các kịch bản như vậy theo cách thủ công đòi hỏi chuyên môn sâu về lĩnh vực, không thể mở rộng trên các hệ sinh thái công cụ và tạo ra các tiêu chuẩn tĩnh không thể theo kịp các API đang phát triển. Chúng tôi nhận thấy rằng các thông số kỹ thuật của công cụ—tên hàm, mô tả bằng ngôn ngữ tự nhiên và các tham số được định kiểu…

Đọc thêm

Việc ngăn chặn kích hoạt thiết bị ngoài ý muốn do giọng nói nghe giống từ khóa đánh thức (wake-word) hoặc do vô tình nhấn nút là rất quan trọng để có trải nghiệm người dùng tốt, và điều này được gọi là Giảm thiểu kích hoạt sai (False-Trigger-Mitigation - FTM). Trong trường hợp có nhiều tùy chọn kích hoạt, cách tiếp cận truyền thống đối với FTM là sử dụng các mô hình dành riêng cho từng loại kích hoạt, hoặc một mô hình duy nhất cho tất cả các kích hoạt. Cả hai cách tiếp cận đều không tối ưu: chi phí bộ nhớ cho cách tiếp cận đầu tiên tăng lên…

Đọc thêm

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Apple Machine Learning Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.