Microsoft Research
85

Nghiên cứu

EvoLib: Biến trải nghiệm thành tri thức tiến hóa cho mô hình AI

(giờ Việt Nam)

Tóm tắt AI

EvoLib giúp các mô hình ngôn ngữ lớn không chỉ ghi nhớ mà còn đúc kết thành kỹ năng và hiểu biết có thể tái sử dụng, giúp AI tự thích nghi hiệu quả hơn sau khi triển khai.

Bản dịch AI

EvoLib: Turning experience into evolving knowledgeFigure 1. EvoLib transforms raw experiences into reusable skills and insights, then continually evolves them through consolidation and dynamic weighting.

Sơ lược

Bộ nhớ đã trở thành một năng lực quan trọng của các AI agent: khả năng lưu trữ và truy xuất những trải nghiệm trong quá khứ. Tuy nhiên, bộ nhớ đơn thuần không phải là học tập. Một tập hợp các cuộc hội thoại, dấu vết suy luận hoặc lịch sử hành động trong quá khứ có thể nhanh chóng phát triển thành một kho lưu trữ trải nghiệm khổng lồ, gây khó khăn cho việc xác định kiến thức phù hợp nhất cho một nhiệm vụ mới—chưa nói đến việc tinh chỉnh và phát triển kiến thức này để cải thiện hiệu suất theo thời gian.

Con người học tập theo cách khác. Chúng ta không ghi nhớ mọi chi tiết về những trải nghiệm trong quá khứ. Thay vào đó, chúng ta ghi nhớ những gì quan trọng: các chiến lược hiệu quả, những sai lầm cần tránh và các kỹ năng có thể áp dụng linh hoạt qua nhiều tình huống. Theo thời gian, những bài học này được tinh chỉnh thành kiến thức ngày càng tổng quát và có khả năng tái sử dụng. Khả năng chuyển hóa trải nghiệm thành kiến thức có thể chuyển đổi và không ngừng phát triển này là một trong những nền tảng của việc học tập ở con người.

Trong bài báo gần đây của chúng tôi, "Test-Time Learning with an Evolving Library" (Học tập tại thời điểm kiểm thử với thư viện tiến hóa), chúng tôi khám phá cách các hệ thống AI có thể học hỏi từ trải nghiệm theo cách tương tự. Chúng tôi giới thiệu EvoLib, một khung làm việc giúp chuyển hóa trải nghiệm thô thành một thư viện kiến thức không ngừng tiến hóa. Thay vì coi bộ nhớ là một kho lưu trữ trải nghiệm quá khứ ngày càng lớn dần, EvoLib trích xuất kiến thức có thể tái sử dụng từ những trải nghiệm đó và liên tục tinh chỉnh chúng khi có trải nghiệm mới. Thông qua quá trình tiến hóa của thư viện, các kỹ năng trở nên tổng quát hơn, những hiểu biết trở nên chính xác hơn và hiệu suất xử lý các tác vụ hạ nguồn được cải thiện nhất quán theo thời gian. Bằng cách này, các AI agent có thể liên tục học hỏi từ việc tích lũy trải nghiệm mà không cần cập nhật mô hình nền tảng.

Cách thức hoạt động của EvoLib

Chuỗi video

On Second Thought with Sinead Bovell

Suy ngẫm thêm

Một chuỗi video cùng Sinead Bovell xoay quanh những câu hỏi mà mọi người đang đặt ra về AI. Với sự tham gia của các chuyên gia từ khắp Microsoft, chúng tôi phân tích những căng thẳng và tiềm năng của công nghệ đang thay đổi nhanh chóng này, đồng thời khám phá những gì đang tiến hóa và những gì có thể thực hiện được.

Không giống như các hệ thống bộ nhớ AI truyền thống lưu trữ trải nghiệm thô dưới dạng thông tin tĩnh, EvoLib được xây dựng dựa trên ý tưởng về kiến thức tiến hóa. Trong EvoLib, một đơn vị kiến thức có thể là một kỹ năng có thể tái sử dụng được chắt lọc từ một giải pháp thành công hoặc một hiểu biết sâu sắc rút ra từ những sai lầm. Thay vì chỉ đơn thuần tích lũy thêm bộ nhớ theo thời gian, EvoLib liên tục tinh chỉnh, củng cố và điều chỉnh trọng số của kiến thức hiện có khi có trải nghiệm mới. Cụ thể, chúng tôi thiết kế các cơ chế sau đây xoay quanh sự tiến hóa của kiến thức:

EvoLib transforms raw experiences into reusable skills and insights, then continually evolves them through consolidation and dynamic weighting.

Kết quả chính

Để đánh giá EvoLib, chúng tôi đã thử nghiệm nó trên một tập hợp đa dạng các nhiệm vụ đầy thách thức với các loại trải nghiệm và yêu cầu học tập khác nhau:

Trên các nhiệm vụ này, EvoLib liên tục vượt trội hơn các phương pháp bộ nhớ dựa trên truy xuất hàng đầu và các cơ chế bộ nhớ trừu tượng khác với mức sử dụng token hiệu quả hơn.

Chúng tôi cũng đánh giá mức độ hiệu quả của EvoLib trong việc chuyển đổi tài nguyên tính toán tại thời điểm kiểm thử (test-time compute) thành sự gia tăng hiệu suất thông qua kiến thức không ngừng tiến hóa. Hình 2 so sánh EvoLib với cả các phương pháp mở rộng tính toán thực hiện từng nhiệm vụ một cách riêng biệt và các phương pháp học tập dựa trên bộ nhớ mạnh mẽ. Mỗi đường cong cho thấy hiệu suất cải thiện như thế nào khi lượng tài nguyên tính toán tại thời điểm kiểm thử tăng lên.

Trên cả ba tiêu chuẩn đánh giá, EvoLib đạt được hiệu suất cao hơn trong hầu hết phạm vi tính toán và cải thiện hiệu suất nhanh hơn khi tài nguyên tính toán tăng lên.

Những kết quả này cho thấy chìa khóa để học tập tốt hơn có thể không chỉ đơn thuần là lưu trữ nhiều bộ nhớ hơn hoặc tiêu tốn nhiều tài nguyên tính toán hơn. Thay vào đó, những lợi ích lớn nhất đến từ việc chuyển hóa trải nghiệm thành kiến thức có thể tái sử dụng, vốn có thể được liên tục tinh chỉnh và áp dụng trên nhiều nhiệm vụ khác nhau.

Across all tasks, EvoLib converts test-time compute into performance gains more efficiently than existing methods.

Độ bền vững với thứ tự nhiệm vụ ngẫu nhiên

Một câu hỏi tự nhiên là liệu việc học tập như vậy có phụ thuộc nhiều vào thứ tự các nhiệm vụ gặp phải hay không. Trong thế giới thực, một hệ thống AI có thể đối mặt với nhiều loại nhiệm vụ khác nhau theo thứ tự tùy ý, và một khung học tập hữu ích cần phải bền vững trước sự ngẫu nhiên của thứ tự nhiệm vụ. Để đánh giá điều này, chúng tôi đã đo lường hiệu suất trên cùng một tập hợp các nhiệm vụ không đồng nhất nhưng với các thứ tự khác nhau. Chúng tôi nhận thấy rằng EvoLib liên tục cải thiện so với các phương pháp học tập dựa trên bộ nhớ hiện có và duy trì hiệu suất ổn định qua các thứ tự khác nhau. Điều này cho thấy EvoLib có thể liên tục học hỏi từ các nhiệm vụ đa dạng ngay cả khi chúng được đan xen, cho thấy lợi thế thực tiễn của nó trong các kịch bản thực tế, nơi một agent phải xử lý và học hỏi từ luồng yêu cầu hỗn hợp của người dùng mà không cần dựa vào một chương trình giảng dạy có cấu trúc.

Khi các hệ thống AI đảm nhận các nhiệm vụ dài hơi và phức tạp hơn, việc học hỏi từ trải nghiệm sẽ ngày càng trở nên quan trọng. Tương lai của AI có thể không chỉ phụ thuộc vào các mô hình lớn hơn và nhiều tài nguyên tính toán hơn, mà còn vào các cơ chế cho phép hệ thống liên tục tích lũy, tinh chỉnh và tái sử dụng kiến thức.

EvoLib là một bước tiến tới tầm nhìn đó. Bằng cách chuyển hóa trải nghiệm thành kiến thức tiến hóa, nó cho phép các hệ thống AI liên tục cải thiện và thích nghi sau khi triển khai. Thay vì liên tục bắt đầu lại từ đầu, các hệ thống AI trong tương lai có thể xây dựng dựa trên một thư viện các kỹ năng và hiểu biết có thể tái sử dụng không ngừng phát triển, giống như cách con người vẫn làm.

Mã nguồn và kết quả thử nghiệm có sẵn trên GitHub (mở trong tab mới) để hỗ trợ nghiên cứu trong tương lai về bộ nhớ và sự tiến hóa kiến thức trong các hệ thống AI.

AIMicrosoftHọc máyLLMNghiên cứu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Microsoft Research. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.