The Decoder: AI News
85

Nghiên cứu

Google DeepMind ra mắt Dream-RSI: Giúp AI tự tối ưu chiến lược qua việc 'hồi tưởng' quá khứ

(giờ Việt Nam)

Tóm tắt AI

Dream-RSI cho phép các tác nhân AI cải thiện hiệu suất bằng cách phân tích lại lịch sử tìm kiếm cũ để thử nghiệm các chiến lược thay thế, mà không cần can thiệp vào mô hình gốc.

Bản dịch AI

Google Deepmind's Dream-RSI helps AI agents improve by “dreaming” about past attempts

Đối với các tác vụ phức tạp, không gian tìm kiếm có thể trở nên khổng lồ. Tác nhân (agent) phải liên tục quyết định phương pháp nào hứa hẹn để theo đuổi, phương pháp nào nên thử nghiệm song song và phương pháp nào nên từ bỏ. Quá trình này, được gọi là khám phá (exploration), có thể quyết định việc tìm kiếm thành công hay lãng phí tài nguyên tính toán vào những ý tưởng sai lầm.

Một nhóm nghiên cứu từ Google và Deepmind đã giới thiệu "Dream-RSI" để cải thiện các quyết định đó. Phương pháp này thay đổi cách tác nhân tìm kiếm, thay vì thay đổi mô hình AI nền tảng.

Các phương pháp hiện có thường xử lý việc khám phá theo hai cách. Một chiến lược tìm kiếm cố định không thể học hỏi từ kinh nghiệm, vì vậy tác nhân có thể lặp đi lặp lại những ngõ cụt. Việc điều chỉnh chiến lược trong quá trình tìm kiếm giúp tránh được sự cứng nhắc đó nhưng lại phải trả giá. Cần rất nhiều lần thử để biết liệu một chiến lược có hiệu quả hay không, và việc kiểm tra vô số phương án thay thế đồng nghĩa với việc lặp lại các lượt chạy dài và tốn kém.

Phát lại các tìm kiếm trong quá khứ giúp việc kiểm tra các chiến lược mới trở nên rẻ hơn

Các nhà nghiên cứu đề xuất tái sử dụng dữ liệu từ một quá trình tìm kiếm đã hoàn tất để kiểm tra các chiến lược thay thế trong không gian mà tác nhân đã khám phá. Tác nhân ghi lại các nỗ lực và kết quả của chúng khi tìm kiếm, cung cấp dữ liệu cần thiết để phát lại các quyết định đó sau này.

Các nhà nghiên cứu ví điều này với việc tìm đường qua một khu vực xa lạ. Trong lần đầu tiên, bạn gặp ngõ cụt, phải quay đầu và chật vật tìm lộ trình. Tuy nhiên, một khi đã có bản đồ trong đầu, bạn có thể lập kế hoạch cho một lộ trình khác mà không cần phải đi lại mọi ngóc ngách.

Dream-RSI áp dụng nguyên tắc đó vào các lịch sử tìm kiếm đã được ghi lại. Thay vì kiểm tra một chiến lược mới trong một lượt chạy thực tế, tác nhân chạy nó dựa trên các kết quả đã lưu trữ. Điều này cho phép nó kiểm tra xem điều gì sẽ xảy ra nếu nó theo đuổi các phương pháp khác trước đó hoặc từ bỏ một số phương pháp sớm hơn. Hệ thống không tạo ra các giải pháp hoàn toàn mới trong quá trình phát lại; nó kiểm tra các quyết định khác nhau trong cây tìm kiếm đã ghi lại.

Diagram of a recorded search tree showing two alternative strategies following colored paths, each scored for quality, cost, and latency.

Vì các kết quả đó đã tồn tại, tác nhân không cần phải tạo hoặc đánh giá lại các giải pháp, tránh được các tính toán tốn kém mà một lượt chạy thực tế yêu cầu. Điều đó giúp việc kiểm tra các chiến lược tìm kiếm mới rẻ hơn nhiều. Các nhà nghiên cứu gọi quá trình này là "dreaming" (mơ). Tác nhân chạy thử hàng ngàn biến thể và chọn ra biến thể tốt nhất trước khi đưa nó vào áp dụng trong một lượt tìm kiếm thực tế.

Quá trình này lặp lại theo vòng lặp. Sau mỗi lần tìm kiếm, tác nhân sử dụng các kết quả đã ghi lại để kiểm tra các chiến lược tốt hơn, sau đó áp dụng phiên bản cải tiến vào lượt chạy thực tế tiếp theo. Trong suốt chu kỳ này, chỉ có chiến lược tìm kiếm thay đổi; mô hình tạo ra các giải pháp vẫn được giữ nguyên.

Diagram of Dream-RSI's three-stage cycle showing live exploration, replay simulator construction, and strategy improvement through simulated searches. A close-up shows the proposal, evaluation, and fe

Dream-RSI tìm ra các giải pháp tốt hơn với ít nỗ lực hơn

Các nhà nghiên cứu đã thử nghiệm Dream-RSI với Gemini 3.1 Pro và Gemini 3.7 Flash trên tám tác vụ thuộc ba lĩnh vực. Mỗi phép so sánh đều sử dụng một đường cơ sở (baseline) với cùng điều kiện bắt đầu nhưng có chiến lược tìm kiếm cố định.

Một tác vụ yêu cầu hệ thống viết chương trình nhanh nhất có thể cho một phép tính thống kê thường được sử dụng trong lĩnh vực gen và tài chính. Chương trình của Dream-RSI chạy nhanh hơn các thư viện đã được thiết lập là sklearn và glmnet trên cả sáu tập dữ liệu thử nghiệm.

Với Gemini 3.1 Pro, thời gian chạy trung bình giảm từ 3.587 xuống 2.931 mili giây, trong khi số lần thử giảm từ 550 xuống 317. Dream-RSI cũng vượt trội hơn một hệ thống cạnh tranh có tên là SimpleTES, vốn cần tới 51.200 lượt chạy, so với 317 lần thử của Dream-RSI.

Line chart showing the best ConvDiv performance in rounds E0 through E8, above a bar chart showing 50 to 110 evaluated attempts per round.

Mô hình tương tự cũng diễn ra đối với các tác vụ tối ưu hóa toán học và nỗ lực viết các GPU kernel hiệu quả, với kết quả tương đương hoặc tốt hơn ở chi phí tính toán thấp hơn nhiều. Trên hai tác vụ GPU, Dream-RSI đạt hiệu suất tương đương trong khi giảm số lượt chạy lên tới 2,43 lần. Trên hai tác vụ khác, nó mang lại hiệu suất gấp tới 2,09 lần trong cùng một ngân sách.

Four step charts comparing Dream-RSI with Recursive Fixed Exploration on VGG16, LayerNorm, ConvDiv, and ConvMax, plotting GPU kernel performance in inverse milliseconds against the number of generatio

Các chỉ dẫn rõ ràng có thể hạn chế việc khám phá

Trong một phân tích tiếp theo, các nhà nghiên cứu đã thử nghiệm một cách khác để sử dụng lịch sử tìm kiếm. Thay vì phát lại chúng để kiểm tra các chiến lược, họ cô đọng chúng thành các chỉ dẫn cho tác nhân biết nơi cần tìm kiếm.

Trên một tác vụ GPU, phiên bản có các chỉ dẫn này hoạt động kém hơn phiên bản không có chúng. Các nhà nghiên cứu cho rằng các chỉ dẫn quá cụ thể có thể thu hẹp không gian tìm kiếm quá mức, ngăn cản tác nhân khám phá một phạm vi phương pháp rộng hơn.

Phân tích tương tự cho thấy chiến lược đã học điều chỉnh nỗ lực của nó như thế nào. Khi hiệu suất được cải thiện, ban đầu nó giảm số lần thử. Khi tiến độ bị đình trệ, nó lại tăng nỗ lực tìm kiếm, điều này trùng khớp với những bước tiến xa hơn. Các nhà nghiên cứu đã chia sẻ mã nguồn và thông tin chi tiết hơn trên GitHub.

Khả năng tự cải thiện đệ quy (Recursive self-improvement) gần đây đã thu hút sự chú ý ngày càng tăng. Những phát triển trong lĩnh vực này là một phần lý do tại sao CEO Dario Amodei của Anthropic gần đây đã cảnh báo về tốc độ nghiên cứu AI.

Google Deepmind đã giới thiệu AlphaEvolve vào năm 2025, sử dụng cùng một nguyên tắc cơ bản. Gemini Flash tạo ra các đề xuất mã, Gemini Pro phân tích chúng và một thuật toán tiến hóa chọn ra các phiên bản tốt nhất. Dream-RSI hoạt động ở một cấp độ cao hơn quá trình đó bằng cách tối ưu hóa chính chiến lược tìm kiếm.

AutoTTS áp dụng một cách tiếp cận liên quan, sử dụng một tác nhân lập trình để tìm kiếm các thuật toán trong môi trường mô phỏng. Các thuật toán này quyết định khi nào một mô hình ngôn ngữ nên bắt đầu, mở rộng hoặc từ bỏ các lộ trình suy luận. Các phương pháp thu được đã đánh bại các phương pháp thiết kế thủ công trong khi sử dụng ít tài nguyên tính toán hơn.

Google Research gần đây đã trình bày một cách khác để tái sử dụng các lượt chạy trong quá khứ với WikiSkill. Hệ thống đó ghi lại các thất bại và thành công vào một wiki và biến chúng thành các chỉ dẫn có thể tái sử dụng cho tác nhân. Phân tích tiếp theo của Dream-RSI cho thấy các chỉ dẫn rõ ràng như thế này có thể hạn chế việc khám phá trên các tác vụ tìm kiếm mở.

Meta tiến xa hơn với Hyperagents, cho phép các tác nhân viết lại cơ chế kiểm soát cách chúng tự cải thiện.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.