LangChain: Blog
85

Sản phẩm

LangChain ra mắt Deep Agents v0.7: Cắt giảm 65% lượng token đầu vào cơ bản

(giờ Việt Nam)

Tóm tắt AI

LangChain vừa phát hành phiên bản Deep Agents v0.7, tối ưu hóa khung cơ sở giúp giảm 65% lượng token đầu vào mà vẫn duy trì hiệu suất vượt trội.

Bản dịch AI

Deep Agents v0.7

Hôm nay chúng tôi chính thức phát hành deep agents v0.7. Bản cập nhật này giúp đơn giản hóa bộ khung (harness) cơ sở, giảm 65% số lượng token đầu vào cơ sở trong khi vẫn duy trì hiệu suất tương đương.

Việc xây dựng các tác nhân (agents) hiệu quả phụ thuộc vào kỹ thuật ngữ cảnh (context engineering): một mô hình chỉ mạnh mẽ tương ứng với ngữ cảnh mà bạn cung cấp, và ngữ cảnh đó phụ thuộc vào những gì có trong prompt. Việc lắp ghép prompt đó một cách tối ưu chính là nhiệm vụ của bộ khung. Tuy nhiên, các hướng dẫn về cách thực hiện việc này thay đổi liên tục: OpenAI, Anthropic và Google đều công bố các hướng dẫn tạo prompt riêng của họ, và cả ba đều đã viết lại chúng khi các mô hình trở nên mạnh mẽ hơn. Các bộ khung cần phải bắt kịp tốc độ này, nếu không chúng sẽ vô tình mang theo những đoạn prompt mà mô hình đã không còn cần đến nữa.

Anthropic vừa công bố một hướng dẫn cập nhật về kỹ thuật ngữ cảnh cho các mô hình hiện đại, cùng với một báo cáo cho thấy họ đã cắt giảm hơn 80% prompt hệ thống của Claude Code cho các mô hình như Opus 5 và Fable 5 mà không làm giảm hiệu suất đánh giá lập trình. Một vài phát hiện của họ phản ánh đúng những gì chúng tôi đã thấy khi xây dựng phiên bản v0.7:

Deep Agents v0.7 cung cấp một bộ khung cơ sở tinh gọn và dễ cấu hình hơn, giúp tiết kiệm token và chi phí hiệu quả hơn.

Bộ khung cơ sở tinh gọn hơn

Giả thuyết của chúng tôi: việc cắt giảm các token không cần thiết từ prompt đầu vào cơ sở sẽ giúp tăng hiệu quả về token và chi phí trong khi vẫn giữ nguyên hiệu suất. Chúng tôi đã thực hiện ba thay đổi để kiểm chứng điều này:

Tổng hợp lại, những thay đổi này giúp giảm 65% số lượng token đầu vào cơ sở* trong một lượt tương tác mặc định của tác nhân (từ khoảng 6k xuống còn khoảng 2k).

*token đầu vào cơ sở: các token liên quan đến prompt tích hợp sẵn, công cụ (tools) và middleware.

Cách chúng tôi xác thực các thay đổi này

Chúng tôi đã xác thực rằng hiệu suất không bị giảm bằng cách sử dụng một bộ đánh giá (eval suite) mới được xây dựng dựa trên ba danh mục tiêu chuẩn. Mỗi danh mục nhắm vào một loại công việc khác nhau của tác nhân:

Chúng tôi đã chạy bộ khung v0.7 mới so với phiên bản cơ sở cũ (v0.6.12) thông qua ma trận của cả ba danh mục đánh giá trên bốn mô hình: gpt-5.6-luna, gemini-3.6-flash, claude-sonnet-4-6 và claude-opus-4-8.

Nhìn chung, điểm thưởng (reward) vẫn ổn định, còn số lượng token/chi phí nhìn chung đều giảm*. Đáng chú ý nhất là gpt-5.6-luna giảm 34% về token và 15% về chi phí với điểm thưởng tăng 4%. claude-sonnet-4-6 là trường hợp ngoại lệ; việc phân tích các dấu vết (traces) từ LangSmith cho thấy chi phí tăng đáng kể chủ yếu là do hai tác vụ tự hành đầy thách thức.

*Khoảng tin cậy của điểm thưởng bao trùm giá trị 0 cho mọi mô hình. Luna và Opus cho thấy mức giảm token rõ rệt về mặt thống kê, và Luna cũng cho thấy mức giảm chi phí rõ rệt về mặt thống kê. Báo cáo đầy đủ của chúng tôi có thể được tìm thấy tại đây.

Để biết thêm thông tin, hãy xem blog gần đây của chúng tôi về cách chúng tôi chạy các đánh giá cho Deep Agents.

Một lưu ý về danh sách việc cần làm (todo lists)

TodoListMiddleware hiện đã chuyển sang chế độ tùy chọn (opt-in). Các đánh giá của chúng tôi trên ba danh mục và ba mô hình cho thấy điểm thưởng tốt hơn một chút và chi phí thấp hơn khi tắt tính năng todo, vì vậy chúng tôi đã loại bỏ công cụ write_todos khỏi bộ khung cơ sở. Các thay đổi và kết quả thử nghiệm đầy đủ có thể được tìm thấy tại đây.

Mặc dù vậy, nó vẫn hữu ích trong một vài trường hợp:

Nếu trường hợp sử dụng của bạn nằm trong ba trường hợp trên, việc bật lại nó chỉ cần một dòng lệnh: middleware=[TodoListMiddleware].

Khả năng cấu hình cao hơn

Khả năng cấu hình là yêu cầu hàng đầu từ người dùng Deep Agents trong sáu tháng qua, bao gồm các yêu cầu ghi đè FilesystemMiddleware, tùy chỉnh ngưỡng SummarizationMiddleware và ghi đè prompt cơ sở trên toàn hệ thống. Tất cả đều gặp cùng một rào cản: không có cách nào được hỗ trợ để thay đổi những gì mà ngăn xếp bộ khung mặc định thực hiện. Phiên bản v0.7 giải quyết vấn đề đó theo hai cách.

Kiểm soát hoàn toàn prompt của bạn. Việc loại bỏ các prompt ẩn có một tác dụng phụ: các prompt tùy chỉnh của riêng bạn trở nên hiệu quả hơn, vì không còn các prompt ngầm định có thể gây ra tình trạng cồng kềnh hoặc tệ hơn là gây xung đột.

Kiểm soát hoàn toàn ngăn xếp middleware. v0.7 biến việc ghi đè middleware tích hợp sẵn thành một tính năng chính: chỉ cần truyền một instance middleware có thuộc tính.name khớp với mặc định, nó sẽ thay thế mặc định đó tại chỗ thay vì báo lỗi trùng lặp. (#4251)

Như một người dùng chuyên nghiệp đã chia sẻ:

"Chúng tôi [từng phải] thực hiện vài thủ thuật để loại bỏ một số middleware mặc định. Việc ghi đè middleware là một sự bổ sung rất đáng hoan nghênh."

SummarizationMiddleware là một ví dụ điển hình. Theo mặc định, nó sẽ kích hoạt khi cuộc hội thoại vượt quá 85% cửa sổ ngữ cảnh, sử dụng một prompt tóm tắt chung. Các ứng dụng khác nhau đòi hỏi các prompt khác nhau, và các nhà phát triển cũng muốn kích hoạt tóm tắt ở các ngưỡng khác nhau để tránh tình trạng suy giảm ngữ cảnh và "vùng mù" (dumb zone). Giờ đây, bạn có thể chèn một middleware tóm tắt với các cài đặt của riêng mình:

Mô hình tương tự cũng hoạt động cho bất kỳ mặc định tích hợp sẵn nào khác mà bạn muốn tinh chỉnh, chẳng hạn như TTL của bộ nhớ đệm prompt (prompt-caching TTLs).

Hiệu suất hệ thống tệp (Filesystem)

Hệ thống tệp là lớp quản lý ngữ cảnh cốt lõi của Deep Agents: môi trường mà các tác nhân đọc, ghi và điều hướng trạng thái thông qua đó. Bản phát hành này thực hiện một số tối ưu hóa dựa trên cùng bộ đánh giá cộng với các tối ưu hóa quỹ đạo được xác định từ việc sử dụng dcode thực tế, với cả các mô hình mở và đóng.

write_file giờ đây sẽ ghi đè lên tệp hiện có thay vì báo lỗi (#4109), read_file có phân trang báo cáo tổng số dòng và số dòng còn lại cộng với phần bù tiếp theo (#4540), và grep/glob trả về kết quả một phần với cờ bị cắt bớt thay vì bị treo trên các cây thư mục lớn, với grep cũng được bổ sung giới hạn 1.000 kết quả khớp, xuất dữ liệu theo luồng và các dòng ngữ cảnh tùy chọn (#4063, #4570, #4706).

Các thay đổi phá vỡ (Breaking changes)

Bản phát hành này loại bỏ một số lớp tương thích (shims) và thay đổi một vài hành vi mặc định:

Thông tin chi tiết đầy đủ, bao gồm các lưu ý về di chuyển và prompt "nâng cấp" cho các tác nhân lập trình, đều có trong nhật ký thay đổi (changelog).

Hãy dùng thử

deepagents v0.7 hiện đã có trên PyPI:

và trên npm:

Hãy dùng thử phiên bản deepagents mới nhất và cho chúng tôi biết suy nghĩ của bạn thông qua các vấn đề trên GitHub, diễn đàn hoặc trên X / LinkedIn.

Tài liệu tham khảo

LangChainDeep AgentsTối ưu hóa AILLMPhát triển phần mềm
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.