LangChain: Blog
Điểm AI 39/100

Sản phẩm

LangSmith cập nhật lớn: Engine v2, Managed Deep Agents và tính năng tinh chỉnh mô hình

(giờ Việt Nam)

Tóm tắt AI

LangChain vừa nâng cấp LangSmith với Engine v2 hỗ trợ kiểm thử tự động, Managed Deep Agents thế hệ mới và khả năng tinh chỉnh mô hình chuyên sâu giúp tối ưu hóa quy trình phát triển AI.

Chính văn · Bản dịch AI

New in LangSmith: Engine v2, Managed Deep Agents, Fine-Tuning, and more

Tuần này, hàng trăm kỹ sư AI đã tham gia cùng chúng tôi tại Interrupt NYC để lắng nghe cách các đội ngũ đưa các tác nhân (agent) chuyên biệt theo lĩnh vực vào môi trường thực tế và khám phá những thông báo mới nhất về LangSmith.

Các bản phát hành mới nhất của chúng tôi tập trung vào hai trụ cột của vòng đời phát triển tác nhân giúp các đội ngũ xây dựng với sự kiểm soát và linh hoạt, tăng cường trí thông minh cho tác nhân của họ và đảm bảo quản trị chặt chẽ: runtime (môi trường thực thi) và khả năng quan sát + đánh giá.

Runtime cung cấp cho các tác nhân những gì họ cần để vận hành trong môi trường thực tế (như bộ nhớ, kênh, công cụ và môi trường thực thi bảo mật). Khả năng quan sát và đánh giá giúp các đội ngũ hiểu hành vi, đo lường chất lượng và cải thiện tác nhân khi chúng được sử dụng nhiều hơn.

Nằm phía trên là lớp trí tuệ, hoạt động dựa trên logic nghiệp vụ, các dấu vết (traces), đánh giá và dữ liệu thực tế để tăng tốc vòng lặp phát triển tác nhân này.

Đây là những gì chúng tôi đã ra mắt.

LangSmith Engine v2: Chủ động phát hiện các vấn đề của tác nhân và triển khai bản sửa lỗi nhanh hơn.

Cải thiện tác nhân là một quy trình gồm nhiều bước; một quy trình làm việc điển hình đòi hỏi các kỹ sư phải phát hiện vấn đề, xác định nguyên nhân gốc rễ, đề xuất bản sửa lỗi, kiểm thử, triển khai và theo dõi các lỗi hồi quy.

Chúng tôi đã xây dựng LangSmith Engine như một tác nhân ngay trong nền tảng để tự động hóa công việc ở từng bước của vòng đời phát triển tác nhân. Kể từ khi ra mắt vào tháng 5, Engine đã giúp các kỹ sư phân tích hơn 60 triệu dấu vết để chẩn đoán hàng chục nghìn vấn đề.

Engine v2 giới thiệu những tiến bộ lớn trong việc phát hiện, kiểm thử và xác thực vấn đề.

Chủ động khắc phục sự cố với Red Teaming

Các khả năng Red Teaming mới giúp phát hiện vấn đề trước khi chúng xuất hiện trong môi trường thực tế. Sử dụng các dấu vết và kho lưu trữ thực tế, Engine có thể tạo ra các giả thuyết về những vấn đề có thể chưa xuất hiện trong thực tế, kiểm thử các giả thuyết đó và đưa ra các lỗi đã được xác nhận để xem xét.

Phát hiện các vấn đề khó nhận biết

Engine hiện phát hiện được nhiều loại vấn đề hơn. Ngoài các lỗi và yêu cầu người dùng không được đáp ứng, nó có thể xác định các xu hướng hiệu suất thông qua tỷ lệ lỗi, độ trễ và chi phí, cũng như các hoạt động tác nhân kém hiệu quả như gọi công cụ lặp đi lặp lại hoặc các quỹ đạo (trajectories) dài không cần thiết.

Tự động kiểm thử các bản sửa lỗi được đề xuất

Đối với các tác nhân đang chạy trên LangSmith Deployment, Engine hiện có thể xác thực các bản sửa lỗi được đề xuất trước khi con người xem xét và triển khai. Engine v2 chạy các đầu vào gây lỗi đối với tác nhân của bạn để xác nhận vấn đề. Sau đó, nó kiểm thử các bản sửa lỗi ứng viên dựa trên một tập hợp đánh giá rộng hơn cho đến khi tìm thấy bản sửa lỗi giải quyết được vấn đề. Khi Engine có một bản sửa lỗi thỏa đáng, nó sẽ được trình bày cho người dùng cuối, nơi họ có thể mở một PR chỉ bằng một cú nhấp chuột để triển khai nhanh chóng.

Bản phát hành tiếp theo của LangSmith tự lưu trữ (self-hosted) sẽ hỗ trợ BYOK cho Engine.

Tìm hiểu thêm về Engine v2.

Managed Deep Agents v0.8: Xác thực, bộ nhớ và các kênh mới

Managed Deep Agents kết hợp bộ công cụ Deep Agents với cơ sở hạ tầng được quản lý, tạo ra cách dễ dàng nhất để chuyển từ logic nghiệp vụ sang một tác nhân trong môi trường thực tế.

Bản phát hành mới nhất của chúng tôi giải quyết bốn thách thức mà các đội ngũ gặp phải khi vận hành tác nhân trong môi trường thực tế: bộ nhớ tác nhân, xác thực, các kênh và quản lý công cụ.

Xác thực và bộ nhớ theo phạm vi định danh

Managed Deep Agents đã hỗ trợ bộ nhớ tác nhân bền vững, và chúng tôi rất vui mừng được giới thiệu bộ nhớ cấp người dùng mới để các tác nhân có thể lưu trữ ngữ cảnh theo phạm vi của từng người dùng đã xác thực. Lớp mới này cung cấp một nơi để lưu trữ ngữ cảnh cụ thể của người gọi, giúp tách biệt nó khỏi bộ nhớ cấp tác nhân dùng chung.

Runtime không sao chép nội dung giữa các lớp và các chính sách truy cập có thể được xác định ở mỗi cấp để đảm bảo thông tin cấp người dùng không bị rò rỉ vào các cuộc hội thoại.

Managed Deep Agents hiện cũng hỗ trợ cả thông tin xác thực của tác nhân và của người dùng cho các kết nối bên ngoài (như GitHub và Notion).

Các kênh mới và mở rộng

Các tác nhân hoạt động tốt nhất khi chúng vận hành ở nơi người dùng đang hiện diện. Chúng tôi đã mở rộng hỗ trợ Slack để bao gồm truyền tệp, vì vậy người dùng có thể gửi nhật ký, bảng tính, hợp đồng, ảnh chụp màn hình và các tệp khác trực tiếp cho tác nhân.

Hỗ trợ kênh HTTP mới cho phép các đội ngũ kết nối tác nhân với bất kỳ dịch vụ nào có thể gửi JSON webhook. Điều này đặc biệt hữu ích cho các tác nhân hướng tới khách hàng hoạt động trên nhiều kênh.

Tìm kiếm web tích hợp sẵn

Tìm kiếm web là một trong những công cụ tác nhân phổ biến nhất, vì vậy chúng tôi quyết định tích hợp nó trực tiếp vào Managed Deep Agents.

Managed Deep Agents 0.8 mang đến tính năng tìm kiếm web như một công cụ được xây dựng sẵn. Được hỗ trợ bởi Parallel, tính năng tìm kiếm web tích hợp sẵn giúp các tác nhân truy cập thông tin hiện tại mà không yêu cầu các đội ngũ phải thiết lập tài khoản nhà cung cấp, khóa API hoặc công cụ tùy chỉnh riêng biệt.

Tìm hiểu thêm về Managed Deep Agents v0.8.

LangSmith Trajectories: Dễ dàng điều hướng các phiên tác nhân và dữ liệu dấu vết

Các tác nhân chạy dài hạn có thể khó gỡ lỗi vì một phiên có thể bao gồm nhiều lượt, lệnh gọi công cụ, thử lại và chuyển giao tác nhân phụ. Dấu vết đầy đủ có thể trở nên dài và lồng nhau, và thường chứa nhiều thông tin hơn mức bạn cần để hiểu chuyện gì đã xảy ra.

Đó là lý do tại sao chúng tôi ra mắt LangSmith Trajectories, một chế độ xem hội thoại của phiên tác nhân. Một quỹ đạo (trajectory) tổng hợp các tin nhắn từ con người, AI và các công cụ trên toàn bộ tác nhân chính và bất kỳ tác nhân phụ nào, sau đó hiển thị chúng theo thứ tự thời gian. Kết quả là việc gỡ lỗi nhanh hơn vì các đội ngũ có thể nhanh chóng thấy được hành vi đã thay đổi hoặc bị lỗi ở đâu.

Trajectories cũng giúp các quy trình làm việc xem xét trở nên dễ dàng hơn. Việc xem xét của chuyên gia (SME) rất quan trọng đối với độ chính xác của tác nhân, nhưng thường thì những người đánh giá này không phải là người đã xây dựng tác nhân đó. Trajectories cung cấp cho họ một chế độ xem phiên dễ đọc, nơi họ có thể chấm điểm, gắn cờ và chú thích mà không cần phải phân tích siêu dữ liệu thực thi và các chi tiết khác.

Trajectories là một phần quan trọng của các vòng lặp cải tiến. Các trình đánh giá trực tuyến của LangSmith có thể chấm điểm Trajectories, cung cấp đầu vào tốt hơn để đánh giá hành vi của tác nhân trong suốt một phiên.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

LangSmithLangChainAI AgentsFine-tuningLLM Ops

Bài viết được AI dịch và tổng hợp tự động từ LangChain: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

LangSmith cập nhật lớn: Engine v2, Managed Deep Agents và tính năng tinh chỉnh mô hình | AIHOT.vn