# LangChain ra mắt tính năng LangSmith Fine-Tuning và công cụ CLI SmithTune

- Nguồn: LangChain: Blog
- Thời gian phát hành: 2026-09-24 21:03 (giờ Việt Nam)
- Điểm AI: 48/100
- Link AIHOT.vn: https://aihot.vn/items/17d17b41182e1cb0
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmufm9c10051aro8wa9ahsrby
- Link gốc: https://www.langchain.com/blog/langsmith-fine-tuning

## Tóm tắt AI

LangChain vừa giới thiệu LangSmith Fine-Tuning cùng công cụ CLI SmithTune, giúp đơn giản hóa quy trình hậu huấn luyện mô hình mà không cần xây dựng đường ống dữ liệu thủ công.

## Thân bài

![Introducing LangSmith Fine-Tuning](https://cdn.prod.website-files.com/65c81e88c254bb0f97633a71/6ab45a5758db5bed65dc7113_LangSmith%20Fine%20Tuning.png)

Hôm nay chúng tôi ra mắt LangSmith Fine-Tuning và smithtune, một CLI giúp các đội ngũ chuyển đổi các quỹ đạo (trajectories) từ LangSmith thành các mô hình tinh chỉnh (fine-tuned) tùy chỉnh cho tác nhân (agent) của họ. Công cụ này xử lý toàn bộ quy trình tinh chỉnh từ một CLI duy nhất: tạo và chuẩn bị tập dữ liệu từ các quỹ đạo LangSmith, huấn luyện với Fireworks hoặc Baseten, và đánh giá với LangSmith. Bạn có thể chạy smithtune trực tiếp hoặc làm việc với coding agent của mình để thực thi các lệnh và kiểm tra kết quả.

smithtune được xây dựng cho các mô hình hậu huấn luyện (post-training). Hiện tại, nó hỗ trợ tinh chỉnh có giám sát (SFT), giúp huấn luyện mô hình bằng cách sử dụng các ví dụ về hành vi tốt. Bạn cung cấp cho mô hình các đầu vào/đầu ra và nó sẽ học bằng cách cập nhật trọng số mô hình để bắt chước hành vi đó. Dữ liệu quỹ đạo LangSmith được thiết kế để hỗ trợ SFT, và smithtune giúp biến các quỹ đạo này thành dữ liệu huấn luyện hữu ích.

Điều này mang đến cho các đội ngũ một cách thức để huấn luyện các mô hình chuyên biệt mà không cần phải tự xây dựng đường ống dữ liệu (data pipeline) thủ công. Một mô hình được huấn luyện trên các ví dụ của bạn thường có thể thực hiện tốt bằng hoặc hơn các mô hình biên (frontier model) đa năng trên các tác vụ cụ thể, thường với chi phí và độ trễ thấp hơn.

[Hãy thử LangSmith Fine-Tuning trên GitHub](https://github.com/langchain-ai/smithtune) và để coding agent của bạn điều khiển toàn bộ quy trình tinh chỉnh từ đầu đến cuối bằng cách cài đặt [skill từ kho lưu trữ](https://github.com/langchain-ai/smithtune/blob/main/src/smithtune/skills/smithtune/SKILL.md) của smithtune.

> Một trong những động lực lớn nhất mang lại hiệu quả cho việc tinh chỉnh chính là lựa chọn dữ liệu. Với sự ra mắt của smithtune, việc kết nối vòng lặp đó trở nên dễ dàng hơn — từ các dấu vết (traces) sản xuất đã được chọn lọc trong LangSmith đến việc huấn luyện được quản lý và mô hình được phục vụ trên Fireworks. Các đội ngũ có thể chuyển đổi liền mạch từ dữ liệu sang huấn luyện và triển khai mà không cần phải thiết lập cơ sở hạ tầng dọc đường. Đó là con đường mà chúng tôi rất hào hứng khi xây dựng cùng LangChain.

> – Pranav Jain, Trưởng bộ phận Sản phẩm tại Fireworks

> Sự tích hợp của smithtune với Baseten Loops giúp các đội ngũ chuyển đổi liền mạch từ thu thập dữ liệu sang chạy các thử nghiệm tinh chỉnh chỉ trong vài phút. Các nhà phát triển có thể liên tục thu thập và chọn lọc dữ liệu tốt hơn để tạo ra các mô hình tốt hơn theo thời gian với cơ sở hạ tầng huấn luyện được quản lý hoàn toàn mà Loops cung cấp, nhờ đó họ có thể tập trung vào việc thiết kế cho các trường hợp sử dụng quan trọng nhất của khách hàng.

> – Aaron Ellis-Bloor, Nhà nghiên cứu Ứng dụng tại Baseten

### Quỹ đạo tác nhân (Agent trajectories) và hậu huấn luyện

Trước khi đi sâu vào các khả năng mà smithtune cung cấp, hãy cùng thảo luận về quỹ đạo tác nhân.

Quỹ đạo là một chuỗi có thứ tự các thông điệp, lệnh gọi công cụ (tool calls) và kết quả công cụ cho thấy cách một tác nhân xử lý một tác vụ. [LangSmith](https://www.langchain.com/langsmith-platform) tập hợp chuỗi này từ một dấu vết hoặc luồng (thread), đưa các định dạng thông điệp được hỗ trợ vào một biểu diễn chung, bảo toàn các định nghĩa công cụ và loại bỏ lịch sử trùng lặp.

Định dạng quỹ đạo LangSmith được thiết kế với mục tiêu hậu huấn luyện. Đối với SFT, mô hình học viên (student model) cần bối cảnh chính xác mà mô hình giáo viên (teacher model) đã có khi nó tạo ra kết quả thành công. Trong các tác nhân phức tạp chạy dài, bối cảnh khả dụng của công cụ thường thay đổi khi tác nhân hoạt động (ví dụ: [tải công cụ trì hoãn](https://www.anthropic.com/engineering/advanced-tool-use)), và việc xuất danh sách thông điệp cuối cùng một cách đơn giản sẽ làm mất đi sự tinh tế đó. Định dạng quỹ đạo của LangSmith ghi lại chính xác những gì mô hình đã thấy ở mỗi lượt, vì vậy smithtune có thể ghép mỗi hành động với bối cảnh thực sự của nó.

![Anatomy of a trajectory in LangSmith](https://cdn.prod.website-files.com/65c81e88c254bb0f97633a71/6ab45c896c65c62de014c5e2_trajectory-anatomy-langsmith.png)

smithtune sử dụng các quỹ đạo trong suốt quy trình làm việc. Bạn chọn lọc các quỹ đạo ví dụ thành công, chuẩn bị chúng cho mô hình đã chọn và huấn luyện dựa trên các phản hồi và lệnh gọi công cụ đã ghi lại của chúng. Các quỹ đạo không nằm trong tập huấn luyện sẽ cung cấp bối cảnh và các hành động tham chiếu để đánh giá.

### Hướng dẫn từng bước

![](https://cdn.prod.website-files.com/65c81e88c254bb0f97633a71/6ab45cf945c12fd04d1baa38_smithtune-flow.png)

### Xây dựng tập dữ liệu của bạn

Một tập dữ liệu chứa các quỹ đạo 'vàng' mà mô hình mục tiêu sẽ khớp theo. Dữ liệu này là nền tảng cho việc tinh chỉnh có giám sát.

Có một vài giai đoạn chính khi tạo tập dữ liệu với smithtune:

1. Kéo tập dữ liệu (Pull Dataset): smithtune kéo các quỹ đạo từ một dự án theo dõi LangSmith về thư mục cục bộ DIR, với các bộ lọc tùy chọn.
2. Gán nhãn dấu vết (Label Traces): smithtune làm việc với con người (và các tác nhân của họ) để xác định các đặc điểm của các dấu vết "tốt", tạo ra một tiêu chí dựa trên đó, sau đó gửi một hội đồng tác nhân để xem xét và lọc các quỹ đạo là ứng viên tốt cho SFT.
3. Lưu trữ tập dữ liệu bền vững: smithtune đảm bảo rằng bất kỳ dữ liệu nào được sử dụng để huấn luyện đều có thể được kiểm toán sau này như một thành phần bền vững. Nó tải lên tập hợp các quỹ đạo vàng đã thống nhất vào một tập dữ liệu LangSmith để huấn luyện và đánh giá.

Trong quá trình này, smithtune xử lý các chi tiết như:

- đảm bảo các quỹ đạo tương thích với mô hình đã chọn bằng cách lọc các dấu vết vượt quá độ dài chuỗi nhất định.
- chia dữ liệu thành các tập huấn luyện/xác thực/kiểm tra để đánh giá sau này.

### Huấn luyện mô hình

Trước khi cam kết huấn luyện, smithtune plan giúp con người xem xét các cài đặt của họ như mô hình đã chọn, số lượng ví dụ huấn luyện và các siêu tham số như tốc độ học (learning rate), kích thước lô (batch size) và số vòng lặp (epochs).

Bạn có thể điều chỉnh các cài đặt này trước khi chạy smithtune train để bắt đầu công việc tinh chỉnh. smithtune gửi công việc đến [Fireworks managed SFT](https://docs.fireworks.ai/fine-tuning/fine-tuning-models) hoặc [Baseten Loops](https://www.baseten.co/blog/introducing-the-baseten-loops-sdk/), vốn hỗ trợ huấn luyện LoRA trên các quỹ đạo đã chuẩn bị của bạn. Không cần phải quản lý GPU hay cơ sở hạ tầng huấn luyện từ phía bạn. Trong quá trình huấn luyện, smithtune cũng kiểm tra hiệu suất trên tập xác thực và chọn điểm kiểm tra (checkpoint) đã lưu có độ mất mát (loss) thấp nhất.

### Đánh giá kết quả

Sau khi huấn luyện hoàn tất, hãy chạy smithtune evaluate để so sánh điểm kiểm tra đã chọn với mô hình cơ sở.

smithtune sử dụng tính năng đánh giá phát lại (replay evaluation) tích hợp để kiểm tra mô hình cơ sở so với mô hình đã tinh chỉnh. Các mô hình được đánh giá dựa trên khả năng hoàn thành các hành động từ một quỹ đạo vàng và một giám khảo sẽ chấm điểm các dự đoán đó dựa trên các ví dụ thực tế đã ghi lại.

CLI trả về một liên kết so sánh LangSmith, với kết quả xuất hiện khi quá trình đánh giá tiến triển. Bạn có thể so sánh điểm số, kiểm tra từng phản hồi và lựa chọn công cụ, đồng thời xem nơi việc tinh chỉnh đã giúp ích hoặc gây ra các lỗi hồi quy.

### Triển khai mô hình của bạn

Nếu bạn hài lòng với kết quả đánh giá, hãy sử dụng smithtune deploy để phục vụ mô hình đã tinh chỉnh của bạn và kết nối nó với ứng dụng của bạn.

Nếu kết quả không như mong đợi, hãy tinh chỉnh tập dữ liệu hoặc điều chỉnh cài đặt huấn luyện, sau đó huấn luyện và đánh giá lại. Bạn có thể xem lại phần so sánh trong LangSmith cùng với coding agent của mình để xác định phản hồi hoặc lựa chọn công cụ nào cần cải thiện thêm.

### Kết quả từ việc chạy thực tế

Để đánh giá chất lượng quy trình smithtune, chúng tôi đã áp dụng nó cho hai tác nhân được sử dụng nhiều tại LangChain:

- [Engine](https://www.langchain.com/langsmith/engine) phân tích các dấu vết tác nhân để tìm lỗi và nhóm các vấn đề liên quan. Sử dụng phiên bản rút gọn của một trong các tác nhân trong Engine, chúng tôi đã kiểm tra xem SFT có thể cải thiện khả năng xác định và tổ chức các vấn đề đó hay không.
- [OpenSWE Review](https://github.com/langchain-ai/open-swe) xem xét các thay đổi mã trong các kho lưu trữ thực tế của chúng tôi. Chúng tôi đã kiểm tra xem SFT có thể duy trì chất lượng đánh giá trong khi giảm bớt công sức cần thiết để tìm lỗi hay không.

### Engine: hiệu suất tác vụ cao hơn thông qua chuyên môn hóa

Chúng tôi đã chọn lọc một tập hợp các quỹ đạo tốt và sử dụng chúng để tinh chỉnh (fine-tune) mô hình Kimi K3 cơ sở. Bản thân mô hình Kimi cơ sở vốn đã rất mạnh, nhưng chúng tôi đã đạt đến giới hạn trong việc cải thiện nó hoặc gpt-5.6-sol thông qua kỹ thuật harness. Mô hình sau khi tinh chỉnh đạt điểm số cao hơn đáng kể so với cả Kimi cơ sở và GPT-5.6 Sol trên một tập con của IssueBench, bộ tiêu chuẩn đánh giá nội bộ của chúng tôi về khả năng phát hiện và nhóm vấn đề.

| Mô hình | Điểm tác vụ ↑ |
| --- | --- |
| GPT-5.6 Sol | 87.0 |
| Kimi K3 | 90.0 |
| Kimi K3 + SFT | 96.0 |

_Bài gốc còn tiếp._ Xem tiếp tại: <https://www.langchain.com/blog/langsmith-fine-tuning>
