Thủ thuật
Warp: Cách xây dựng AI tự tối ưu hóa trên nền tảng Claude
(giờ Việt Nam)
Tóm tắt AI
Warp áp dụng mô hình Agent Skills để biến phản hồi từ con người thành vòng lặp tự cải tiến cho AI, giúp tối ưu hóa quy trình code trên quy mô lớn. Phương pháp này nhấn mạnh việc thiết lập nguyên tắc thay vì quy tắc cứng nhắc để tăng tính linh hoạt.
Bản dịch AI

Trong loạt bài này, chúng tôi làm nổi bật cách các startup đang thay đổi ngành công nghiệp của họ bằng AI. Trong bài viết này, chúng tôi chia sẻ cách Warp biến phản hồi người dùng vốn chỉ mang tính tạm thời thành một vòng lặp tự cải thiện cho các tác nhân (agent) của mình.
Các agent cần xử lý những tác vụ lặp đi lặp lại một cách đáng tin cậy và hiệu quả. Một câu lệnh (prompt) sơ khai chỉ đạt được 80% độ chính xác có thể tạo ra trải nghiệm gây nhiễu và khó chịu cho người dùng. Warp đã rút ra bài học đắt giá từ điều này và sử dụng nó để định hình chiến lược sản phẩm, tạo ra trải nghiệm cải tiến cho gần 1 triệu lập trình viên trên toàn thế giới.
Warp, môi trường phát triển tích hợp agent và terminal hỗ trợ bởi AI, được xây dựng trên nền tảng Claude Platform. Đội ngũ đã gặp phải vấn đề "trải nghiệm gây nhiễu" này với agent đánh giá mã nguồn (code review) nội bộ của họ. Các kỹ sư phàn nàn rằng agent của họ đưa ra những bình luận vô ích và kết quả đầu ra có chất lượng thấp.
Ban đầu, đội ngũ đã thử các giải pháp tình thế, chẳng hạn như viết lại prompt theo cách thủ công dựa trên những lỗi đánh giá mã nguồn quan sát được. Điều này giúp kết quả đầu ra hữu dụng hơn nhưng không thể mở rộng. Việc cải thiện các tệp ngữ cảnh như AGENTS.md cũng giúp ích, nhưng vẫn chưa phải là giải pháp triệt để.
Cuối cùng, họ nhận ra vấn đề thực sự là phản hồi dành cho một agent, bất kể mục đích là gì, thường biến mất khi phiên làm việc kết thúc, làm mất đi ngữ cảnh quan trọng trong vòng lặp của agent. Giải pháp của họ là: một khung làm việc dựa trên "Kỹ năng Agent" (Agent Skills) để tạo ra các agent tự cải thiện, nơi phản hồi được tích lũy theo thời gian để liên tục tinh chỉnh và nâng cao kết quả đầu ra của agent.
Hãy đọc tiếp để tìm hiểu cách họ xây dựng hệ thống này với các kỹ năng trên nền tảng Claude Platform.
Vòng lặp tự cải thiện của agent được xây dựng trên các kỹ năng
Kỹ thuật cốt lõi là một vòng lặp tự cải thiện sử dụng các kỹ năng (skills) — vốn là các tệp mã hóa kiến thức giúp giữ các chỉ dẫn nằm ngoài prompt thô. Warp đã phát triển một kiến trúc agent tự cải thiện bao gồm hai kỹ năng, với phản hồi của con người ở giữa.

Kỹ năng nội tại/cơ sở (inner/base skill) chứa kiến thức chuyên môn chức năng và các chỉ dẫn. Ví dụ, khi một PR (Pull Request) được mở, agent mã nguồn của Warp sẽ thực thi bằng cách sử dụng kỹ năng cơ sở đó cùng với ngữ cảnh để đưa ra đánh giá.
Phản hồi của con người đối với kết quả đầu ra của agent là một thành phần quan trọng cho vòng lặp tự cải thiện. Đối với việc đánh giá mã nguồn, điều này có thể đơn giản như một nút like (thumbs up), nhưng càng chi tiết thì càng tốt.
"Con người có thể khẳng định 'đây là một bình luận hay và hữu ích'," nhà sáng lập Warp, Zach Lloyd giải thích, "Nhưng họ cũng có thể đưa ra lý do chi tiết tại sao một đánh giá mã nguồn chưa tốt. Những chi tiết cụ thể như 'bạn đề xuất đổi tên biến này, nhưng quy ước mã nguồn của chúng tôi là loại biến toàn cục này phải sử dụng ngữ cảnh đặt tên cụ thể này' sẽ chỉ cho agent cách làm đúng vào lần sau."
Kỹ năng ngoại vi/cải tiến (outer/improver skill) hoạt động như một agent quan sát chạy theo lịch trình thay vì chạy theo từng tác vụ. Nó thu thập các phản hồi của con người đã tích lũy, so sánh những gì agent đề xuất với cách con người phản hồi, và đề xuất một chỉnh sửa nhỏ, tập trung vào kỹ năng cơ sở.
Vì các kỹ năng là các tệp văn bản thuần túy, các agent rất giỏi trong việc cập nhật chúng. Những cập nhật này có thể được xem xét, phê duyệt và hợp nhất (merge), có thể luân chuyển qua quy trình làm việc PR/đánh giá mã nguồn thông thường; một khi đã hợp nhất, lần chạy tiếp theo của kỹ năng nội tại sẽ kế thừa sự cải tiến đó.
Warp hiện đang vận hành mô hình này trên toàn bộ kho lưu trữ mã nguồn mở của mình, với các agent chuyên biệt về viết đặc tả (spec-writing), đánh giá và phân loại (triage), mỗi agent đều mang trong mình vòng lặp tự cải thiện riêng.
"Các kỹ năng dựa trên tệp là một cách mã hóa kiến thức cho agent mà không cần đưa kiến thức đó trực tiếp vào prompt, như một thứ mà agent có thể dễ dàng tra cứu trong quá trình làm việc," Zach nói. "Khung làm việc này thực sự rất đơn giản: có kỹ năng cơ sở chuyên biệt theo lĩnh vực và sau đó là kỹ năng cải tiến giúp tinh chỉnh kỹ năng chuyên biệt đó. Sự đơn giản này chính là vẻ đẹp của phương pháp này."
Cách viết các kỹ năng tự cải thiện cho agent
Dưới đây là một số mẹo đã được kiểm chứng của đội ngũ Warp để viết các kỹ năng tự cải thiện cho các vòng lặp agent:
Vòng lặp trong thực tế: Agent phân loại vấn đề (issue triage agent) của Warp
Agent phân loại vấn đề của Warp minh họa cho khung làm việc kỹ năng agent tự cải thiện. Mô hình này được kích hoạt bất cứ khi nào có ai đó tạo một GitHub issue mới: một GitHub Action sẽ khởi chạy một agent để phân tích vấn đề về độ phức tạp và tính khả thi, gán nhãn và đề xuất hướng khắc phục. Agent phân loại đó chạy dựa trên một tệp kỹ năng nội tại chứa kiến thức chuyên môn về ý nghĩa của từng nhãn và cách nghiên cứu cơ sở mã nguồn trước khi hành động.
Trên một issue mẫu, kỹ năng nội tại giai đoạn đầu đã làm tốt nhưng bỏ sót một nhãn là "ready to spec" (sẵn sàng để viết đặc tả), vốn báo hiệu rằng một cộng tác viên có thể bắt đầu xây dựng các đặc tả sản phẩm và kỹ thuật cho issue đó. Một người bảo trì (maintainer) trong đội ngũ Warp đã phát hiện ra thiếu sót này và để lại phản hồi trực tiếp trên issue, ngay tại nơi công việc đang diễn ra. Quan trọng là, anh ấy giải thích cả những gì anh ấy mong đợi và lý do tại sao: phản hồi có tính hành động cao, dễ dàng để agent tiếp thu sau này.
Kỹ năng cải tiến ngoại vi chạy trong Oz, nền tảng điều phối agent của Warp, dưới dạng một agent "cập nhật phân loại" theo lịch trình. Agent này xác thực với GitHub, chạy một tập lệnh Python đi kèm với kỹ năng để lấy các issue gần đây có phản hồi, tóm tắt chúng thành tệp JSON và đọc lại vào ngữ cảnh. Tập lệnh đi kèm này tự nó là một phương pháp thực hành tốt nhất; các kỹ năng có thể tham chiếu đến các tệp tài nguyên thay vì phải viết mã mới mỗi khi chạy.
Từ đó, agent xác định các tín hiệu phản hồi cụ thể trong bình luận của người bảo trì và đề xuất chỉnh sửa nhỏ nhất để nắm bắt chúng. Nó mở một PR chỉnh sửa kỹ năng nội tại để áp dụng nhãn "ready to spec" khi một issue mô tả một vấn đề thực tế, ngay cả khi hình dạng UI hoặc UX chính xác chưa được xác định.
Vì toàn bộ bản cập nhật là một tệp kỹ năng, nó di chuyển qua quy trình làm việc đánh giá mã nguồn thông thường. PR đến kèm với mô tả giải thích những tín hiệu nào đã thúc đẩy thay đổi và nó đã thay đổi những gì. Con người xem xét, phê duyệt và hợp nhất, và lần chạy tiếp theo của kỹ năng phân loại sẽ kế thừa kiến thức mới. Bước cuối cùng của con người đó khép lại vòng lặp và giữ cho con người quyền kiểm soát những gì thực sự thay đổi.
Đây là cơ chế tương tự mà Warp hiện đang vận hành ở quy mô lớn trên toàn bộ kho mã nguồn mở của mình, nơi các agent viết đặc tả, agent đánh giá và agent phân loại đều mang trong mình vòng lặp tự cải thiện riêng.
Bất kỳ agent nào, bất kể tác vụ là gì, đều sẽ trở nên tốt hơn theo thời gian nếu bạn xây dựng một trong những vòng lặp này vào đó ngay từ đầu để nắm bắt các tín hiệu phản hồi của con người, biến chúng thành các bản cập nhật kỹ năng và mở rộng các agent từ những công cụ hỗ trợ dùng một lần thành các hệ thống có khả năng tích lũy giá trị trên toàn bộ tổ chức của bạn.
Xem toàn bộ hội thảo trực tuyến để có bản demo trực tiếp và thảo luận sâu hơn về cách Warp sử dụng Claude để xây dựng các agent học hỏi từ phản hồi của nhóm và tự cải thiện theo thời gian.
Bắt đầu xây dựng với Claude Platform ngay hôm nay.
Bài viết được AI dịch và tổng hợp tự động từ Claude: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.