MarkTechPost
92

Thủ thuật

Tổng hợp 11 khung Agent mã nguồn mở tốt nhất cho LLM cục bộ năm 2026

(giờ Việt Nam)

Tóm tắt AI

Bài viết đánh giá chi tiết 11 khung Agent mã nguồn mở như OpenHands, Aider và Cline dựa trên các tiêu chí về tài liệu, tính bảo mật và khả năng duy trì, giúp bạn tối ưu hóa việc chạy LLM cục bộ.

Bản dịch AI

Best Open-Source Agent Harnesses for Local LLMs in 2026

Một agent bao gồm một mô hình và một bộ khung (harness). Bộ khung này chạy các công cụ, lưu giữ trạng thái, quản lý quyền hạn và cung cấp ngữ cảnh ngược lại cho mô hình. Với mô hình chạy cục bộ, bộ khung càng trở nên quan trọng hơn. Các cửa sổ ngữ cảnh nhỏ và khả năng gọi công cụ yếu sẽ làm lộ ra mọi lỗ hổng trong thiết kế.

Hướng dẫn này xếp hạng 11 bộ khung mã nguồn mở dựa trên mức độ tài liệu hóa cho việc suy luận cục bộ. Tất cả dữ liệu kho lưu trữ được thu thập từ GitHub vào ngày 18 tháng 9 năm 2026. Bảng xếp hạng dựa trên 4 tiêu chí: giấy phép được OSI phê duyệt, thời gian chạy cục bộ có tài liệu, tình trạng bảo trì và các biện pháp kiểm soát an toàn.

3 quy tắc áp dụng cho mọi bộ khung

1. Ưu tiên mở rộng cửa sổ ngữ cảnh: Theo tài liệu về độ dài ngữ cảnh của Ollama, các giá trị mặc định phụ thuộc vào VRAM: 4k cho dưới 24 GiB, 32k cho từ 24 đến 48 GiB và 256k cho từ 48 GiB trở lên. Trang này cũng lưu ý rằng các agent và công cụ lập trình nên có ít nhất 64.000 token. Cách khắc phục chỉ với một dòng lệnh: OLLAMA_CONTEXT_LENGTH=64000 ollama serve.

2. Chọn mô hình hỗ trợ gọi công cụ (tool calling): Tài liệu nhà cung cấp của Goose nêu rõ rằng các mô hình không có khả năng gọi công cụ chỉ có thể thực hiện hoàn thiện trò chuyện (chat completion). Với llama.cpp, tài liệu của Pi lưu ý rằng cờ --jinja cho phép sử dụng các mẫu trò chuyện tương thích và tính năng gọi công cụ.

3. Phân bổ bộ nhớ hợp lý: Hướng dẫn cục bộ của Cline ánh xạ 16 đến 32GB RAM cho các mô hình lượng tử hóa nhỏ, 32 đến 64GB cho các mô hình lập trình cỡ trung bình và 64GB trở lên cho các mô hình lớn hơn. Trang Hermes của Ollama liệt kê gemma4 cần khoảng 16 GB VRAM và qwen3.6 cần khoảng 24 GB VRAM.

1. OpenCode

OpenCode tài liệu hóa 3 đường dẫn cục bộ trong tài liệu nhà cung cấp của riêng mình: Ollama, LM Studio và llama-server của llama.cpp. Mỗi cái đều sử dụng gói @ai-sdk/openai-compatible với một baseURL cục bộ. Tài liệu tuyên bố hỗ trợ hơn 75 nhà cung cấp nói chung.

Việc thiết lập có thể chỉ cần một lệnh. Trang OpenCode của Ollama hiển thị ollama launch opencode. Nó khuyến nghị cửa sổ ngữ cảnh ít nhất 64k token. Tài liệu của chính OpenCode bổ sung một mẹo thực tế: nếu việc gọi công cụ thất bại, hãy tăng num_ctx lên khoảng 16k đến 32k.

Nó đi kèm với 2 agent tích hợp sẵn. build có toàn quyền truy cập. plan ở chế độ chỉ đọc và sẽ hỏi trước khi chạy các lệnh bash.

Phù hợp nhất cho: Các nhà phát triển muốn một thiết lập cục bộ có tài liệu đầy đủ nhất trong một công cụ dòng lệnh.

2. Pi

Pi là lựa chọn tối giản. Tệp README của nó cung cấp cho mô hình 4 công cụ: read, write, edit và bash. Nó cố tình bỏ qua MCP, các sub-agent, chế độ plan và các cửa sổ bật lên xin quyền. Những tính năng đó được bổ sung thông qua các gói và tiện ích mở rộng TypeScript.

Pi hỗ trợ nguyên bản cho máy chủ router của llama.cpp. Router này khám phá nhiều tệp GGUF và tải chúng theo yêu cầu. Bạn quản lý các mô hình bên trong Pi bằng lệnh /llama. Ollama cũng hỗ trợ nó. ollama launch pi sẽ cài đặt Pi, cấu hình nhà cung cấp và mở một phiên làm việc.

Một lưu ý quan trọng cho việc sử dụng cục bộ: Pi không có hệ thống quyền tích hợp. Nó chạy với quyền của người dùng hiện tại. Tệp README khuyến nghị sử dụng Docker, tiện ích mở rộng micro-VM hoặc sandbox chính sách để cô lập.

URL cũ badlogic/pi-mono hiện đã chuyển hướng đến earendil-works/pi. Earendil đã mua lại Pi vào tháng 4 năm 2026 và người sáng tạo Mario Zechner đã gia nhập công ty. The Pragmatic Engineer báo cáo rằng Pi là nền tảng mà OpenClaw được xây dựng dựa trên đó.

Phù hợp nhất cho: Các mô hình cục bộ nhỏ, nơi danh sách công cụ ngắn giúp dành nhiều ngữ cảnh hơn cho mã nguồn.

3. Goose

Goose tài liệu hóa nhiều thời gian chạy cục bộ nhất trong số các bộ khung ở đây. Tài liệu nhà cung cấp của nó liệt kê Ollama, LM Studio, Docker Model Runner, Ramalama và Atomic Chat. vLLM và KServe hoạt động thông qua nhà cung cấp tương thích với OpenAI. Các nhà cung cấp tùy chỉnh có thể bỏ qua khóa API cho các máy chủ cục bộ.

Quản trị là một điểm khác biệt. Linux Foundation đã thành lập Agentic AI Foundation vào ngày 9 tháng 12 năm 2025, với việc Block đóng góp goose. Kho lưu trữ hiện nằm tại aaif-goose/goose. Goose được viết bằng Rust và cung cấp ứng dụng máy tính để bàn, CLI và API. Tệp README trích dẫn hơn 70 tiện ích mở rộng MCP.

Thiết lập Ollama rất nhanh chóng. Chạy goose configure, chọn Ollama và nhập tên mô hình.

Phù hợp nhất cho: Tự động hóa chung ngoài lập trình, dưới sự quản trị của một tổ chức trung lập.

4. Cline

Cline là lựa chọn mạnh mẽ nhất dựa trên trình soạn thảo. Hướng dẫn cục bộ của nó khuyến nghị một cài đặt quan trọng nhất: bật “Use Compact Prompt” cho suy luận cục bộ. Nó cũng khuyên nên tập trung vào các tác vụ cụ thể và bắt đầu phiên mới khi ngữ cảnh trở nên quá tải.

Mọi chỉnh sửa tệp và lệnh đều cần sự phê duyệt theo mặc định. Tự động phê duyệt là tùy chọn. Các chế độ Plan và Act giúp tách biệt chiến lược khỏi quá trình thực thi.

Một chi tiết về giấy phép cần lưu ý: Tệp README của Cline cho biết các plugin JetBrains không phải là mã nguồn mở. Tiện ích mở rộng VS Code, CLI và SDK nằm trong kho lưu trữ Apache-2.0.

Phù hợp nhất cho: Người dùng VS Code muốn có sự phê duyệt của con người (human-in-the-loop) với mô hình cục bộ.

5. OpenHands

OpenHands công bố hướng dẫn cục bộ chi tiết nhất. Hướng dẫn LLM cục bộ của nó khuyến nghị Qwen3.6-35B-A3B là mô hình cục bộ đầu tiên nên thử, tính đến ngày 21 tháng 5 năm 2026. Các yêu cầu phần cứng được nêu rõ ràng. Các biến thể lượng tử hóa cần ít nhất 24GB VRAM hoặc máy Mac Apple Silicon với 64GB bộ nhớ thống nhất.

Hướng dẫn về ngữ cảnh cũng trực tiếp không kém. Đặt độ dài ngữ cảnh ít nhất là 22.000 token, khuyến nghị là 32.768. Hướng dẫn cảnh báo rằng giá trị mặc định 4.096 của Ollama thậm chí không đủ chứa system prompt.

Người dùng Linux gặp phải một cái bẫy: LM Studio mặc định liên kết với 127.0.0.1, vì vậy OpenHands chạy trong Docker không thể truy cập được. Việc bật “Serve on Local Network” sẽ khắc phục vấn đề này.

Phù hợp nhất cho: Các tác vụ chạy lâu dài trong container trên máy trạm hoặc GPU máy chủ.

6. Aider

Aider xử lý việc gọi công cụ yếu theo cách khác. Các định dạng chỉnh sửa của nó yêu cầu mô hình trả về các chỉnh sửa dưới dạng văn bản. Định dạng toàn bộ trả về các tệp đầy đủ. Định dạng diff trả về các khối tìm kiếm và thay thế. Aider cũng gửi một bản đồ kho lưu trữ các ký hiệu chính với mỗi yêu cầu.

Tài liệu Ollama của nó cảnh báo một mối nguy thực sự: Ollama âm thầm loại bỏ ngữ cảnh vượt quá cửa sổ. Aider khắc phục điều này bằng cách định cỡ cửa sổ theo từng yêu cầu, cộng thêm 8k token cho phản hồi. Lưu ý rằng trang này vẫn trích dẫn giá trị mặc định 2k cũ của Ollama.

Bảo trì là một mối lo ngại. PyPI hiển thị phiên bản 0.86.2 vào ngày 12 tháng 2 năm 2026. Bản phát hành trước đó là ngày 13 tháng 8 năm 2025.

Phù hợp nhất cho: Lập trình cặp (pair programming) gốc Git với các mô hình gặp khó khăn trong việc gọi hàm.

7. Codex CLI

Codex CLI sử dụng giấy phép Apache-2.0 và đi kèm với 2 nhà cung cấp cục bộ tích hợp sẵn. Mã nguồn định nghĩa ollama trên cổng 11434 và lmstudio trên cổng 1234. Theo trang Codex của Ollama, codex --oss mặc định là gpt-oss:20b. Cờ -m được dùng để chọn mô hình khác.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.