MarkTechPost
92

Sản phẩm

Andrew Ng ra mắt OpenWorker: Trợ lý AI cục bộ, tự động hoàn thiện công việc thay vì chỉ chat

(giờ Việt Nam)

Tóm tắt AI

OpenWorker là trợ lý AI mã nguồn mở chạy cục bộ trên máy tính, tập trung vào việc tạo ra sản phẩm hoàn chỉnh thay vì chỉ phản hồi văn bản. Công cụ này tích hợp cơ chế bảo mật nghiêm ngặt và hỗ trợ đa dạng các mô hình AI từ Ollama đến các model chuyên dụng.

Bản dịch AI

Andrew Ng Just Released OpenWorker: An Open-Source, Local-First Desktop AI Coworker That Returns Finished Deliverables Instead of Chat

Andrew Ng vừa công bố OpenWorker, một desktop agent mã nguồn mở tạo ra kết quả công việc hoàn chỉnh thay vì chỉ trò chuyện. OpenWorker yêu cầu người dùng đưa ra kết quả mong muốn thay vì một câu lệnh (prompt): một tài liệu đã được trau chuốt, một phản hồi trên Slack chứa các con số thực tế, một lịch làm việc đã cập nhật, hoặc một hộp thư đến đã được phân loại. Sau đó, nó chia kết quả đó thành các bước, thực hiện trên các tệp cục bộ và các ứng dụng được kết nối, đồng thời kiểm tra lại với người dùng trước khi thực hiện bất kỳ hành động quan trọng nào.

Kiến trúc của hệ thống gồm bốn lớp và tất cả đều chạy trên máy tính của bạn.

Kho lưu trữ chứa 119 tệp Python (~32.400 dòng) trong thư mục coworker/, 149 tệp TypeScript/TSX trong surfaces/gui/ và 78 mô-đun kiểm thử backend.

Ngăn xếp công nghệ được phân chia như sau:

Công cụ này được xây dựng trên aisuite, thư viện LLM không phụ thuộc vào nhà cung cấp của Andrew Ng.

Bạn có thể tự mang theo mô hình của mình từ một danh sách được tuyển chọn kỹ lưỡng và có giới hạn.

Không có dịch vụ suy luận (inference service) nào cho OpenWorker. Người dùng tự dán khóa API hoặc trỏ ứng dụng vào một môi trường chạy cục bộ (local runtime).

Ma trận mô hình được tuyển chọn bao gồm chính xác 30 mục. Các nhà cung cấp gốc bao gồm OpenAI (GPT-5.6 Sol/Terra/Luna và GPT-5.5), Anthropic (Claude Fable 5, Opus 4.8, Sonnet 4.6, Haiku 4.5) và Google (Gemini 3.1 Pro, 3.6 Flash, 2.5 Pro, 2.5 Flash). Các nhà cung cấp tương thích với OpenAI bổ sung thêm GLM-5.2, DeepSeek V4, Kimi K2.6, MiniMax M2.5, Qwen3 Max, Grok 4.3 và Mistral Large. Các mô hình mã nguồn mở (open-weight) được cung cấp thông qua Together AI và Fireworks, còn các mô hình chạy hoàn toàn cục bộ thông qua Ollama, vốn không yêu cầu bất kỳ khóa nào.

Công cụ quản lý quyền (permission engine) mới là điểm nhấn kỹ thuật thực sự.

Hầu hết các dự án desktop agent đều coi việc phê duyệt là một tính năng phụ của giao diện người dùng. OpenWorker coi đó là một lớp được định kiểu (typed layer).

Mọi lệnh gọi công cụ đều được phân loại vào một trong bốn nhóm rủi ro: read (không có tác dụng phụ), write_local (thay đổi không gian làm việc, giới hạn trong đường dẫn), exec (chạy lệnh) và external (có tác dụng phụ bên ngoài máy tính). Sau đó, năm chế độ cấp quyền sẽ quyết định điều gì xảy ra: discuss và plan chỉ ở chế độ đọc, interactive là chế độ mặc định và sẽ hỏi trước khi thực hiện ghi dữ liệu, lệnh hoặc hành động bên ngoài, auto cho phép mọi thứ trong khi vẫn giới hạn trong đường dẫn, và custom cho phép tự động phê duyệt một tập hợp các công cụ do người dùng liệt kê.

Hai quyết định thiết kế nổi bật đáng chú ý.

Persona ops tích hợp sẵn cũng hướng dẫn mô hình coi nội dung từ các công cụ, nhật ký, web, tệp tin và tin nhắn đến là dữ liệu không đáng tin cậy thay vì các chỉ dẫn. Đó là một tư thế phòng thủ chống tiêm câu lệnh (prompt-injection) rõ ràng, được viết trực tiếp vào persona đi kèm.

Quyền riêng tư: ưu tiên cục bộ (local-first).

Các lệnh gọi mô hình đi trực tiếp từ máy tính đến nhà cung cấp đã cấu hình. Các cuộc trò chuyện, mã thông báo kết nối (connector tokens) và khóa mô hình vẫn nằm cục bộ, và kho lưu trữ bảo mật được thiết kế để các thông tin bí mật không bao giờ lọt vào ngữ cảnh, câu lệnh hoặc dấu vết của mô hình.

Thành phần đám mây duy nhất là một trình môi giới tùy chọn xử lý các bước bắt tay OAuth cho các trình kết nối một lần nhấp, sử dụng Auth0 Authorization Code với PKCE. Các mã thông báo kết nối được chuyển thẳng đến máy tính và không bao giờ được lưu trữ trên đám mây. Ứng dụng hoạt động đầy đủ ngay cả khi đăng xuất, bằng cách sử dụng thông tin xác thực được dán thủ công.

Những điểm chính cần lưu ý.

Hãy xem qua GitHub Repo, trang web của dự án và thông báo chính thức. Mọi công lao cho nghiên cứu này đều thuộc về các nhà nghiên cứu và nhà phát triển của dự án.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo độc giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với công chúng.

AI AgentOpenWorkerAndrew NgLocal AITự động hóa
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.