Hacker News: AI bài nổi bật
85

Sản phẩm

Ra mắt Screenpipe (YC S26): Ghi lại quy trình làm việc để tự động hóa bằng AI Agent

(giờ Việt Nam)

Tóm tắt AI

Screenpipe là công cụ mã nguồn mở giúp ghi lại mọi hoạt động trên màn hình và âm thanh của bạn, sau đó chuyển đổi dữ liệu này thành các AI agent có khả năng thực hiện tác vụ tự động dựa trên ngữ cảnh thực tế.

Bản dịch AI

Chào Hacker News, mình là Louis. Mình đã xây dựng Screenpipe (https://screenpipe.com), một ứng dụng ghi lại màn hình và âm thanh của bạn hoàn toàn cục bộ (chỉ cục bộ thôi!), đồng thời cung cấp cho các AI agent một bộ nhớ có thể tìm kiếm được về những gì bạn đã thấy, đã nói và đã nghe. Điều này giúp việc tự động hóa các tác vụ lặp đi lặp lại trở nên dễ dàng hơn, chuyển đổi chúng thành các SOP (Quy trình vận hành tiêu chuẩn) và nhiều thứ khác nữa.

Mình đã tạo một video demo theo phong cách HN tại https://www.tella.tv/video/build-your-ai-second-brain-with-s... và có một video giới thiệu sản phẩm tại https://www.youtube.com/watch?v=c1jV6E9pyug.

Mình đã bị ám ảnh bởi điều này từ rất lâu rồi. Mình đã duy trì một "bộ não thứ hai" từ năm 2020, nơi mình lưu trữ nhật ký, ghi chú viết tay, âm nhạc mình nghe, các dự án đang thực hiện, các cuộc trò chuyện với mọi người, CRM cá nhân, v.v. Mình đã thử nghiệm rất nhiều về RAG trong thời gian đầu với ParlAI, hàng trăm mô hình GPT2 được tinh chỉnh, và GPT3 (https://forum.obsidian.md/t/fine-tuning-openai-api-gpt3-on-y...). Sau đó, mình xây dựng Ava, plugin AI đầu tiên cho Obsidian, nhanh chóng đạt được vài nghìn người dùng. Sau đó nó trở thành Embedbase, một API giúp việc xây dựng các ứng dụng AI dựa trên RAG trở nên dễ dàng hơn.

Điều mình học được từ tất cả những việc này là tầm quan trọng của việc các mô hình cần có ngữ cảnh về những gì bạn đang làm trên máy tính để chúng có thể thực hiện chính xác những gì bạn muốn.

Thời kỳ đầu, chúng ta có tinh chỉnh (fine-tuning) nhưng quá vất vả, sau đó là gọi công cụ (tool calling) để AI có thể truy cập phần mềm bạn sử dụng nhưng vẫn chưa đủ tự chủ, vẫn cần sự quản lý vi mô. Rồi MCP ra đời, nhưng nó có vẻ quá tĩnh và những người dùng không chuyên về kỹ thuật gặp khó khăn khi xây dựng và sử dụng MCP. Sau đó chúng ta có các kỹ năng (skills). Gần đây nhất, chúng ta đã thấy wiki do LLM duy trì của Karpathy, GBrain của Garry, v.v., nơi một agent liên tục duy trì một tập hợp các trang Markdown bền vững. Các nguồn mới cập nhật các trang thực thể, củng cố hoặc phản bác các tuyên bố hiện có và cải thiện một sự tổng hợp tích lũy theo thời gian. Mình thích mô hình này, nhưng nó vẫn bắt đầu bằng việc ai đó chọn và nhập các nguồn. Vẫn chưa có cách nào để AI biết bạn và công ty của bạn đang làm gì mỗi ngày, trên khắp các ứng dụng, chứ không chỉ bên trong các ứng dụng.

Tất nhiên, không phải ai cũng muốn điều này. Nhưng mình thì có! Mình muốn AI biết mình đang làm gì và không bao giờ bị mất trí nhớ nữa, và mình muốn nó sử dụng cùng một phần mềm mà con người sử dụng, mà không cần phải chuyển đổi ngữ cảnh gây mệt mỏi.

Mình bắt đầu xây dựng Screenpipe cho bản thân vào năm 2024 - một CLI để ghi lại màn hình và đưa ngữ cảnh này vào AI. Một người dùng HN đã đăng nó vào năm 2024 (https://news.ycombinator.com/item?id=41695840) và cuộc thảo luận đó đã ảnh hưởng đến sản phẩm. Những lời chỉ trích hữu ích nhất liên quan đến sự đồng ý khi ghi âm, bảo mật cục bộ, mức sử dụng CPU, tỷ lệ tín hiệu trên nhiễu và liệu các agent có thể hành động dựa trên dữ liệu đó hay không.

Cách triển khai sơ khai bắt đầu từ việc ghi video liên tục và chạy OCR trên từng khung hình. Nhưng điều đó tạo ra dữ liệu trùng lặp, tiêu tốn tài nguyên đáng kể (nó biến máy tính của bạn thành một chiếc máy sưởi!) và loại bỏ cấu trúc mà hệ điều hành đã biết. Thay vào đó, Screenpipe hiện lắng nghe các sự kiện như chuyển đổi ứng dụng, nhấp chuột, tạm dừng gõ phím, cuộn trang và các trạng thái chờ. Khi có thay đổi ý nghĩa, nó ghép ảnh chụp màn hình với cây truy cập (accessibility tree) của hệ điều hành tại cùng một dấu thời gian. OCR được sử dụng khi dữ liệu truy cập có cấu trúc không khả dụng. Chúng tôi cũng ghi âm liên tục, xác định người nói và chuyển đổi giọng nói thành văn bản cục bộ thông qua Parakeet/Whisper hoặc sử dụng các mô hình đám mây.

Mọi thứ được lập chỉ mục trong cơ sở dữ liệu SQLite cục bộ, các tệp mp4 và đôi khi là các tệp md. Một API thân thiện với AI trên cổng 3030 được mở cho các agent, với xác thực, MCP và các kỹ năng.

Khi Screenpipe đã chạy được một thời gian, bạn có thể sử dụng nó thông qua tính năng chat tích hợp, Claude, ChatGPT, Hermes, Openclaw hoặc bất kỳ agent nào để thực hiện các việc như:

- thêm ngữ cảnh vào cuộc trò chuyện hiện tại của bạn, ví dụ: "thu thập tất cả ngữ cảnh về tác vụ X", sau đó cần ít câu lệnh (prompt) hơn để đạt được mục tiêu của bạn

- truy xuất thông tin, ví dụ: "truy xuất các tác vụ tôi đã làm từ 8 giờ sáng đến 4 giờ chiều, lập danh sách những việc đã hoàn thành và những việc còn lại"

- tạo và duy trì một wiki cá nhân / bộ não thứ hai cho các agent của bạn: "mỗi 1 giờ hãy sắp xếp mọi thứ tôi làm vào các dự án, con người, tác vụ, cuộc họp trong Obsidian vault của tôi dưới dạng các tệp và thư mục markdown"

- tạo tự động hóa: bất cứ khi nào tôi truy cập hồ sơ của ai đó trên LinkedIn, hãy cập nhật CRM của tôi

- tìm kiếm cơ hội tự động hóa: xem xét mọi thứ nhóm của tôi đã làm trong tuần này và biến nó thành một danh sách các cơ hội tự động hóa

Dữ liệu của Screenpipe được lưu trữ cục bộ, mặc dù chúng tôi cũng cung cấp gói doanh nghiệp để khám phá các cơ hội tự động hóa và đối với gói đó, công ty sẽ quyết định nơi lưu trữ dữ liệu. Chúng tôi đã xây dựng mô hình AI PII của riêng mình để ẩn thông tin nhạy cảm, nó chạy cục bộ trên Apple MLX hoặc Windows DirectML, chúng tôi cũng hỗ trợ suy luận bảo mật trên đám mây cho các thiết bị cấu hình thấp, mặc dù các mô hình cục bộ của chúng tôi được thiết kế để sử dụng <1% CPU và <400 MB RAM. Người dùng có thể thiết lập các ứng dụng, cửa sổ và URL để lọc, ngoài chế độ ẩn danh của trình duyệt.

Chúng tôi cũng hỗ trợ lịch trình ghi âm và các tính năng bảo mật khác.

Hầu hết cơ sở mã của chúng tôi được viết bằng Rust, MLX, Onnx, chúng tôi thích cidre hoặc gọi C trực tiếp cho các API của Apple và windows-rs cho API của Windows. Chúng tôi cũng hỗ trợ thử nghiệm trên Linux.

Chúng tôi có một ứng dụng máy tính để bàn (https://screenpipe.com/how-to-install) và một CLI:

Bạn có thể chạy nó mà không cần tạo tài khoản. Tất cả mã nguồn đều có sẵn tại https://github.com/screenpipe/screenpipe. Chúng tôi đã thực hiện bước khó khăn là tạo ra Giấy phép Thương mại Screenpipe của riêng mình. Tôi biết HN rất ưu tiên mã nguồn mở OSI (MIT/Apache/v.v.) nhưng tôi không thể tìm ra cách bền vững để tiếp tục phát triển Screenpipe trong khi các công ty đang sử dụng nó miễn phí cho mục đích thương mại. Vì vậy, hiện tại việc sử dụng cá nhân phi thương mại, phi lợi nhuận, giáo dục và nghiên cứu là miễn phí, nhưng sử dụng thương mại cần có giấy phép.

Các phiên bản được phát hành trước khi thay đổi giấy phép vẫn khả dụng theo MIT. Chúng tôi có gói miễn phí và các gói khác, bao gồm Enterprise giúp các công ty tìm kiếm cơ hội tự động hóa.

Rất mong nhận được phản hồi, những điều bạn đã làm với Screenpipe hoặc các tính năng bạn muốn.

AI AgentTự động hóaNăng suấtMã nguồn mởYC S26
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.