Sản phẩm
Token Saver: Công cụ mã nguồn mở giúp giảm 99% chi phí token khi đọc PDF trên Claude
(giờ Việt Nam)
Tóm tắt AI
Token Saver là tiện ích mở rộng MCP mã nguồn mở sử dụng công nghệ Hybrid RAG cục bộ, giúp người dùng Claude Desktop tiết kiệm tới 99% chi phí token khi xử lý tài liệu PDF mà vẫn đảm bảo quyền riêng tư tuyệt đối.
Bản dịch AI

Các nhà phát triển, nhà nghiên cứu và chuyên gia AI thường xuyên gặp phải một rào cản gây nản lòng khi phân tích các tài liệu lớn bằng LLM: chi phí ẩn, tích lũy của cửa sổ ngữ cảnh (context window). Việc dán một tệp PDF dài 200 trang vào khung chat không phải là khoản phí một lần. Vì lịch sử trò chuyện được gửi lại cho mô hình trong mỗi lượt phản hồi, tài liệu khổng lồ đó sẽ bị tính phí lặp lại với mỗi câu hỏi tiếp theo.
Đội ngũ Marktechpost AI vừa phát hành Token Saver, một tiện ích mở rộng Model Context Protocol (MCP) mã nguồn mở cho Claude Desktop (giấy phép MIT, hiện ở phiên bản v1.0). Công cụ này được phát triển tại Marktechpost AI Media Inc bởi Arnav Rai (sinh viên ngành Khoa học máy tính tại Rochester Institute of Technology) trong kỳ thực tập tại Marktechpost, dưới sự giám sát của Jean-marc Mommessin và Asif Razzaq. Token Saver thay đổi căn bản cách Claude tương tác với các tài liệu cục bộ. Bằng cách triển khai Local Hybrid RAG (hệ thống chạy trực tiếp trên máy tính của bạn), nó cho phép bạn đặt câu hỏi về các tệp PDF khổng lồ mà không cần phải tải tệp thực tế lên mô hình.
Mức tiêu thụ token được cắt giảm từ 92% đến 99%, quyền riêng tư được đảm bảo và việc thiết lập không yêu cầu bất kỳ môi trường Python hay cấu hình terminal nào.
Giao diện trông như thế nào!

Sự hao hụt token ẩn từ các tệp PDF lớn
Hầu hết người dùng cho rằng khi họ thả một tệp PDF vào Claude, nó chỉ đơn giản là trích xuất văn bản. Trên thực tế, hành vi mặc định của Claude là chuyển đổi mỗi trang thành một hình ảnh để bảo toàn biểu đồ và bố cục, đồng thời trích xuất văn bản một cách riêng biệt. Trước khi một token hình ảnh nào được tính, riêng phần văn bản đã có thể tiêu tốn từ 1.500 đến 3.000 token mỗi trang.
Mặc dù Prompt Caching và Claude Projects giúp giảm bớt gánh nặng này, chúng không giải quyết được vấn đề cốt lõi: toàn bộ tài liệu vẫn phải truyền qua máy chủ của nhà cung cấp. Hơn nữa, nếu bạn chỉ cần hai đoạn văn liên quan từ một cuốn sách giáo khoa dài 1.000 trang, việc buộc LLM phải tự tìm kiếm trên toàn bộ 1.000 trang đó vừa kém hiệu quả vừa dễ dẫn đến tình trạng ảo giác (hallucination).
Local Hybrid RAG giải quyết vấn đề như thế nào
Token Saver của Marktechpost đóng vai trò như một máy chủ MCP cục bộ: một chương trình chạy nền nhẹ trên máy tính của bạn mà Claude có thể gọi như một công cụ. Tệp PDF không bao giờ rời khỏi ổ cứng của bạn.
Khi bạn đặt câu hỏi, Token Saver sử dụng Local Hybrid RAG để tìm câu trả lời. Hybrid RAG là tiêu chuẩn vàng cho việc truy xuất tài liệu vì nó kết hợp hai phương pháp tìm kiếm mạnh mẽ:
Bằng cách kết hợp hai phương pháp này tại cục bộ, máy chủ sẽ tìm kiếm tệp và chỉ cung cấp cho Claude những đoạn văn có độ liên quan cao. Sau đó, Claude tổng hợp câu trả lời, trích dẫn số trang chính xác và cung cấp bảng tổng kết số token bạn vừa tiết kiệm được.
Quy trình xử lý 8 giai đoạn
Token Saver chạy hoàn toàn bên trong một tiến trình cục bộ duy nhất và kéo dài. Trước khi bất kỳ văn bản nào đến được với Claude, quy trình Hybrid RAG cục bộ sẽ thực hiện tám bước nhanh chóng:

(Lưu ý: Mô hình embedding là tùy chọn nhưng được khuyến nghị sử dụng. Nếu nó không tải được, hệ thống sẽ tự động chuyển sang chế độ khớp từ khóa đơn thuần).
Những con số: Tiết kiệm 99% ở quy mô lớn
Vì quy trình Hybrid RAG giới hạn phần văn bản được trả về, mức tiết kiệm token tăng theo cấp số nhân với kích thước của tài liệu. Dưới đây là hiệu suất của Token Saver trong quá trình kiểm chuẩn (đo bằng tiktoken, giả định một câu hỏi cho mỗi tài liệu):
Tuyên bố miễn trừ trách nhiệm: Số lượng token sử dụng cl100k_base làm đại diện và các đường cơ sở giả định rằng toàn bộ tài liệu bị tính phí trong mỗi lần tìm kiếm.
Đối với các chuyên gia thường xuyên làm việc với các ý kiến pháp lý, tiêu chuẩn kỹ thuật, báo cáo tài chính hoặc sách giáo khoa dày đặc, Token Saver loại bỏ khoản thuế token lặp đi lặp lại.
Bảo mật và quyền riêng tư cục bộ
Đối với người dùng doanh nghiệp và chuyên gia pháp lý, quyền riêng tư dữ liệu là điều không thể thỏa hiệp. Mô hình bảo mật của Token Saver dựa trên ba trụ cột:
Hiệu suất mô hình: Sonnet so với Opus
Token Saver của Marktechpost hoạt động trên cả ba cấp độ của Claude 3.5, nhưng thử nghiệm cho thấy các hành vi riêng biệt:
Bắt đầu trong vài phút
Không giống như nhiều công cụ AI mã nguồn mở yêu cầu môi trường Python và cấu hình JSON phức tạp, Token Saver được đóng gói thành một tệp.mcpb duy nhất.
Tiện ích mở rộng sẽ không chạy cho đến khi một thư mục được chọn, vì lựa chọn duy nhất đó phục vụ ba mục đích cùng một lúc.

Thư mục đó rất đáng để cân nhắc. Nó thiết lập ranh giới của những gì có thể được đọc, cho phép bạn yêu cầu tệp theo tên thay vì phải gõ đường dẫn, và là danh sách mà máy chủ hiển thị cho Claude khi cuộc trò chuyện bắt đầu. Một thư mục nhỏ chỉ chứa những gì bạn định hỏi sẽ hoạt động hiệu quả hơn nhiều so với việc trỏ nó vào toàn bộ thư mục Documents.
Những điểm chính cần lưu ý
Xem kho lưu trữ GitHub.
Tài liệu tham khảo: Định dạng MCP Bundle | all-MiniLM-L6-v2 | pdfkb-mcp | wesleygriffin/pdfrag | Các tập dữ liệu: Dobbs v. Jackson Women’s Health Organization; Báo cáo thường niên năm 2023 của Berkshire Hathaway

Arnav hiện là sinh viên tại Rochester Institute of Technology, đang theo học bằng Cử nhân Khoa học máy tính và chuyên ngành phụ về Kinh tế với kinh nghiệm thực tế về phát triển backend, đồng thời là cộng tác viên tại Marktechpost, nơi anh viết về nghiên cứu AI/ML.

Jean-marc là một nhà điều hành doanh nghiệp AI thành công. Ông lãnh đạo và thúc đẩy tăng trưởng cho các giải pháp hỗ trợ bởi AI và đã thành lập một công ty thị giác máy tính vào năm 2006. Ông là diễn giả được công nhận tại các hội nghị AI và có bằng MBA từ Stanford.
Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với người xem.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.