NameetP/pdfmux

NameetP/pdfmux

от nameetp
pdfmux — самоисцеляющееся извлечение PDF с постраничной оценкой уверенности. Альтернатива LlamaParse для RAG-пайплайнов и AI-агентов. Маршрутизирует страницы между 5 движками + LLM, переизвлекает с...

pdfmux

CI PyPI Python 3.11+ License: MIT Downloads

Self-healing PDF extraction with per-page confidence scoring. Open-source LlamaParse alternative for RAG pipelines, MCP server for Claude Desktop, LangChain + LlamaIndex loaders. Ranked #2 on opendataloader-bench (0.900).

The only PDF extractor that audits its own output. Catches blank pages, scrambled columns, broken tables — re-extracts them with a stronger backend. So your LLM gets clean data, not silent garbage. Routes each page to the best of 5 rule-based backends + BYOK LLM fallback (Gemini / Claude / GPT-4o / Ollama). One CLI. One API. Zero config.

pdfmux terminal demo

PDF ──> pdfmux router ──> best extractor per page ──> audit ──> re-extract failures ──> Markdown / JSON / chunks
            |
            ├─ PyMuPDF         (digital text, 0.01s/page)
            ├─ OpenDataLoader  (complex layouts, 0.05s/page)
            ├─ RapidOCR        (scanned pages, CPU-only)
            ├─ Docling         (tables, 97.9% TEDS)
            ├─ Surya           (heavy OCR fallback)
            ├─ Marker          (academic papers, neural)
            ├─ Mistral OCR     ($0.002/page, 96.6% tables)
            └─ YOUR LLM        (Gemini / Gemma 4 / Claude / GPT-4o / Ollama / Mistral — BYOK via YAML)
У этого сервера пока нет списка инструментов.

Похожие MCP-сервера

talonicdev/talonic-mcp

talonicdev/talonic-mcp

MCP сервер для извлечения структурированных данных из документов (PDF, сканы, инвойсы) с валидацией по схеме и оценками уверенности. Полезен разработчикам и AI-агентам, работающим с реальными документами в сложных процессах.

TypeScript5
apify/mcp-server-rag-web-browser

apify/mcp-server-rag-web-browser

официальный

MCP сервер подключает AI агентов к вебу через RAG Web Browser Actor. Выполняет поиск в Google, извлекает страницы и возвращает чистый Markdown. Идеально для RAG пайплайнов и LLM, которым нужны свежие данные из интернета.

JavaScript208
teradata/teradata-mcp-server

teradata/teradata-mcp-server

Подключает AI-агентов напрямую к Teradata для запросов, профилирования данных, семантических слоёв и RAG-пайплайнов. MCP сервер с хуками для аудита, контролем лимитов строк и enterprise-безопасностью. Идеально дата-инженерам, DBA и разработчикам ИИ.

Python56
pomazanbohdan/memory-mcp-1file

pomazanbohdan/memory-mcp-1file

Высокопроизводительный MCP-сервер на Rust для AI-агентов. Обеспечивает семантическую память, граф знаний и индексацию кода. Работает полностью локально — один бинарник без внешних БД и облака. Подх...

Rust24
AlekseiMarchenko/central-intelligence

AlekseiMarchenko/central-intelligence

MCP сервер Central Intelligence даёт AI-агентам долговременную память: сохраняйте факты и контекст между сессиями, делитесь знаниями между инструментами. Инструменты запоминания, поиска и контекста работают с Claude Code, Cursor и другими. Данные возвращаются дословно, без перезаписи.

TypeScript3
PrinceGabriel-lgtm/freshcontext-mcp

PrinceGabriel-lgtm/freshcontext-mcp

FreshContext — контекстный слой для AI-агентов: оценивает свежесть и релевантность данных между поиском и рассуждением. Решает проблему устаревшего контекста в RAG-пайплайнах. Полезен разработчикам...

TypeScript11
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин