talonicdev/talonic-mcp

talonicdev/talonic-mcp

от talonicdev
MCP сервер для извлечения структурированных данных из документов (PDF, сканы, инвойсы) с валидацией по схеме и оценками уверенности. Полезен разработчикам и AI-агентам, работающим с реальными документами в сложных процессах.

@talonic/mcp

Official Talonic MCP server. Give any AI agent the ability to extract structured, schema-validated data from any document — PDFs, scans, invoices, contracts, forms — via the Model Context Protocol.

talonic-mcp MCP server smithery badge

Status: stable, listed on the official MCP Registry as io.github.talonicdev/talonic-mcp. Nine tools and two resources, verified end-to-end against production (including the Claude.ai hosted connector). Runs as a local stdio process for desktop/IDE clients and as a hosted Streamable HTTP server at mcp.talonic.com for Claude.ai connectors.


What you get

One install gives an agent the whole document-extraction workflow:

Tool What it does
talonic_extract Extract schema-validated JSON from a document, with per-field confidence scores. The primary tool.
talonic_request_upload Get a browser upload link for files too large to pass through a hosted connector (e.g. Claude.ai). The robust path for real-world documents.
talonic_to_markdown OCR a document to clean markdown.
talonic_search Omnisearch across documents, fields, sources, and schemas.
talonic_filter Filter documents by extracted field values (eq, gt, between, contains, …).
talonic_get_document Fetch a document's metadata, processing status, and links.
talonic_list_schemas List saved schemas (with definitions).
talonic_save_schema Save a reusable schema to the workspace.
talonic_get_balance Read credit balance, EUR value, burn rate, and runway for budget-aware behaviour.
Инструменты были проиндексированы:
talonic_claim_agent_task

Захватывает доступную задачу стадии Agent или повторно захватывает её после истечения срока аренды. ИСПОЛЬЗУЙТЕ, КОГДА: готовы обработать задачу. Сохраните возвращённые execution_epoch и lease_expires_at. НЕ ДЛЯ: простой проверки работы (используйте talonic_get_agent_task) или продления активной аренды (используйте talonic_heartbeat_agent_task). Конфликтующая активная попытка захвата возвращает HTTP 409. Успешный захват возвращает полезную нагрузку задачи.

Задача агента по претензиям

Параметры
  • task_idstringобязательный

    Agent task UUID.

talonic_extractвнешний мир

Превращает ЛЮБОЙ документ в структурированный JSON, прошедший проверку схемы. Инструмент по умолчанию, когда нужно извлечь данные ИЗ неструктурированного файла: PDF, скан, изображение, DOCX, письмо или фото. Возвращает запрошенные поля с оценками уверенности для каждого поля. ИСПОЛЬЗОВАТЬ КОГДА: 'извлечь данные из этого документа', 'превратить этот PDF в JSON', 'вытащить поля из этого файла', 'распарсить этот скан / форму / выписку / чек / отчёт' - для ЛЮБОГО типа документов, обычных (счёт, договор) или необычных. Если задача - неструктурированный документ -> структурированные данные, это ответ. НЕ ДЛЯ: полный обычный текст (используйте talonic_to_markdown) · поиск документов (используйте talonic_search / talonic_filter). ПО ИМЕНИ: если пользователь называет файл, сначала вызовите talonic_search, чтобы получить его document_id, затем вызовите этот инструмент. АРГУМЕНТЫ: определите нужные поля с помощью встроенной schema (JSON Schema, например {type:'object',properties:{vendor_name:{type:'string'}}}) ИЛИ сохранённого schema_id, но не одновременно. Ещё не знаете поля? Установите auto_schema:true, чтобы Talonic обнаружил их (открытый захват) и вернул предлагаемую схему, которую можно доработать. Укажите РОВНО ОДИН источник документа: document_id (самый дешёвый, документ рабочей области), file_url (публичный URL) или file_data+filename (только небольшие локальные файлы). СТОИМОСТЬ: дёшево за вызов, есть бесплатный тариф - можно свободно использовать; проверяйте бюджет через talonic_get_balance. ВОЗВРАЩАЕТ: данные (JSON), confidence.overall и confidence.fields (значения ниже 0.7 считайте требующими проверки), метаданные документа, extraction_id.

Извлекает данные из документа

Параметры
  • auto_schemaboolean

    Open capture: when true, extract WITHOUT providing a schema — Talonic discovers the document's fields and returns them plus a suggested schema you can refine and reuse. Use this when you don't yet know the fields. Mutually exclusive with schema and schema_id.

  • document_idstring

    ID of a document already in the workspace, to re-extract with a new schema.

  • file_datastring

    Base64-encoded file bytes. Recommended path when the agent already has the file in memory (e.g., the user attached a PDF to the conversation). Pair with filename so MIME type can be inferred. Works regardless of where the file lives on disk.

  • filenamestring

    Original filename including extension, e.g. 'invoice.pdf'. Used to infer MIME type when uploading via file_data. Required when file_data is provided.

  • file_pathstring

    Local path to a document file. Only works if the MCP server has read access to that path. In sandboxed chat clients (Claude Desktop, Cowork) where uploads land in a host-owned directory, use file_data instead.

  • file_urlstring

    URL to a document file. The Talonic API fetches it server-side. Use this for documents already on the public web.

  • include_markdownboolean

    Include OCR-converted markdown in the response alongside structured data.

  • include_provenanceboolean

    Include per-field provenance (source_text, section, page) showing where each value was found in the document.

  • instructionsstring

    Natural-language guidance for the extractor, e.g. 'Focus on the billing section. Amounts are in EUR.'

  • schemaobject

    Inline schema definition. REQUIRED unless schema_id is provided. Recommended: full JSON Schema {type:'object', properties:{...}}. Also accepted: flat key-type map {field_name:'string', amount:'number'}. Mutually exclusive with schema_id.

  • schema_idstring

    ID of a saved schema. REQUIRED unless schema is provided. Accepts UUID or SCH-XXXXXXXX short id from talonic_list_schemas. Mutually exclusive with schema.

talonic_filterтолько чтение

Находит документы по значениям извлечённых полей с помощью составляемых условий (например, «счета, где total > 1000»). ИСПОЛЬЗУЙ, КОГДА: нужны условия на основе значений извлечённых полей — сравнения чисел/дат/текста или проверки наличия. НЕ ДЛЯ: полнотекстового / смыслового поиска (используй talonic_search) · поиска одного документа по id (используй talonic_get_document). АРГУМЕНТЫ: conditions[] (AND-логика). Каждый = РОВНО ОДИН из field (каноническое имя) или field_id (UUID), operator и обычно value. Операторы: eq, neq, gt, gte, lt, lte, between (требует value И value_to), contains, is_empty / is_not_empty (без value). value/value_to — string|number|boolean в соответствии с типом поля (для дат — ISO YYYY-MM-DD). ТЕКСТОВЫЕ ФИЛЬТРЫ: для eq/contains/is_not_empty по текстовому полю просто ПОПРОБУЙ естественное имя поля ('currency', 'vendor_name') — имена разрешаются на сервере, и неразрешённое поле попадает в warnings[], а не в ошибку. НЕ блокируйся на предварительном определении поля; search-first требуется только для числовых операторов. ЧИСЛОВАЯ ЗАЩИТА: gt/gte/lt/lte/between работают только если dataType поля равен 'number'. Сначала вызови talonic_search и проверь dataType; числовая операция над строковым полем возвращает ноль совпадений. Если в ответе есть warnings[], покажи их пользователю — не делай повторных попыток молча. ВОЗВРАЩАЕТ: data[] (подходящие документы со значениями полей), total, warnings[].

Фильтровать документы Talonic

Параметры
  • conditionsobject[]обязательный

    One or more filter conditions, AND-ed together.

  • limitinteger

    Results per page. Default 50 server-side.

  • pageinteger

    Page number for pagination.

  • searchstring

    Optional free-text search applied alongside the filters.

  • sortobject

    Optional sort by a field.

  • source_connection_idstring

    Optionally scope to a specific source connection.

talonic_get_agent_taskтолько чтение

Получает неизменяемый снимок входных данных, инструкции и объявленный контракт вывода для одной задачи этапа агента. Это раскрытие проверяется. ИСПОЛЬЗУЙТЕ, КОГДА: осматриваете задачу из списка перед принятием решения, обрабатывать ли её. НЕ ДЛЯ: получения задачи (используйте talonic_claim_agent_task) или возврата результатов (используйте talonic_submit_agent_task). АРГУМЕНТЫ: task_id. ВОЗВРАЩАЕТ: metadata, input_snapshot, output_contract, instructions и timeout_fallthrough.

Get Agent Task

Параметры
  • task_idstringобязательный

    Agent task UUID.

talonic_get_balanceтолько чтение

Читает баланс кредитов Talonic рабочего пространства, его стоимость в евро, тариф, расход за 30 дней и прогнозируемый остаток работы. ИСПОЛЬЗУЙТЕ КОГДА: пользователь спрашивает о кредитах/бюджете, или перед большой пакетной обработкой, когда нужно подтвердить наличие запаса. НЕ ДЛЯ: стоимости одного вызова извлечения (она возвращается в ответе talonic_extract). АРГУМЕНТЫ: нет. ВОЗВРАЩАЕТ: balance_credits, balance_eur, tier, burn_rate_30d_credits, projected_runway_days (-1 = недавнего использования нет), tier_resets_at.

Получает баланс кредитов Talonic

Параметры

Без параметров.

talonic_get_documentтолько чтение

Извлекает метаданные и статус обработки одного документа из рабочего пространства. ИСПОЛЬЗУЙТЕ, КОГДА: «расскажи о документе X» или для опроса статуса после talonic_request_upload, пока файл не будет готов. НЕ ДЛЯ: полного текста (используйте talonic_to_markdown) · извлечённых полей (используйте talonic_extract). ПО ИМЕНИ: если пользователь называет файл, сначала вызовите talonic_search, чтобы получить его document_id, затем вызовите этот инструмент. АРГУМЕНТЫ: document_id. ВОЗВРАЩАЕТ: filename, pages, type_detected, language и status. Жизненный цикл статуса: pending_upload -> uploading -> queued -> extracting -> completed. Дождитесь completed перед вызовом talonic_extract для только что загруженного документа. Конечные статусы ошибок: ocr_failed, extraction_failed, error — прекратите опрос и сообщите об ошибке пользователю, если появится любой из них. Чтобы прочитать текст документа, вызовите talonic_to_markdown с этим id.

Получает Talonic Document

Параметры
  • document_idstringобязательный

    The Talonic document ID. Get this from a previous talonic_extract or talonic_search response.

talonic_get_pricingтолько чтение

Читает машиночитаемый каталог цен на кредиты Talonic: фиксированные ставки за единицу, чтобы вы могли предсказать расходы ДО запуска чего-либо. ИСПОЛЬЗУЙТЕ КОГДА: оцениваете стоимость запланированной задачи по извлечению/структурированию/сопоставлению или отвечаете на вопрос о цене. Публичный - работает без траты кредитов. НЕ ДЛЯ: текущего баланса рабочего пространства (используйте talonic_get_balance) или того, что оно уже потратило (используйте talonic_get_usage). АРГУМЕНТЫ: нет. ВОЗВРАЩАЕТ: currency, credits_per_eur, multipliers (например, batch 0.5x) и units[] - каждый { unit, label, credits, eur, free }.

Получает Talonic Pricing

Параметры

Без параметров.

talonic_get_usageтолько чтение

Читает потребление кредитов по функциям рабочего пространства за скользящее окно: куда на самом деле ушли кредиты. ИСПОЛЬЗОВАТЬ КОГДА: пользователь спрашивает, на что он потратил кредиты, или вы хотите увидеть, какая функция (извлечение, структурирование, интеллектуальные операции) доминирует в затратах. НЕ ДЛЯ: остатка на балансе (используйте talonic_get_balance) или тарифов за единицу (используйте talonic_get_pricing). ПАРАМЕТРЫ: days (необязательный, по умолчанию 30, ограничение 1-365). ВОЗВРАЩАЕТ: period_days, total_credits и by_function[] - каждый { operation_type, operations, credits }, сначала наибольшие затраты.

Get Talonic Usage

Параметры
  • daysinteger

    Trailing window in days (default 30).

talonic_heartbeat_agent_task

Продлевает аренду на закреплённую задачу этапа агента. КОГДА ИСПОЛЬЗОВАТЬ: обработка может продолжаться после lease_expires_at; отправьте сердцебиение до истечения срока, используя значение epoch из закрепления. НЕ ДЛЯ: получения задачи (используйте talonic_claim_agent_task) или отправки завершённых результатов (используйте talonic_submit_agent_task). АРГУМЕНТЫ: task_id и execution_epoch. Устаревшие или чужие закрепления возвращают HTTP 409.

Heartbeat Agent Task

Параметры
  • execution_epochintegerобязательный

    Execution epoch returned by the successful claim. Stale epochs are rejected.

  • task_idstringобязательный

    Agent task UUID.

talonic_list_agent_tasksтолько чтение

Перечисляет задачи стадии Agent, видимые для этого учётного доступа рабочей области Talonic. ИСПОЛЬЗУЙТЕ КОГДА: ищете внешнюю работу агента для обработки; начните со статуса 'available'. НЕ ДЛЯ: чтения неизменяемой полезной нагрузки задачи (используйте talonic_get_agent_task) или взятия аренды (используйте talonic_claim_agent_task). АРГУМЕНТЫ: необязательные status, limit и cursor. ВОЗВРАЩАЕТ: только метаданные и pagination.next_cursor.

Список задач агента

Параметры
  • cursorstring

    Opaque cursor from pagination.next_cursor.

  • limitinteger

    Page size (default 50).

  • statusenum

    Optional task-status filter.

talonic_list_schemasтолько чтение

Перечисляет сохранённые схемы в рабочем пространстве в виде компактных сводок (id, short_id, name, description, version, field_count). ИСПОЛЬЗУЕТСЯ КОГДА: «what schemas do I have» или для поиска переиспользуемой схемы перед извлечением. НЕ ДЛЯ: одноразового извлечения со встроенной схемой (вызывайте talonic_extract напрямую). АРГУМЕНТЫ: нет. ВОЗВРАЩАЕТ: data[] со сводками схем. Полные определения полей здесь опущены — для их получения прочитайте ресурс talonic://schemas. Передавайте id/short_id схемы в talonic_extract как schema_id.

Выводит список схем Talonic

Параметры

Без параметров.

talonic_request_upload

Получает ссылку для загрузки в браузере, которую пользователь открывает, чтобы добавить файл в своё рабочее пространство. Возвращает ссылку и предварительно выделенный document_id. ИСПОЛЬЗУЙ, КОГДА: пользователь хочет загрузить документ, и вы не можете передать его напрямую - размещённые/песочные клиенты (ChatGPT, Claude.ai) или файлы слишком велики для аргументов вызова инструмента. НЕ ДЛЯ: документа, уже находящегося в рабочем пространстве (используйте его document_id) · файла, уже доступного по публичному URL (используйте file_url в talonic_extract). АРГУМЕНТЫ: имя файла (с расширением). ВОЗВРАЩАЕТ: upload_url, document_id, expires_at. После загрузки пользователя опрашивайте talonic_get_document с этим document_id, пока статус не станет 'completed', затем вызывайте talonic_extract. Если статус становится ocr_failed, extraction_failed или error, прекратите опрос и сообщите об ошибке пользователю.

Запрашивает загрузку файла.

Параметры
  • filenamestringобязательный

    The name of the file being uploaded, including extension (e.g. 'invoice.pdf'). Used to pre-allocate the document and infer MIME type.

talonic_save_schema

Сохраняет повторно используемую схему в рабочую область для применения в будущих извлечениях. ИСПОЛЬЗУЙТЕ, КОГДА: пользователь подтверждает схему/шаблон, который хочет повторно использовать в разных документах. НЕ ДЛЯ: однократного извлечения (передайте схему напрямую в talonic_extract). АРГУМЕНТЫ: name; definition — JSON-схема ({type:'object',properties:{...}}) или плоская map {field:'type'}. ВОЗВРАЩАЕТ: сохранённую схему с id и short_id. Передайте любой из них в talonic_extract как schema_id.

Сохранить Talonic Schema

Параметры
  • definitionobjectобязательный

    Schema definition. Most reliable: full JSON Schema {type:'object', properties:{...}}. Also accepted: a flat key-type map {field_name:'string', amount:'number'} which the API normalises.

  • descriptionstring

    Optional description of what this schema extracts and when to use it.

  • namestringобязательный

    Human-readable name for the schema, e.g. 'Standard Invoice'.

talonic_searchтолько чтение

Находит документы, поля, схемы или источники в рабочем пространстве. Один вызов возвращает ранжированные результаты по всем типам. ПОИСК ИДЁТ ПО ТОЧНОМУ КЛЮЧЕВОМУ СЛОВУ, а не по смыслу. Запрашивайте ОДНИМ коротким термином в единственном числе или точным именем файла: 'invoice', 'bank statement', 'sample-invoice.pdf'. Предложения ('documents related to invoices') и множественное число ('invoices') возвращают пустой результат. Если поиск ничего не дал, повторите с более коротким ключевым словом в единственном числе, прежде чем делать вывод, что в рабочем пространстве ничего нет. ИСПОЛЬЗУЙТЕ, КОГДА: пользователь называет или описывает документ без идентификатора, или вам нужен document_id или имя фильтруемого поля перед вызовом extract / to_markdown / get_document / filter. НЕ ДЛЯ: структурированных фильтров вида «поле-значение» (например, 'amount > 1000' — для них используйте talonic_filter). АРГУМЕНТЫ: query (короткое точное ключевое слово); опционально limit. ВОЗВРАЩАЕТ: documents[], fields[]/fieldMatches[] (только записи с filterable: true работают в talonic_filter), schemas[], sources[]. Используйте id из documents[], чтобы работать с именованным файлом.

Ищет в Talonic Workspace

Параметры
  • limitinteger

    Maximum results per entity type. Default: 5. Increase for broader exploration.

  • querystringобязательный

    ONE short, SINGULAR keyword or an exact filename — 'invoice', 'insurance certificate', 'sample-invoice.pdf'. Matching is literal: sentences and plurals return empty.

talonic_submit_agent_task

Отправляет заявленные поля вывода для захваченной задачи на этапе Agent и возобновляет приостановленный документ. ИСПОЛЬЗУЙТЕ, КОГДА: обработка завершена и все требуемые выходные данные в output_contract готовы. НЕ ДЛЯ: незаявленные поля или частичное обслуживание аренды (используйте talonic_heartbeat_agent_task). АРГУМЕНТЫ: task_id, execution_epoch, outputs, привязанные точно по ключу заявленного поля, и опциональное summary. Платформа проверяет все поля и типы транзакционно перед записью чего-либо.

Отправляет задачу агенту

Параметры
  • execution_epochintegerобязательный

    Execution epoch returned by the successful claim. Stale epochs are rejected.

  • outputsobjectобязательный

    Output field key to { value, confidence?, reasoning? }. Use only declared fields.

  • summarystring

    Optional result summary, up to 4,000 characters.

  • task_idstringобязательный

    Agent task UUID.

talonic_to_markdownвнешний мир

Получает текст документа в Markdown, преобразованный с помощью OCR. ИСПОЛЬЗУЙТЕ, КОГДА: пользователь хочет получить полный текст - 'что здесь написано', краткое содержание или перевод документа. НЕ ДЛЯ: конкретных структурированных полей (используйте talonic_extract со схемой). ПО ИМЕНИ: если пользователь указывает имя файла, сначала вызовите talonic_search, чтобы получить его document_id, затем вызовите этот. АРГУМЕНТЫ: предпочтительнее document_id (документ из рабочего пространства - один дешёвый вызов). В противном случае file_url, или file_data+filename для небольших локальных файлов - укажите ровно один. Ввод файла сначала загружает документ и расходует кредиты; document_id не расходует. ВОЗВРАЩАЕТ: document_id и markdown (полный текст).

Преобразует документ в Markdown

Параметры
  • document_idstring

    The Talonic document id whose markdown you want. Get this from a previous talonic_extract or talonic_search response.

  • file_datastring

    Base64-encoded file bytes. Recommended path when the agent already has the file in memory (e.g., the user attached a PDF to the conversation). Pair with filename so MIME type can be inferred.

  • filenamestring

    Original filename including extension, e.g. 'invoice.pdf'. Used to infer MIME type when uploading via file_data. Required when file_data is provided.

  • file_pathstring

    Local path to a document file. Only works if the MCP server has read access to that path. In sandboxed chat clients (Claude Desktop, Cowork) use file_data instead.

  • file_urlstring

    URL to a document file. The Talonic API fetches it server-side.

Похожие MCP-сервера

NameetP/pdfmux

NameetP/pdfmux

pdfmux — самоисцеляющееся извлечение PDF с постраничной оценкой уверенности. Альтернатива LlamaParse для RAG-пайплайнов и AI-агентов. Маршрутизирует страницы между 5 движками + LLM, переизвлекает с...

Python82
PSPDFKit/nutrient-document-engine-mcp-server

PSPDFKit/nutrient-document-engine-mcp-server

официальный

MCP-сервер для обработки документов на естественном языке. Подключает AI-агентов к извлечению текста, редактированию и рецензированию PDF, а также безопасному сокрытию конфиденциальных данных. Поле...

TypeScript62
linxule/mineru-mcp

linxule/mineru-mcp

MCP сервер для парсинга документов через API MinerU. Извлекает текст, таблицы и формулы из PDF, DOC, изображений с точностью 90%. Пакетная обработка до 200 файлов, OCR на 109 языках. Полезен для интеграции парсинга в ИИ-ассистенты.

JavaScript9
toolstem/toolstem-sec-mcp-server

toolstem/toolstem-sec-mcp-server

MCP сервер для извлечения сигналов из SEC EDGAR: инсайдерские сделки, 13D-активизм и материальные события 8-K. Пять готовых инструментов возвращают структурированные данные без API-ключа, оплата за...

TypeScript1
AbdelStark/bitcoin-mcp

AbdelStark/bitcoin-mcp

MCP-сервер для интеграции AI-агентов с Bitcoin и Lightning Network. Генерирует ключи, проверяет адреса, декодирует транзакции, запрашивает блокчейн и работает с Lightning-инвойсами. Полезен разрабо...

TypeScript76
plagtech/spraay-x402-mcp

plagtech/spraay-x402-mcp

Сервер предоставляет 148 инструментов по запросу (pay-per-call) для DeFi, AI, платежей, свопов, payroll и других операций. AI-агенты (Claude, Cursor) платят за вызов в USDC по x402 — без API-ключей...

JavaScript2
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин