olostep/olostep-mcp-server

olostep/olostep-mcp-server

от olostep
MCP сервер для веб-скрапинга и поиска через Olostep: извлекает контент в разных форматах и выполняет ИИ-поиск с цитатами, пакетно собирает до 10k URL и обходит сайты с построением карты ссылок.

Olostep MCP Server

Docker Hub npm version License: ISC

A Model Context Protocol (MCP) server implementation that integrates with Olostep for web scraping, content extraction, and search capabilities. To set up Olostep MCP Server, you need to have an API key. You can get the API key by signing up on the Olostep website.

Features

  • Scrape website content in HTML, Markdown, JSON or Plain Text (with optional parsers)
  • Parser-based web search with structured results
  • AI Answers with citations and optional JSON-shaped outputs
  • Batch scraping of up to 10k URLs
  • Autonomous site crawling from a start URL
  • Website URL discovery and mapping (with include/exclude filters)
  • Country-specific request routing for geo-targeted content
  • Configurable wait times for JavaScript-heavy websites
  • Comprehensive error handling and reporting
  • Simple API key configuration

Installation

There are multiple ways to connect to the Olostep MCP Server. Choose the one that best fits your workflow.

☁️ Remote Endpoint (Recommended)

The simplest way — no local installation required. Connect directly to our hosted MCP server:

Инструменты были проиндексированы:
answers

Отвечает на фактологический вопрос с помощью веб-поиска, опционально оформляет ответ в виде плоского JSON-объекта с полями (возвращает с источниками и цитатами). Лучше всего подходит для ограниченного фактологического ответа (например, год основания компании, текущая цена продукта). Он НЕ надёжен для перечисления актуального списка со страницы (например, «последние N записей в блоге с заголовками и датами»). Для этого используйте create_map или get_webpage_content для страницы и прочитайте результаты.

Параметры
  • jsonstring | object

    Optional shape for the answer: a flat JSON object of the fields you want. Example: { "book_title": "", "author": "", "release_date": "" }. Keep it flat. Deeply nested shapes or long lists are unreliable.

  • taskstringобязательный

    Question or task to answer using web data.

batch_scrape_urls

Соберите КОНКРЕТНЫЙ, ИЗВЕСТНЫЙ список URL (обычно с разных доменов). Не используйте этот инструмент для сканирования веб-сайтов — если пользователь хочет собрать целый сайт или «просканировать» домен, используйте create_crawl. Используйте этот инструмент только когда у вас уже есть явный список URL для сбора (например, пользователь предоставляет CSV с URL, или вам нужно собрать несвязанные страницы). Немедленно возвращает batch_id. Используйте get_batch_results с batch_id для получения собранного содержимого после завершения пакета (около 5–8 мин). Установите wait_for_completion_seconds для автоматического опроса.

Параметры
  • countrystring

    Optional country code for location-specific scraping.

  • output_formatenum

    Choose format for all URLs. Default: "markdown".

  • parserstring

    Optional parser ID for specialized extraction (e.g. @olostep/google-search).

  • urlsstring | object[]

    Array of URLs to scrape — plain URL strings, or objects with "url" and optional "custom_id".

  • urls_to_scrapeobject[]

    Alias for urls.

  • wait_before_scrapinginteger

    Wait time in milliseconds before scraping each URL.

  • wait_for_completion_secondsinteger

    Seconds to wait for batch completion. If >0, polls every 10s until done or timeout, then returns status. Use 0 to return immediately with batch_id (then call get_batch_results later). Recommended: 60 for batches <50 URLs, 300–600 for 50–1k URLs, 0 for larger batches (poll separately).

create_crawl

ПРЕДПОЧТИТЕЛЬНЫЙ инструмент для обхода веб-сайта. Используйте его, когда пользователь говорит «обойти», «извлечь весь сайт», «получить все страницы с сайта» или хочет несколько страниц с одного домена. Это ПРАВИЛЬНЫЙ инструмент для любой задачи по обходу всего сайта. НЕ ИСПОЛЬЗУЙТЕ `batch_scrape_urls` для обхода - этот инструмент только для случаев, когда у вас уже есть конкретный список несвязанных URL-адресов с разных доменов. Запускает АСИНХРОННЫЙ обход, который автономно находит и извлекает страницы, переходя по ссылкам с начального URL. Возвращает crawl_id - обход выполняется в фоновом режиме. Затем вы ОБЯЗАНЫ вызвать get_crawl_results с полученным crawl_id, чтобы опросить статус и получить извлечённые страницы. НЕ вызывайте get_batch_results с crawl_id - обходы и пакеты — это разные ресурсы.

Параметры
  • countrystring

    Optional country code for location-specific crawling.

  • max_pagesinteger

    Maximum number of pages to crawl. Set to 1 to scrape only the start URL.

  • output_formatenum

    Format for scraped content. Default: "markdown".

  • parserstring

    Optional parser ID for specialized content extraction.

  • start_urlstring

    Alias for url.

  • urlstring

    Starting URL for the crawl.

create_map

Получает СПИСОК URL-адресов на веб-сайте (только обнаружение URL — НЕ извлекает содержимое). Используйте, когда пользователь хочет получить список ссылок: «покажи все URL-адреса на этом сайте», «составь карту этого сайта» или когда нужно показать пользователю подходящие URL-адреса перед извлечением их подмножества. Предпочитайте create_crawl, если цель — извлечь весь сайт — он обнаруживает И извлекает за один рабочий процесс. Используйте это только тогда, когда сам список URL является результатом.

Параметры
  • exclude_url_patternsstring[]

    Optional glob patterns to exclude (e.g., "/admin/**").

  • include_url_patternsstring[]

    Optional glob patterns to include (e.g., "/blog/**").

  • search_querystring

    Optional search query to filter URLs (e.g., "blog").

  • top_ninteger

    Optional limit for number of URLs returned.

  • urlstring

    Website URL to extract links from.

  • website_urlstring

    Alias for url.

get_batch_results

Получает статус и извлечённое содержимое для пакетной задачи. Передайте batch_id, возвращённый batch_scrape_urls. Если задача завершена, возвращает извлечённое содержимое для каждого URL. Если всё ещё in_progress, возвращает текущий статус, чтобы вы могли вызвать его снова позже.

Параметры
  • batch_idstringобязательный

    The batch_id (or id) returned from batch_scrape_urls.

  • formatsenum[]

    Content formats to retrieve per URL. Default: ["markdown"].

  • items_limitinteger

    Max number of items to retrieve content for (1-100). Default: 20.

get_crawl_results

Получает статус и собранные страницы для задания обхода. Передайте crawl_id, полученный от create_crawl. Если обход всё ещё выполняется (in_progress), возвращает текущий статус, чтобы вы могли вызвать его снова позже (опрашивайте каждые ~10 секунд). После завершения возвращает список обнаруженных страниц с их собранным содержимым в запрошенных форматах. Это ОБЯЗАТЕЛЬНЫЙ компаньон для create_crawl - create_crawl только запускает асинхронное задание, а этот инструмент - то, как вы на самом деле получаете содержимое.

Параметры
  • crawl_idstringобязательный

    The crawl_id (or id) returned from create_crawl.

  • cursorinteger

    Pagination cursor for list-pages. Default: 0 (first page).

  • formatsenum[]

    Content formats to retrieve per page. Default: ["markdown"].

  • items_limitinteger

    Max number of pages to retrieve content for (1-100). Default: 20.

  • search_querystring

    Optional filter to rank/select pages by relevance to a query.

get_webpage_content

Получает содержимое веб-страницы в формате Markdown.

Параметры
  • countrystring

    Residential country to load the request from (e.g., US, CA, GB). Optional.

  • urlstring

    The URL of the webpage to scrape.

  • url_to_scrapestring

    Alias for url.

  • wait_before_scrapinginteger

    Time to wait in milliseconds before starting the scrape.

get_website_urls

Ищет и извлекает релевантные URL-адреса с веб-сайта (только обнаружение URL — НЕ извлекает содержимое). Используйте это только когда пользователь хочет отфильтрованный список ссылок, соответствующий поисковому запросу. НЕ используйте это как подготовку к scraping — если пользователь хочет выполнить scrape/crawl сайта, используйте create_crawl напрямую.

Параметры
  • search_querystringобязательный

    The search query to sort URLs by.

  • urlstringобязательный

    The URL of the website to map.

scrape_website

Извлекает содержимое из одного URL. Поддерживает множество форматов и рендеринг JavaScript.

Параметры
  • countrystring

    Optional country code (e.g., US, GB, CA) for location-specific scraping.

  • llm_extractobject

    Defines what to pull when output_format is "json". Provide a schema (a JSON-schema object of the fields you want, e.g. { "type": "object", "properties": { "title": { "type": "string" } } }) and/or a prompt. Required for JSON output unless a parser is given.

  • output_formatenum

    Output format. "markdown" (default), "html", and "text" need no extra config. "json" returns STRUCTURED data and requires either a parser OR an llm_extract schema describing the fields to pull. Do not request "json" on its own.

  • parserstring

    Optional parser ID for specialized extraction (e.g., "@olostep/amazon-product").

  • urlstring

    The URL of the website you want to scrape.

  • url_to_scrapestring

    Alias for url.

  • wait_before_scrapinginteger

    Wait time in milliseconds before scraping (0-10000). Useful for dynamic content.

search_web

Ищет в интернете по заданному запросу и возвращает структурированные результаты (без ИИ, на основе парсинга).

Параметры
  • countrystring

    Optional country code for localized results (e.g., US, GB).

  • querystringобязательный

    Search query

Похожие MCP-сервера

andyliszewski/webcrawl-mcp

andyliszewski/webcrawl-mcp

MCP сервер для веб-скрапинга, поиска и обхода сайтов без headless-браузера. Использует бесплатные библиотеки (trafilatura) для извлечения контента, с опциональным Fallback на Firecrawl для JS-тяжёл...

Python16
scraperapi/scraperapi-mcp

scraperapi/scraperapi-mcp

MCP сервер для интеграции с ScraperAPI, позволяющий LLM-агентам легко выполнять веб-скрапинг. Поддерживает рендеринг JavaScript, геотаргетинг и обход блокировок. Полезен разработчикам, работающим с...

Python5
tavily-ai/tavily-mcp

tavily-ai/tavily-mcp

MCP сервер Tavily предоставляет инструменты для веб-поиска, извлечения данных и построения карты сайта в реальном времени. Помогает разработчикам AI-ассистентов получать актуальную информацию из интернета.

TypeScript2378
ofershap/mcp-server-scraper

ofershap/mcp-server-scraper

MCP-сервер для веб-скрапинга: извлекает чистый контент с URL в виде markdown, ссылки и метаданные. Использует Mozilla Readability, не требует API-ключей и настроек. Бесплатная альтернатива Firecraw...

TypeScript6
oxylabs/oxylabs-mcp

oxylabs/oxylabs-mcp

MCP инструмент для веб-скрапинга: связывает AI-модели с реальными данными, предлагая универсальный скрапер, парсинг Google/Amazon, AI-извлечение, краулинг и браузерный агент с обходом CAPTCHA и geo-доступом.

Python105
Crawleo/Crawleo-MCP

Crawleo/Crawleo-MCP

Crawleo MCP-сервер даёт AI-ассистентам веб-поиск и краулинг в реальном времени: извлекайте данные с любых URL, выбирайте формат (HTML, Markdown, текст), настраивайте страну и устройство. Без хранен...

JavaScript11
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин