andyliszewski/webcrawl-mcp

andyliszewski/webcrawl-mcp

от andyliszewski
MCP сервер для веб-скрапинга, поиска и обхода сайтов без headless-браузера. Использует бесплатные библиотеки (trafilatura) для извлечения контента, с опциональным Fallback на Firecrawl для JS-тяжёл...

webcrawl-mcp

PyPI version Python versions License: MIT

A lightweight MCP server that gives Claude Code (or any MCP client) the ability to scrape, search, map, and crawl the web — using free, open-source libraries. Firecrawl is supported as an optional fallback for JS-heavy sites when you have a key.

Why

Most scraping doesn't actually need a headless browser. trafilatura handles the ~80% case (articles, docs, blogs) locally, which is faster and keeps external API usage to a minimum. This server routes the easy stuff through local extraction and only falls back to Firecrawl when content quality is genuinely poor.

Tools

Tool Purpose
webcrawl_scrape Fetch a single URL → {content, source} (markdown + provenance)
webcrawl_search DuckDuckGo search (optionally scrape results, each with provenance)
webcrawl_map Discover same-domain URLs from a starting page
webcrawl_crawl BFS crawl multiple pages (each result includes provenance)

The source field on scraped content is one of static_http, static_http_retry, firecrawl_transport_fallback, or firecrawl_quality_fallback — see Fallback behavior.

Инструменты были проиндексированы:
webcrawl_crawl

Обходит несколько страниц, начиная с URL. Использует BFS, чтобы найти и загрузить страницы на расстоянии не более max_depth ссылок. Соблюдает ограничение частоты запросов.

Webcrawl Crawl

Параметры
  • include_patternsstring[] | null

    Glob patterns for URLs to include (e.g., ["/docs/"])

  • max_depthinteger

    Maximum link depth from start (default: 2)

  • max_pagesinteger

    Maximum number of pages to fetch (default: 10)

  • urlstringобязательный

    Starting URL

webcrawl_map

Находит URL-адреса на сайте. Загружает указанный URL и извлекает все ссылки того же домена.

Webcrawl Map

Параметры
  • limitinteger

    Maximum number of URLs to return (default: 50)

  • urlstringобязательный

    Starting URL to map from

webcrawl_scrape

Загружает URL и извлекает основное содержимое в формате Markdown.

Веб-краулинг и скрейпинг.

Параметры
  • timeoutinteger

    Request timeout in seconds (default: 30)

  • urlstringобязательный

    The URL to scrape

webcrawl_search

Ищет в интернете с помощью DuckDuckGo.

Webcrawl Search

Параметры
  • num_resultsinteger

    Maximum number of results to return (default: 5)

  • querystringобязательный

    Search query string

  • scrape_resultsboolean

    If true, fetch full page content for each result (default: false)

Похожие MCP-сервера

olostep/olostep-mcp-server

olostep/olostep-mcp-server

MCP сервер для веб-скрапинга и поиска через Olostep: извлекает контент в разных форматах и выполняет ИИ-поиск с цитатами, пакетно собирает до 10k URL и обходит сайты с построением карты ссылок.

TypeScript23
Firecrawl MCP

Firecrawl MCP

официальный

MCP сервер для поиска и скрапинга веб-страниц, превращающий живой интернет в чистые данные для ИИ-агентов. Поддерживает навигацию, клики и автономные исследования. Работает в облаке или локально.

JavaScript7431
scraperapi/scraperapi-mcp

scraperapi/scraperapi-mcp

MCP сервер для интеграции с ScraperAPI, позволяющий LLM-агентам легко выполнять веб-скрапинг. Поддерживает рендеринг JavaScript, геотаргетинг и обход блокировок. Полезен разработчикам, работающим с...

Python5
oxylabs/oxylabs-mcp

oxylabs/oxylabs-mcp

MCP инструмент для веб-скрапинга: связывает AI-модели с реальными данными, предлагая универсальный скрапер, парсинг Google/Amazon, AI-извлечение, краулинг и браузерный агент с обходом CAPTCHA и geo-доступом.

Python105
ofershap/mcp-server-scraper

ofershap/mcp-server-scraper

MCP-сервер для веб-скрапинга: извлекает чистый контент с URL в виде markdown, ссылки и метаданные. Использует Mozilla Readability, не требует API-ключей и настроек. Бесплатная альтернатива Firecraw...

TypeScript6
kagisearch/kagimcp

kagisearch/kagimcp

MCP-сервер для поиска и извлечения контента через Kagi API. Поддерживает веб, новости, видео, подкасты, изображения и выгрузку страниц в Markdown. Полезен разработчикам MCP-клиентов.

Python509
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин