andyliszewski/webcrawl-mcp

andyliszewski/webcrawl-mcp

от andyliszewski
MCP сервер для веб-скрапинга, поиска и обхода сайтов без headless-браузера. Использует бесплатные библиотеки (trafilatura) для извлечения контента, с опциональным Fallback на Firecrawl для JS-тяжёл...

webcrawl-mcp

PyPI version Python versions License: MIT

A lightweight MCP server that gives Claude Code (or any MCP client) the ability to scrape, search, map, and crawl the web — using free, open-source libraries. Firecrawl is supported as an optional fallback for JS-heavy sites when you have a key.

Why

Most scraping doesn't actually need a headless browser. trafilatura handles the ~80% case (articles, docs, blogs) locally, which is faster and keeps external API usage to a minimum. This server routes the easy stuff through local extraction and only falls back to Firecrawl when content quality is genuinely poor.

Tools

Tool Purpose
webcrawl_scrape Fetch a single URL → {content, source} (markdown + provenance)
webcrawl_search DuckDuckGo search (optionally scrape results, each with provenance)
webcrawl_map Discover same-domain URLs from a starting page
webcrawl_crawl BFS crawl multiple pages (each result includes provenance)

The source field on scraped content is one of static_http, static_http_retry, firecrawl_transport_fallback, or firecrawl_quality_fallback — see Fallback behavior.

webcrawl_crawl

Обходит несколько страниц, начиная с URL. Использует BFS, чтобы найти и загрузить страницы на расстоянии не более max_depth ссылок. Соблюдает ограничение частоты запросов.

Обходит несколько страниц, начиная с URL. Использует BFS, чтобы найти и загрузить страницы на расстоянии не более max_depth ссылок. Соблюдает ограничение частоты запросов.

Параметры

  • urlstringобязательный

    Starting URL

  • max_pagesinteger

    Maximum number of pages to fetch (default: 10)

  • max_depthinteger

    Maximum link depth from start (default: 2)

  • include_patternsany

    Glob patterns for URLs to include (e.g., ["*/docs/*"])

webcrawl_map

Находит URL-адреса на сайте. Загружает указанный URL и извлекает все ссылки того же домена.

Находит URL-адреса на сайте. Загружает указанный URL и извлекает все ссылки того же домена.

Параметры

  • urlstringобязательный

    Starting URL to map from

  • limitinteger

    Maximum number of URLs to return (default: 50)

webcrawl_scrape

Загружает URL и извлекает основное содержимое в формате Markdown.

Загружает URL и извлекает основное содержимое в формате Markdown.

Параметры

  • urlstringобязательный

    The URL to scrape

  • timeoutinteger

    Request timeout in seconds (default: 30)

webcrawl_search

Поищите в интернете с помощью DuckDuckGo.

Поищите в интернете с помощью DuckDuckGo.

Параметры

  • querystringобязательный

    Search query string

  • num_resultsinteger

    Maximum number of results to return (default: 5)

  • scrape_resultsboolean

    If true, fetch full page content for each result (default: false)

Другие проверенные MCP-сервера

designcomputer/mysql_mcp_server

designcomputer/mysql_mcp_server

MCP инструмент для безопасной работы AI-агентов с MySQL. Выполняет SQL-запросы, возвращает схему таблиц и выборки данных. Помогает разработчикам и аналитикам контролировать доступ, избегая SQL-инъекций и используя SSL/TLS.

Python1333
Google MCP

Google MCP

официальный

Сборник MCP серверов от Google для интеграции сервисов Google Cloud (BigQuery, Cloud SQL и др.) с AI-агентами. Включает удаленные и open-source серверы для развертывания. Полезен разработчикам агентных систем.

4407
pinecone-io/assistant-mcp

pinecone-io/assistant-mcp

официальный

MCP-сервер на Rust для получения данных от Pinecone Assistant. Укажите API-ключ и лимит результатов. Интеграция с ИИ-инструментами через Docker. Для разработчиков поисковых ассистентов.

Rust45
mediar-ai/screenpipe

mediar-ai/screenpipe

Screenpipe - MCP сервер для локального ИИ, запоминающего всё на экране и в аудио. Записывает и распознаёт текст и речь. Ищите виденное и слышанное естественным языком. Плагины (Pipes) автоматизируют действия на основе активности. Полная приватность.

Rust20300
alchemy/alchemy-mcp-server

alchemy/alchemy-mcp-server

официальный

MCP-сервер для AI-агентов, работающий с блокчейн-данными Alchemy. Позволяет запрашивать цены токенов, NFT, историю транзакций и балансы на нескольких сетях, а также отправлять транзакции и выполнят...

TypeScript88
GreptimeTeam/greptimedb-mcp-server

GreptimeTeam/greptimedb-mcp-server

официальный

GreptimeDB MCP-сервер для AI-ассистентов - выполняет SQL, TQL и RANGE-запросы к open-source базе наблюдаемости, объединяющей метрики, логи и трейсы. Встроенная безопасность: read-only, маскировка д...

Python28
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин