oxylabs/oxylabs-mcp

oxylabs/oxylabs-mcp

от oxylabs
MCP инструмент для веб-скрапинга: связывает AI-модели с реальными данными, предлагая универсальный скрапер, парсинг Google/Amazon, AI-извлечение, краулинг и браузерный агент с обходом CAPTCHA и geo-доступом.

Oxylabs + MCP

Oxylabs MCP Server

The missing link between AI models and the real‑world web: one API that delivers clean, structured data from any site.


📖 Overview

The Oxylabs MCP server provides a bridge between AI models and the web. It enables them to scrape any URL, render JavaScript-heavy pages, extract and format content for AI use, manage CAPTCHA, and access geo-restricted web data from 195+ countries.

🛠️ MCP Tools

Oxylabs MCP provides two sets of tools that can be used together or independently:

Oxylabs Web Scraper API Tools
  1. universal_scraper: Uses Oxylabs Web Scraper API for general website scraping;
  2. google_search_scraper: Uses Oxylabs Web Scraper API to extract results from Google Search;
  3. amazon_search_scraper: Uses Oxylabs Web Scraper API to scrape Amazon search result pages;
  4. amazon_product_scraper: Uses Oxylabs Web Scraper API to extract data from individual Amazon product pages.
Oxylabs AI Studio Tools
  1. ai_scraper: Scrape content from any URL in JSON or Markdown format with AI-powered data extraction;
  2. ai_crawler: Based on a prompt, crawls a website and collects data in Markdown or JSON format across multiple pages;
  3. ai_browser_agent: Based on prompt, controls a browser and returns data in Markdown, JSON, HTML, or screenshot formats;
  4. ai_search: Search the web for URLs and their contents with AI-powered content extraction.
Инструменты были проиндексированы:
ai_browser_agentтолько чтение

Запускает браузерного агента и возвращает данные в указанном формате. Этот инструмент полезен, если нужно перемещаться по сайту и выполнять действия. Он позволяет переходить по любому URL, нажимать на ссылки, заполнять формы, прокручивать страницу и так далее. В итоге возвращает данные в указанном формате. Схема требуется только если output_format равен json, csv или toon. 'task_prompt' описывает, чего должен достичь браузерный агент.

Параметры
  • geo_locationstring | null

    Двухбуквенный код страны ISO для прокси браузера.

  • output_formatenum

    Формат вывода. Markdown возвращает полный текст страницы, включая ссылки. Toon (объектная нотация, ориентированная на токены) возвращает данные в формате Toon, который оптимизирован для ИИ-агентов. Для json, csv или toon требуется схема.

  • schemaobject | null

    Схема для скрейпинга. Нужна только если output_format - json, csv или toon.

  • task_promptstringобязательный

    Что должен делать браузерный агент.

  • urlstringобязательный

    URL-адрес, с которого начинается навигация браузерного агента.

ai_crawlerтолько чтение

Инструмент полезен для обхода веб-сайта, начиная с указанного URL, и возврата данных в заданном формате. Схема обязательна только если output_format равен json, csv или toon. 'render_javascript' используется для рендеринга сайтов с большим количеством JavaScript. 'return_sources_limit' используется для ограничения количества возвращаемых источников, например, если вы ожидаете результаты из одного источника, вы можете установить значение 1.

Параметры
  • geo_locationstring | null

    Двухбуквенный ISO-код страны для прокси обхода.

  • output_formatenum

    Формат вывода. Если json, csv или toon, схема обязательна. Markdown возвращает полный текст страницы. CSV возвращает данные в формате CSV. Toon (Token-Oriented Object Notation) возвращает данные в формате Toon, который оптимизирован для ИИ-агентов.

  • render_javascriptboolean

    Следует ли рендерить HTML страницы с помощью javascript. Намного медленнее, поэтому используйте это только для сайтов, которым требуется javascript для рендеринга страницы. Если пользователь не просит использовать это, сначала попробуйте обойти страницу без этого. Если результаты неудовлетворительные, попробуйте использовать это.

  • return_sources_limitinteger

    Максимальное количество возвращаемых источников.

  • schemaobject | null

    JSON-схема для извлечения структурированных данных со скачанных страниц. Нужна только если output_format: json, csv или toon.

  • urlstringобязательный

    URL-адрес, с которого начнется обход.

  • user_promptstringобязательный

    Какую информацию пользователь хочет извлечь из домена.

ai_mapтолько чтение

Создаёт карту URL-адресов веб-сайта.

Параметры
  • allow_external_domainsboolean

    Включать ли URL-адреса внешних доменов.

  • allow_subdomainsboolean

    Следует ли также сопоставлять URL-адреса поддоменов.

  • geo_locationstring | null

    Двухбуквенный код страны ISO для прокси-сервера карт.

  • limitinteger

    Максимальное количество URL-адресов, которые нужно вернуть.

  • max_crawl_depthinteger

    Максимальная глубина обхода.

  • render_javascriptboolean

    Следует ли рендерить HTML страницы с помощью javascript. Намного медленнее, поэтому используйте это только для сайтов, которым требуется javascript для рендеринга страницы. Если пользователь не просит использовать это, сначала попробуйте обойти страницу без этого. Если результаты неудовлетворительные, попробуйте использовать это.

  • search_keywordsstring[] | null

    Ключевые слова для фильтрации путей URL. Ключевые слова сопоставляются по условию ИЛИ. То есть достаточно одного совпавшего ключевого слова, чтобы путь URL подошёл.

  • urlstringобязательный

    URL, с которого начнется сопоставление URL-адресов.

  • user_promptstring | null

    Какие типы URL пользователь хочет найти. Можно использовать вместе с 'search_keywords'.

ai_scraperтолько чтение

Извлекает содержимое веб-страницы и возвращает данные в указанном формате. Schema требуется только если output_format равен json или csv. 'render_javascript' используется для рендеринга сайтов с тяжёлым JavaScript.

Параметры
  • geo_locationstring | null

    Двухбуквенный код страны ISO для использования в прокси для скрапинга.

  • output_formatenum

    Формат вывода. Если json, csv или toon, схема обязательна. Markdown возвращает полный текст страницы. CSV возвращает данные в формате CSV, табличные данные. Toon(Token-Oriented Object Notation) возвращает данные в формате Toon, который оптимизирован для AI-агентов.

  • render_javascriptboolean

    Использовать ли JavaScript для рендеринга HTML страницы. Это значительно медленнее, поэтому используйте его только для сайтов, которым требуется JavaScript для отображения страницы. Если пользователь не просит использовать его, сначала попробуйте извлечь страницу без него. Если результаты неудовлетворительны, попробуйте использовать его.

  • schemaobject | null

    JSON-схема для извлечения структурированных данных со скрейпнутой страницы. Нужна только если output_format равен json, csv или toon.

  • urlstringобязательный

    URL для парсинга

ai_searchтолько чтение

Ищет в интернете по заданному запросу. Параметр 'return_content' возвращает содержимое в формате Markdown для каждого результата поиска. Если 'return_content' установлен в True, вам не нужно использовать ai_scraper для получения содержимого URL-адресов результатов поиска, так как оно уже включено в результаты. Если 'return_content' установлен в True, указывайте меньшее значение 'limit', чтобы уменьшить размер ответа.

Параметры
  • geo_locationstring | null

    Двухбуквенный код страны ISO для поискового прокси.

  • limitinteger

    Максимальное количество результатов для возврата (1-100)

  • querystringобязательный

    Поисковый запрос

  • render_javascriptboolean

    Рендерить ли HTML-страницу с помощью JavaScript. Это намного медленнее, поэтому используйте эту опцию только если пользователь просит об этом. Сначала попробуйте выполнить поиск с отключённой этой опцией.

  • return_contentboolean

    Возвращать ли содержимое markdown результатов поиска.

amazon_product_scraperтолько чтение

Извлекает данные о продуктах Amazon. Поддерживает разбор содержимого, различные типы user agent, параметры домена, геолокации, локали и разные форматы вывода. Поддерживает специфические для Amazon параметры, такие как валюта и получение более точных данных о цене с автовыбором варианта.

Параметры
  • autoselect_variantboolean

    Чтобы получить точные данные о цене/блоке покупки, установите этот параметр в значение true.

  • currencystring | null

    Валюта, в которой будут отображаться цены.

  • domainstring | null

    Локализация доменов для Google. Используйте национальные домены верхнего уровня. Например: - 'co.uk' для Соединенного Королевства - 'us' для Соединенных Штатов - 'fr' для Франции

  • geo_locationstring | null

    Географическое расположение, для которого должен быть адаптирован результат. Используйте коды стран ISO-3166. Примеры: - 'California, United States' - 'Mexico' - 'US' для Соединённых Штатов - 'DE' для Германии - 'FR' для Франции

  • localestring | null

    Установите значение заголовка 'Accept-Language', которое изменяет язык веб-интерфейса вашей страницы поиска Google. Примеры: - 'en-US' для английского, США - 'de-AT' для немецкого, Австрия - 'fr-FR' для французского, Франция

  • output_formatenum | null

    Формат вывода. Работает только когда параметр parse имеет значение false. - links — Наиболее эффективен, когда цель — навигация или поиск конкретных URL. Используйте это в первую очередь, когда нужно найти конкретную страницу на сайте. - md — Лучше всего подходит для извлечения и чтения видимого содержимого, когда вы уже нашли нужную страницу. Используйте это, чтобы получить структурированный контент, который легко читать и обрабатывать. - html — Следует использовать редко, только когда нужна необработанная HTML-структура, код JavaScript или информация о стилях.

  • parseboolean

    Нужно ли парсить результат. Если результат не парсится, применяется параметр output_format.

  • querystringобязательный

    Ключевое слово для поиска.

  • renderstring | null

    Нужно ли использовать безголовый браузер для рендеринга страницы. Например: - 'html', когда для рендеринга страницы требуется браузер.

  • user_agent_typeenum | null

    Тип устройства и браузер, которые будут использоваться для определения значения заголовка User-Agent.

amazon_search_scraperтолько чтение

Парсит результаты поиска Amazon. Поддерживает парсинг контента, разные типы user-agent, пагинацию, параметры домена, геолокации, локали и разные форматы вывода. Поддерживает специфичные для Amazon параметры, такие как идентификатор категории, идентификатор продавца, валюта.

Параметры
  • category_idstring | null

    Ищет товары в конкретном узле просмотра (категории товара).

  • currencystring | null

    Валюта, в которой будут отображаться цены.

  • domainstring | null

    Локализация доменов для Google. Используйте национальные домены верхнего уровня. Например: - 'co.uk' для Соединенного Королевства - 'us' для Соединенных Штатов - 'fr' для Франции

  • geo_locationstring | null

    Географическое расположение, для которого должен быть адаптирован результат. Используйте коды стран ISO-3166. Примеры: - 'California, United States' - 'Mexico' - 'US' для Соединённых Штатов - 'DE' для Германии - 'FR' для Франции

  • localestring | null

    Установите значение заголовка 'Accept-Language', которое изменяет язык веб-интерфейса вашей страницы поиска Google. Примеры: - 'en-US' для английского, США - 'de-AT' для немецкого, Австрия - 'fr-FR' для французского, Франция

  • merchant_idstring | null

    Поиск товаров, проданных конкретным продавцом.

  • output_formatenum | null

    Формат вывода. Работает только когда параметр parse имеет значение false. - links — Наиболее эффективен, когда цель — навигация или поиск конкретных URL. Используйте это в первую очередь, когда нужно найти конкретную страницу на сайте. - md — Лучше всего подходит для извлечения и чтения видимого содержимого, когда вы уже нашли нужную страницу. Используйте это, чтобы получить структурированный контент, который легко читать и обрабатывать. - html — Следует использовать редко, только когда нужна необработанная HTML-структура, код JavaScript или информация о стилях.

  • pagesinteger

    Количество страниц для получения.

  • parseboolean

    Нужно ли парсить результат. Если результат не парсится, применяется параметр output_format.

  • querystringобязательный

    Ключевое слово для поиска.

  • renderstring | null

    Нужно ли использовать безголовый браузер для рендеринга страницы. Например: - 'html', когда для рендеринга страницы требуется браузер.

  • start_pageinteger

    Номер начальной страницы.

  • user_agent_typeenum | null

    Тип устройства и браузер, которые будут использоваться для определения значения заголовка User-Agent.

generate_schemaтолько чтение

Сгенерируй JSON-схему в формате OpenAPI.

Параметры
  • app_nameenumобязательный
  • user_promptstringобязательный
google_search_scraperтолько чтение

Парсит результаты поиска Google. Поддерживает парсинг контента, различные типы user-agent, пагинацию, параметры домена, геолокации, локали и разные форматы вывода.

Параметры
  • ad_modeboolean

    Если это правда, будет использовать источник Google Ads, оптимизированный для платных объявлений.

  • domainstring | null

    Локализация доменов для Google. Используйте национальные домены верхнего уровня. Например: - 'co.uk' для Соединенного Королевства - 'us' для Соединенных Штатов - 'fr' для Франции

  • geo_locationstring | null

    Географическое расположение, для которого должен быть адаптирован результат. Используйте коды стран ISO-3166. Примеры: - 'California, United States' - 'Mexico' - 'US' для Соединённых Штатов - 'DE' для Германии - 'FR' для Франции

  • limitinteger

    Количество результатов на странице.

  • localestring | null

    Установите значение заголовка 'Accept-Language', которое изменяет язык веб-интерфейса вашей страницы поиска Google. Примеры: - 'en-US' для английского, США - 'de-AT' для немецкого, Австрия - 'fr-FR' для французского, Франция

  • output_formatenum | null

    Формат вывода. Работает только когда параметр parse имеет значение false. - links — Наиболее эффективен, когда цель — навигация или поиск конкретных URL. Используйте это в первую очередь, когда нужно найти конкретную страницу на сайте. - md — Лучше всего подходит для извлечения и чтения видимого содержимого, когда вы уже нашли нужную страницу. Используйте это, чтобы получить структурированный контент, который легко читать и обрабатывать. - html — Следует использовать редко, только когда нужна необработанная HTML-структура, код JavaScript или информация о стилях.

  • pagesinteger

    Количество страниц для получения.

  • parseboolean

    Нужно ли парсить результат. Если результат не парсится, применяется параметр output_format.

  • querystringобязательный

    URL-кодированное ключевое слово для поиска.

  • renderstring | null

    Нужно ли использовать безголовый браузер для рендеринга страницы. Например: - 'html', когда для рендеринга страницы требуется браузер.

  • start_pageinteger

    Номер начальной страницы.

  • user_agent_typeenum | null

    Тип устройства и браузер, которые будут использоваться для определения значения заголовка User-Agent.

universal_scraperтолько чтение

Получает содержимое любой веб-страницы. Поддерживает рендеринг в браузере, парсинг некоторых веб-страниц и разные форматы вывода.

Параметры
  • geo_locationstring | null

    Географическое расположение, для которого должен быть адаптирован результат. Используйте коды стран ISO-3166. Примеры: - 'California, United States' - 'Mexico' - 'US' для Соединённых Штатов - 'DE' для Германии - 'FR' для Франции

  • output_formatenum | null

    Формат вывода. Работает только когда параметр parse имеет значение false. - links — Наиболее эффективен, когда цель — навигация или поиск конкретных URL. Используйте это в первую очередь, когда нужно найти конкретную страницу на сайте. - md — Лучше всего подходит для извлечения и чтения видимого содержимого, когда вы уже нашли нужную страницу. Используйте это, чтобы получить структурированный контент, который легко читать и обрабатывать. - html — Следует использовать редко, только когда нужна необработанная HTML-структура, код JavaScript или информация о стилях.

  • renderstring | null

    Нужно ли использовать безголовый браузер для рендеринга страницы. Например: - 'html', когда для рендеринга страницы требуется браузер.

  • urlstringобязательный

    URL веб-сайта для извлечения данных.

  • user_agent_typeenum | null

    Тип устройства и браузер, которые будут использоваться для определения значения заголовка User-Agent.

Похожие MCP-сервера

hyperbrowserai/mcp

hyperbrowserai/mcp

MCP сервер Hyperbrowser для скрапинга, краулинга и извлечения структурированных данных. Включает браузерные агенты OpenAI CUA и Claude. Для веб-автоматизации и сбора данных LLM.

TypeScript789
olostep/olostep-mcp-server

olostep/olostep-mcp-server

MCP сервер для веб-скрапинга и поиска через Olostep: извлекает контент в разных форматах и выполняет ИИ-поиск с цитатами, пакетно собирает до 10k URL и обходит сайты с построением карты ссылок.

TypeScript23
andyliszewski/webcrawl-mcp

andyliszewski/webcrawl-mcp

MCP сервер для веб-скрапинга, поиска и обхода сайтов без headless-браузера. Использует бесплатные библиотеки (trafilatura) для извлечения контента, с опциональным Fallback на Firecrawl для JS-тяжёл...

Python16
scraperapi/scraperapi-mcp

scraperapi/scraperapi-mcp

MCP сервер для интеграции с ScraperAPI, позволяющий LLM-агентам легко выполнять веб-скрапинг. Поддерживает рендеринг JavaScript, геотаргетинг и обход блокировок. Полезен разработчикам, работающим с...

Python5
tavily-ai/tavily-mcp

tavily-ai/tavily-mcp

MCP сервер Tavily предоставляет инструменты для веб-поиска, извлечения данных и построения карты сайта в реальном времени. Помогает разработчикам AI-ассистентов получать актуальную информацию из интернета.

TypeScript2378
executeautomation/playwright-mcp-server

executeautomation/playwright-mcp-server

Сервер для браузерной автоматизации на Playwright. Используется AI-агентами для открытия страниц, скриншотов, веб-скрапинга и выполнения JavaScript в реальном браузере. Отлично подходит для тестиро...

TypeScript5644
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин