tan-yong-sheng/ai-vision-mcp

tan-yong-sheng/ai-vision-mcp

от tan-yong-sheng
MCP-сервер для ИИ-анализа изображений и видео через Google Gemini и Vertex AI. Поддерживает детекцию объектов, дизайн-аудит с WCAG-проверкой, сравнение снимков и анализ YouTube-роликов. Пригодится ...

AI Vision MCP Server

A powerful Model Context Protocol (MCP) server that provides AI-powered image and video analysis using Google Gemini and Vertex AI models.

Features

  • Dual Provider Support: Choose between Google Gemini API and Vertex AI
  • Multimodal Analysis: Support for both image and video content analysis
  • Flexible File Handling: Upload via multiple methods (URLs, local files, base64)
  • Storage Integration: Built-in Google Cloud Storage support
  • Comprehensive Validation: Zod-based data validation throughout
  • Error Handling: Robust error handling with retry logic and circuit breakers
  • TypeScript: Full TypeScript support with strict type checking

Quick Start

Pre-requisites

You could choose either to use google provider or vertex_ai provider. For simplicity, google provider is recommended.

Below are the environment variables you need to set based on your selected provider. (Note: It’s recommended to set the timeout configuration to more than 5 minutes for your MCP client).

(i) Using Google AI Studio Provider

analyze_image

Анализирует изображение с помощью AI-моделей компьютерного зрения. Поддерживает URL, данные в base64 и локальные пути к файлам.

Analyze Image

Анализирует изображение с помощью AI-моделей компьютерного зрения. Поддерживает URL, данные в base64 и локальные пути к файлам.

Параметры

  • imageSourcestringобязательный

    Image source - can be a URL, base64 data (data:image/...), or local file path

  • promptstringобязательный

    The prompt describing how you want to compare the images. If the task is **front-end or UI comparison**, the prompt you provide must be: "Compare the given screenshots and describe differences in layout structure, component arrangement, color scheme, typography, and visual hierarchy. Pay attention to common sections such as the navbar, header, footer, and main content areas to identify style or layout inconsistencies." + your additional requirements. For **other tasks**, the prompt you provide must clearly describe what to compare, identify, or analyze between the images.

  • modeenum

    Analysis mode: general (default), palette (extract design tokens), hierarchy (analyze visual hierarchy), components (catalog UI components)

    generalpalettehierarchycomponents
  • optionsobject
analyze_video

Анализирует видео с помощью AI-моделей компьютерного зрения. Поддерживает URL и локальные пути к файлам.

Analyze Video

Анализирует видео с помощью AI-моделей компьютерного зрения. Поддерживает URL и локальные пути к файлам.

Параметры

  • videoSourcestringобязательный

    Video source - can be a URL or local file path

  • promptstringобязательный

    The prompt describing what you want to know about the video.

  • optionsobject
compare_images

Сравнивает несколько изображений с помощью AI-моделей компьютерного зрения. Поддерживает URL-адреса, данные в формате base64 и локальные пути к файлам.

Compare Images

Сравнивает несколько изображений с помощью AI-моделей компьютерного зрения. Поддерживает URL-адреса, данные в формате base64 и локальные пути к файлам.

Параметры

  • imageSourcesstring[]обязательный

    Array of image sources (URLs, base64 data, or file paths) - minimum 2 images. Maximum determined by MAX_IMAGES_FOR_COMPARISON environment variable (default: 4)

  • promptstringобязательный

    The prompt describing how you want to compare the images. If the task is **front-end or UI consistency**, the prompt you provide must specify what to evaluate — such as layout alignment, component structure, spacing, typography, color consistency, and visual hierarchy. Pay special attention to shared sections like the **navbar**, **header**, **footer**, and **main content areas** to identify layout shifts or inconsistent styles between versions. For **other tasks**, the prompt you provide must clearly describe what aspects to compare or analyze — such as visual differences, content changes, design variations, or quality degradation.

  • optionsobject
detect_objects_in_image

Обнаруживает объекты на изображении с помощью AI-моделей компьютерного зрения и создаёт размеченные изображения с ограничивающими рамками. Поддерживает URL, данные в base64 и локальные пути к файлам. Обработка файлов: явно указанный filePath → точный путь, иначе → временная директория. Использует оптимизированные параметры по умолчанию для обнаружения объектов.

Detect Objects in Image

Обнаруживает объекты на изображении с помощью AI-моделей компьютерного зрения и создаёт размеченные изображения с ограничивающими рамками. Поддерживает URL, данные в base64 и локальные пути к файлам. Обработка файлов: явно указанный filePath → точный путь, иначе → временная директория. Использует оптимизированные параметры по умолчанию для обнаружения объектов.

Параметры

  • imageSourcestringобязательный

    Image source - can be a URL, base64 data (data:image/...), or local file path

  • promptstringобязательный

    Text prompt describing what to detect or recognize in the image. Avoid including any instructions about output structure or formatting — these are automatically managed by the workflow.

  • outputFilePathstring

    Optional explicit output path for the annotated image. If provided, the image is saved to this exact path. Relative paths are resolved against the MCP server's current working directory.

  • viewportWidthnumber

    Optional logical viewport width (for web screenshots). Used to distinguish between actual image dimensions and logical viewport size.

  • viewportHeightnumber

    Optional logical viewport height (for web screenshots). Used to distinguish between actual image dimensions and logical viewport size.

Другие проверенные MCP-сервера

VictoriaMetrics-Community/mcp-victorialogs

VictoriaMetrics-Community/mcp-victorialogs

официальный

MCP-сервер для VictoriaLogs. Предоставляет AI-агентам доступ к чтению логов, метрик, полей и встроенной документации через LogsQL-запросы. Упрощает отладку и мониторинг для инженеров.

Go90
tavily-ai/tavily-mcp

tavily-ai/tavily-mcp

MCP сервер Tavily предоставляет инструменты для веб-поиска, извлечения данных и построения карты сайта в реальном времени. Помогает разработчикам AI-ассистентов получать актуальную информацию из интернета.

JavaScript2231
atilaahmettaner/tradingview-mcp

atilaahmettaner/tradingview-mcp

MCP сервер для рыночных данных и технического анализа — акции, крипта, форекс и фьючерсы. Включает скринеры, бэктестинг и 30+ инструментов. Работает с Claude, ChatGPT, Cursor — всё в одном сервере.

Python3576
skill-seekers/Skill_Seekers

skill-seekers/Skill_Seekers

MCP-сервер Skill Seekers преобразует документацию, GitHub, PDF, видео и 18 типов источников в структурированные знания для AI-систем. Подходит для создания AI-навыков (Claude, Gemini, OpenAI), RAG-...

Python14495
isaacphi/mcp-language-server

isaacphi/mcp-language-server

MCP-сервер, запускающий языковой сервер (LSP) для LLM. Дает ИИ доступ к семантике кода: определения, ссылки, переименование, диагностика. Поддерживает Go, Rust, Python, TypeScript, C/C++. Упрощает ...

Go1570
oraios/serena

oraios/serena

Serena — MCP-сервер для AI-агентов, который даёт семантический поиск, рефакторинг и отладку кода на уровне IDE. Работает с символьными операциями, ускоряет агентов в больших проектах.

Python26580
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин