eviscerations/whisper-windows-mcp

eviscerations/whisper-windows-mcp

от eviscerations
Локальная транскрипция аудио и видео на Windows через whisper.cpp с GPU-ускорением (Vulkan). Интегрируется с Claude Desktop, поддерживает batch-обработку, субтитры и приватный режим. Ни один файл н...

whisper-windows-mcp

CI

whisper-windows-mcp MCP server

A Windows-native MCP (Model Context Protocol) server that lets Claude Desktop transcribe audio and video files locally using whisper.cpp — with GPU acceleration, multilingual support, and batch processing. All transcription runs locally — no audio, video, or file paths ever leave your machine.

Why does this exist? The popular whisper-mcp package was built for macOS and assumes a Unix environment. It does not work on Windows. This package was written specifically for Windows users who want local AI transcription integrated with Claude Desktop.


What you can do with it

Once installed, you can say things like this directly in Claude Desktop:

  • "Transcribe C:\Users\Me\Downloads\meeting.mp3"
  • "Transcribe this folder of recordings and save each as a text file"
  • "Generate Japanese and English subtitles for this video"
  • "Start a batch transcription of everything in this folder"
  • "How long will it take to transcribe these files?"
  • "Check if GPU acceleration is working"
  • "Transcribe this file in privacy mode"
analyze_media

Анализирует один или несколько медиафайлов с помощью FFprobe перед транскрипцией. Для одного файла: возвращает длительность, размер, кодек и примерное время транскрипции на CPU и GPU. Для папки: сканирует все поддерживаемые медиафайлы и возвращает отсортированную таблицу с той же информацией для каждого. Используйте это, чтобы планировать пакетную работу, оценить, сколько времени займет транскрипция, или проверить, что уже транскрибировано.

Анализирует один или несколько медиафайлов с помощью FFprobe перед транскрипцией. Для одного файла: возвращает длительность, размер, кодек и примерное время транскрипции на CPU и GPU. Для папки: сканирует все поддерживаемые медиафайлы и возвращает отсортированную таблицу с той же информацией для каждого. Используйте это, чтобы планировать пакетную работу, оценить, сколько времени займет транскрипция, или проверить, что уже транскрибировано.

Параметры

  • pathstringобязательный

    Absolute Windows path to a single file or a folder.

  • sort_byenum

    For folder scans: sort order. Defaults to duration (shortest first).

    durationnamesize
check_batch_progress

Проверяет статус batch, запущенного с помощью start_batch. Автоматически переходит к следующему файлу, когда текущий завершается. Возвращает общий прогресс, текущий файл, файлы с ошибками и прошедшее время. Вызывайте повторно, пока batch не покажет завершение.

Проверяет статус batch, запущенного с помощью start_batch. Автоматически переходит к следующему файлу, когда текущий завершается. Возвращает общий прогресс, текущий файл, файлы с ошибками и прошедшее время. Вызывайте повторно, пока batch не покажет завершение.

Параметры

  • batch_idstringобязательный

    Batch ID returned by start_batch.

check_config

Убедитесь, что whisper-cli.exe, модель и FFmpeg доступны. Запустите это сначала, если что-то не работает.

Убедитесь, что whisper-cli.exe, модель и FFmpeg доступны. Запустите это сначала, если что-то не работает.

Параметры

Без параметров.

check_progress

Проверяет статус фоновой задачи транскрипции, запущенной через transcribe_audio (background=true). Возвращает текущий прогресс, затраченное время, временную метку последней обработанной части и сам текст расшифровки по завершении. Вызывайте повторно, пока задача не перейдет в статус "завершено" или "ошибка". ⚠️ Конфиденциальность: расшифрованный текст при завершении обрабатывается API Claude. Если передать privacy_mode=true, при этой проверке вернутся только метаданные — независимо от того, как была запущена задача.

Проверяет статус фоновой задачи транскрипции, запущенной через transcribe_audio (background=true). Возвращает текущий прогресс, затраченное время, временную метку последней обработанной части и сам текст расшифровки по завершении. Вызывайте повторно, пока задача не перейдет в статус "завершено" или "ошибка". ⚠️ Конфиденциальность: расшифрованный текст при завершении обрабатывается API Claude. Если передать privacy_mode=true, при этой проверке вернутся только метаданные — независимо от того, как была запущена задача.

Параметры

  • job_idstringобязательный

    Job ID returned by transcribe_audio when background=true.

  • privacy_modeboolean

    Override privacy mode for this check. true = metadata only. Omit to use the setting from when the job was started.

check_system

Определяет аппаратное обеспечение GPU и проверяет доступность ускорения Vulkan. Сообщает название GPU, объем видеопамяти VRAM, установлен ли бинарный файл Vulkan, и рекомендует лучшую модель Whisper для вашего оборудования.

Определяет аппаратное обеспечение GPU и проверяет доступность ускорения Vulkan. Сообщает название GPU, объем видеопамяти VRAM, установлен ли бинарный файл Vulkan, и рекомендует лучшую модель Whisper для вашего оборудования.

Параметры

Без параметров.

download_model

Скачайте модель Whisper с Hugging Face прямо в вашу директорию models. Принимает название модели (например, large-v3-turbo, medium.en-q5_0) и обрабатывает загрузку автоматически. Загружает только из доверенных пространств имён Hugging Face (ggerganov/whisper.cpp и ggml-org). После загрузки используйте switch_model, чтобы активировать её для текущей сессии.

Скачайте модель Whisper с Hugging Face прямо в вашу директорию models. Принимает название модели (например, large-v3-turbo, medium.en-q5_0) и обрабатывает загрузку автоматически. Загружает только из доверенных пространств имён Hugging Face (ggerganov/whisper.cpp и ggml-org). После загрузки используйте switch_model, чтобы активировать её для текущей сессии.

Параметры

  • model_namestringобязательный

    Model name to download, e.g. 'large-v3-turbo', 'medium.en-q5_0'. Use list_models to see what is already installed.

generate_subtitles

Генерирует файлы субтитров для аудио- или видеофайла с помощью whisper.cpp. Установите language='auto', чтобы автоматически определить язык речи. Установите translate_to_english=true, чтобы также создать файл субтитров с переводом на английский. Поддерживает выходные форматы SRT и WebVTT (VTT). Когда запрошены и исходные, и переведённые субтитры, сохраняется два файла: один на исходном языке и один английский перевод. Загрузите SRT в VLC через Subtitle → Add Subtitle File. VTT работает в веб-плеерах и HTML5-видео. Поддерживает все стандартные форматы, а также .3gp и .ts.

Генерирует файлы субтитров для аудио- или видеофайла с помощью whisper.cpp. Установите language='auto', чтобы автоматически определить язык речи. Установите translate_to_english=true, чтобы также создать файл субтитров с переводом на английский. Поддерживает выходные форматы SRT и WebVTT (VTT). Когда запрошены и исходные, и переведённые субтитры, сохраняется два файла: один на исходном языке и один английский перевод. Загрузите SRT в VLC через Subtitle → Add Subtitle File. VTT работает в веб-плеерах и HTML5-видео. Поддерживает все стандартные форматы, а также .3gp и .ts.

Параметры

  • file_pathstringобязательный

    Absolute Windows path to the file.

  • languagestring

    Language code (e.g. ja, es, fr, de) or 'auto' to detect automatically. Defaults to en.

  • output_formatenum

    srt = SubRip subtitle (default, widest compatibility), vtt = WebVTT (web and HTML5 video).

    srtvtt
  • translate_to_englishboolean

    Also generate an English translation subtitle file alongside the native language file. Only applies when language is not 'en'. Not available in background mode.

  • backgroundboolean

    Run as a detached background job — recommended for files over 10 minutes. Returns a job ID to use with check_progress. translate_to_english is not available in background mode.

  • threadsnumber

    CPU threads. Defaults to 2 of 1.

  • temperaturenumber

    Sampling temperature 0.0–1.0. Default 0.0.

  • promptstring

    Prior context string for domain-specific vocabulary or speaker names.

  • beam_sizenumber

    Beam search width. Higher = more accurate, slower. Default 5.

  • best_ofnumber

    Candidate sequences evaluated. Default 5.

  • diarizeboolean

    Stereo speaker diarization. Requires stereo audio.

  • tinydiarizeboolean

    Mono speaker-turn detection (TinyDiarize). Requires a tdrz model (small.en-tdrz) activated via switch_model.

  • vad_modelstring

    Path to Silero VAD model .bin. Strips silence before transcription.

  • gpu_devicenumber

    GPU/Vulkan device index for multi-GPU systems. Overrides the WHISPER_GPU_DEVICE env default. Check whisper-cli's startup log for the index that lists your target card.

list_models

Перечислите все файлы модели Whisper, установленные в вашей директории моделей. Показывает имя файла, размер, активна ли она в данный момент, статус квантизации и рекомендуемый вариант использования для каждой модели. Без сетевых вызовов - читает только локальную файловую систему.

Перечислите все файлы модели Whisper, установленные в вашей директории моделей. Показывает имя файла, размер, активна ли она в данный момент, статус квантизации и рекомендуемый вариант использования для каждой модели. Без сетевых вызовов - читает только локальную файловую систему.

Параметры

Без параметров.

start_batch

Запускает автоматическую последовательную пакетную транскрипцию всех нетранскрибированных файлов в папке. Сканирует файлы без соответствующего .txt, сортирует по длительности (сначала самые короткие) и обрабатывает их по одному — как фоновые задачи. Каждый файл проверяется после завершения: пустые или подозрительно короткие результаты помечаются. Пакет сам переходит к следующему файлу без опроса, когда каждый файл заканчивается. Возвращает batch ID — используй его с check_batch_progress. ⚠️ Приватность: когда privacy_mode активен, нужно одно подтверждение перед запуском пакета. Все файлы затем обрабатываются без вашего участия. Текст транскрипции не возвращается в API.

Запускает автоматическую последовательную пакетную транскрипцию всех нетранскрибированных файлов в папке. Сканирует файлы без соответствующего .txt, сортирует по длительности (сначала самые короткие) и обрабатывает их по одному — как фоновые задачи. Каждый файл проверяется после завершения: пустые или подозрительно короткие результаты помечаются. Пакет сам переходит к следующему файлу без опроса, когда каждый файл заканчивается. Возвращает batch ID — используй его с check_batch_progress. ⚠️ Приватность: когда privacy_mode активен, нужно одно подтверждение перед запуском пакета. Все файлы затем обрабатываются без вашего участия. Текст транскрипции не возвращается в API.

Параметры

  • folder_pathstringобязательный

    Absolute Windows path to the folder.

  • languagestring

    Language code. Defaults to en.

  • threadsnumber

    CPU threads. Defaults to 2 of 1.

  • output_formatenum

    timestamps = with time codes (default), text = plain. Applies to all files in the batch.

    timestampstext
  • privacy_modeboolean

    Override privacy mode for this batch. When active, requires one confirmation before batch start. All files process unattended with no transcript text returned.

switch_model

Переключает активную модель Whisper для текущей сессии без перезапуска Claude Desktop. Принимает имя файла модели (например, ggml-large-v3-turbo.bin) или полный путь. Модель должна быть уже установлена в вашей директории моделей. Изменение действует в рамках сессии — не сохраняется после перезапуска Claude Desktop.

Переключает активную модель Whisper для текущей сессии без перезапуска Claude Desktop. Принимает имя файла модели (например, ggml-large-v3-turbo.bin) или полный путь. Модель должна быть уже установлена в вашей директории моделей. Изменение действует в рамках сессии — не сохраняется после перезапуска Claude Desktop.

Параметры

  • model_namestringобязательный

    Model filename (e.g. ggml-large-v3-turbo.bin) or full path. Must be a .bin file in the configured models directory.

transcribe_audio

Транскрибирует одно аудио- или видеофайл с помощью whisper.cpp на Windows. Нативно поддерживает mp3 и wav. Автоматически конвертирует mp4, mkv, avi, mov, webm, m4a, flac, ogg и другие через FFmpeg — ручная конвертация не нужна. По умолчанию вывод в формате с временными метками (таймкоды). Для файлов, обработка которых может занять больше 4 минут, установите background=true — задача выполняется в фоне, а для отслеживания используйте check_progress. ⚠️ Конфиденциальность: текст расшифровки, возвращаемый этим инструментом, обрабатывается API Claude. Передайте privacy_mode=true в этот инструмент, чтобы включить режим ответов только с метаданными — текст расшифровки передаваться не будет. Чтобы включить глобально, установите WHISPER_PRIVACY_MODE=true в переменной окружения. Когда режим конфиденциальности активен, перед каждой операцией требуется подтверждение.

Транскрибирует одно аудио- или видеофайл с помощью whisper.cpp на Windows. Нативно поддерживает mp3 и wav. Автоматически конвертирует mp4, mkv, avi, mov, webm, m4a, flac, ogg и другие через FFmpeg — ручная конвертация не нужна. По умолчанию вывод в формате с временными метками (таймкоды). Для файлов, обработка которых может занять больше 4 минут, установите background=true — задача выполняется в фоне, а для отслеживания используйте check_progress. ⚠️ Конфиденциальность: текст расшифровки, возвращаемый этим инструментом, обрабатывается API Claude. Передайте privacy_mode=true в этот инструмент, чтобы включить режим ответов только с метаданными — текст расшифровки передаваться не будет. Чтобы включить глобально, установите WHISPER_PRIVACY_MODE=true в переменной окружения. Когда режим конфиденциальности активен, перед каждой операцией требуется подтверждение.

Параметры

  • file_pathstringобязательный

    Absolute Windows path, e.g. C:\Users\You\Downloads\recording.mp4

  • modelstring

    Override model path. Leave blank to use active model.

  • languagestring

    Language code (e.g. en, ja, es, fr) or 'auto' to detect automatically. Defaults to en.

  • output_formatenum

    timestamps = with time codes (default), text = plain, json = structured, srt = SRT subtitle file, vtt = WebVTT subtitle file, lrc = LRC lyrics/karaoke, csv = CSV with timestamps.

    timestampstextjsonsrtvttlrccsv
  • threadsnumber

    CPU threads. Defaults to 2 of 1.

  • save_to_fileboolean

    Save transcript as .txt next to the source file.

  • backgroundboolean

    Run as a detached background job. Returns a job ID immediately. Use check_progress to monitor. Recommended for files over 10 minutes.

  • privacy_modeboolean

    Override privacy mode for this call. true = metadata only, no transcript text transmitted to API. false = return text (even if WHISPER_PRIVACY_MODE=true globally). Omit to use global WHISPER_PRIVACY_MODE setting. When active, requires confirmation before each operation.

  • temperaturenumber

    Sampling temperature 0.0–1.0. Default 0.0 (deterministic).

  • promptstring

    Prior context string injected before transcription. Improves accuracy for domain-specific vocabulary or speaker names. Example: 'Names: Keemstar, DramaAlert.'

  • condition_on_prev_textboolean

    Re-enable conditioning each segment on its own prior output. Default false.

  • no_speech_tholdnumber

    Confidence threshold below which segments are treated as silence. Default 0.6.

  • beam_sizenumber

    Beam search width. Higher = more accurate but slower. Default 5.

  • best_ofnumber

    Number of candidate sequences to evaluate. Default 5.

  • gpu_devicenumber

    GPU/Vulkan device index for multi-GPU systems. Overrides the WHISPER_GPU_DEVICE env default. Check whisper-cli's startup log for the index that lists your target card.

  • processorsnumber

    Number of parallel processors. Default 1.

  • word_timestampsboolean

    Output one word per timestamped segment. Useful for clip alignment.

  • max_segment_lengthnumber

    Maximum segment length in characters.

  • split_on_wordboolean

    Split segments at word boundaries.

  • diarizeboolean

    Stereo speaker diarization — requires stereo audio with speakers on separate channels.

  • tinydiarizeboolean

    Mono speaker-turn detection (TinyDiarize). Marks '[SPEAKER_TURN]' at speaker changes on single-channel audio. Requires a tdrz model (small.en-tdrz) — download it with download_model and activate with switch_model first.

  • vad_modelstring

    Absolute path to a Silero VAD model .bin file. Strips silence before transcription.

  • offset_tnumber

    Start transcription at this offset in milliseconds.

  • durationnumber

    Process only this many milliseconds of audio from offset_t.

transcribe_batch

Транскрибирует несколько аудио/видео файлов в папке в интерактивном режиме, по одному за раз. Показывает предпросмотр каждой расшифровки и ждёт подтверждения перед продолжением. Сохраняет каждую расшифровку как .txt файл рядом с исходником. Файлы, уже расшифрованные (с соответствующим .txt), помечаются как готовые и пропускаются. Поддерживаемые форматы: mp3, wav, mp4, mkv, avi, mov, webm, m4a, flac, ogg. ПРИМЕЧАНИЕ: для больших пакетных задач без присмотра используйте start_batch. ⚠️ Конфиденциальность: предпросмотр расшифровок обрабатывается API Claude. Установите privacy_mode=true, чтобы скрыть предпросмотр и возвращать только метаданные. Когда режим конфиденциальности активен, требуется подтверждение перед каждым файлом.

Транскрибирует несколько аудио/видео файлов в папке в интерактивном режиме, по одному за раз. Показывает предпросмотр каждой расшифровки и ждёт подтверждения перед продолжением. Сохраняет каждую расшифровку как .txt файл рядом с исходником. Файлы, уже расшифрованные (с соответствующим .txt), помечаются как готовые и пропускаются. Поддерживаемые форматы: mp3, wav, mp4, mkv, avi, mov, webm, m4a, flac, ogg. ПРИМЕЧАНИЕ: для больших пакетных задач без присмотра используйте start_batch. ⚠️ Конфиденциальность: предпросмотр расшифровок обрабатывается API Claude. Установите privacy_mode=true, чтобы скрыть предпросмотр и возвращать только метаданные. Когда режим конфиденциальности активен, требуется подтверждение перед каждым файлом.

Параметры

  • folder_pathstringобязательный

    Absolute Windows path to the folder.

  • file_indexnumber

    Which file to process (1-based). Omit to list files first.

  • languagestring

    Language code. Defaults to en.

  • threadsnumber

    CPU threads. Defaults to 2 of 1.

  • recursiveboolean

    Include subfolders. Defaults to false.

  • output_formatenum

    timestamps = with time codes (default), text = plain.

    timestampstext
  • privacy_modeboolean

    Override privacy mode for this call. When active, requires confirmation before each file and returns metadata only.

whisper_server

Запустить, остановить или проверить состояние постоянного сервера модели whisper. Когда сервер работает, активная модель остаётся в VRAM, и каждый вызов transcribe_audio / transcribe_batch обслуживается через localhost без перезагрузки — это устраняет затраты на загрузку модели для каждого файла (значительное ускорение для множества коротких файлов). ⚠️ Постоянная модель занимает GPU VRAM на всё время жизни сервера, поэтому запускайте его осознанно, сделайте свою работу, а затем остановите, чтобы вернуть GPU другим приложениям. Пока сервер работает, фоновые задачи, start_batch, generate_subtitles, а также lrc/csv или расширенные параметры для отдельных вызовов недоступны (им нужен одноразовый CLI, и они будут конкурировать за GPU) — остановите сервер, чтобы их использовать. Привязан только к localhost.

Запустить, остановить или проверить состояние постоянного сервера модели whisper. Когда сервер работает, активная модель остаётся в VRAM, и каждый вызов transcribe_audio / transcribe_batch обслуживается через localhost без перезагрузки — это устраняет затраты на загрузку модели для каждого файла (значительное ускорение для множества коротких файлов). ⚠️ Постоянная модель занимает GPU VRAM на всё время жизни сервера, поэтому запускайте его осознанно, сделайте свою работу, а затем остановите, чтобы вернуть GPU другим приложениям. Пока сервер работает, фоновые задачи, start_batch, generate_subtitles, а также lrc/csv или расширенные параметры для отдельных вызовов недоступны (им нужен одноразовый CLI, и они будут конкурировать за GPU) — остановите сервер, чтобы их использовать. Привязан только к localhost.

Параметры

  • actionenumобязательный

    start = launch the server with the active model resident; stop = shut it down and free VRAM; status = report whether it is running, the resident model, port, and uptime.

    startstopstatus

Другие проверенные MCP-сервера

PSPDFKit/nutrient-document-engine-mcp-server

PSPDFKit/nutrient-document-engine-mcp-server

официальный

MCP-сервер для обработки документов на естественном языке. Подключает AI-агентов к извлечению текста, редактированию и рецензированию PDF, а также безопасному сокрытию конфиденциальных данных. Поле...

TypeScript61
IvanMurzak/Unity-MCP

IvanMurzak/Unity-MCP

MCP сервер связывает AI-агентов с Unity, автоматизируя создание сцен, генерацию кода и отладку. Работает внутри собранной игры — для динамических NPC и дебага. Полезен геймдев-разработчикам.

C#3597
api7/apisix-mcp

api7/apisix-mcp

официальный

MCP-сервер для управления APISIX через Admin API с помощью естественного языка. Позволяет просматривать, создавать и удалять ресурсы (роуты, сервисы, upstreams, плагины) через AI-клиенты. Полезен р...

TypeScript38
esignaturescom/mcp-server-esignatures

esignaturescom/mcp-server-esignatures

официальный

MCP сервер eSignatures.com: создание и редактирование Markdown-контрактов, управление подписантами и шаблонами. Полезен разработчикам и AI-агентам для гибких workflows электронных подписей.

Python38
weaviate/mcp-server-weaviate

weaviate/mcp-server-weaviate

официальный

Встроенный MCP сервер Weaviate даёт AI-агентам гибридный поиск, управление коллекциями и объектами прямо через REST API. Полезен разработчикам, работающим с векторными базами данных.

162
jau123/MeiGen-AI-Design-MCP

jau123/MeiGen-AI-Design-MCP

MCP-сервер для генерации изображений и видео через ИИ. Работает в Claude Code, Cursor и других AI-инструментах, поддерживает 9 моделей и 1446 промптов. Параллельная генерация, управление стилями и ...

TypeScript1584
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин