eviscerations/whisper-windows-mcp

eviscerations/whisper-windows-mcp

от eviscerations
Локальная транскрипция аудио и видео на Windows через whisper.cpp с GPU-ускорением (Vulkan). Интегрируется с Claude Desktop, поддерживает batch-обработку, субтитры и приватный режим. Ни один файл н...

whisper-windows-mcp

CI

whisper-windows-mcp MCP server

A Windows-native MCP (Model Context Protocol) server that lets Claude Desktop transcribe audio and video files locally using whisper.cpp — with GPU acceleration, multilingual support, and batch processing. All transcription runs locally — no audio, video, or file paths ever leave your machine.

Why does this exist? The popular whisper-mcp package was built for macOS and assumes a Unix environment. It does not work on Windows. This package was written specifically for Windows users who want local AI transcription integrated with Claude Desktop.


What you can do with it

Once installed, you can say things like this directly in Claude Desktop:

  • "Transcribe C:\Users\Me\Downloads\meeting.mp3"
  • "Transcribe this folder of recordings and save each as a text file"
  • "Generate Japanese and English subtitles for this video"
  • "Start a batch transcription of everything in this folder"
  • "How long will it take to transcribe these files?"
  • "Check if GPU acceleration is working"
  • "Transcribe this file in privacy mode"
Инструменты были проиндексированы:
analyze_media

Анализирует один или несколько медиафайлов с помощью FFprobe перед транскрипцией. Для одного файла: возвращает длительность, размер, кодек и примерное время транскрипции на CPU и GPU. Для папки: сканирует все поддерживаемые медиафайлы и возвращает отсортированную таблицу с той же информацией для каждого. Используйте это, чтобы планировать пакетную работу, оценить, сколько времени займет транскрипция, или проверить, что уже транскрибировано.

Параметры
  • pathstringобязательный

    Абсолютный путь Windows к одному файлу или папке.

  • sort_byenum

    Для сканирования папок: порядок сортировки. По умолчанию — по длительности (сначала самые короткие).

check_batch_progress

Проверяет статус batch, запущенного с помощью start_batch. Автоматически переходит к следующему файлу, когда текущий завершается. Возвращает общий прогресс, текущий файл, файлы с ошибками и прошедшее время. Вызывайте повторно, пока batch не покажет завершение.

Параметры
  • batch_idstringобязательный

    Batch ID, возвращаемый функцией start_batch.

check_config

Убедитесь, что whisper-cli.exe, модель и FFmpeg доступны. Запустите это сначала, если что-то не работает.

Параметры

Без параметров.

check_progress

Проверяет статус фоновой задачи транскрипции, запущенной через transcribe_audio (background=true). Возвращает текущий прогресс, затраченное время, временную метку последней обработанной части и сам текст расшифровки по завершении. Вызывайте повторно, пока задача не перейдет в статус "завершено" или "ошибка". ⚠️ Конфиденциальность: расшифрованный текст при завершении обрабатывается API Claude. Если передать privacy_mode=true, при этой проверке вернутся только метаданные — независимо от того, как была запущена задача.

Параметры
  • job_idstringобязательный

    Идентификатор задания, возвращаемый transcribe_audio при background=true.

  • privacy_modeboolean

    Переопределяет режим конфиденциальности для этой проверки. true = только метаданные. Не указывайте параметр, чтобы использовать настройку, заданную при запуске задания.

check_system

Определяет аппаратное обеспечение GPU и проверяет доступность ускорения Vulkan. Сообщает название GPU, объем видеопамяти VRAM, установлен ли бинарный файл Vulkan, и рекомендует лучшую модель Whisper для вашего оборудования.

Параметры

Без параметров.

download_model

Скачивает модель Whisper с Hugging Face напрямую в вашу директорию models. Принимает имя модели (например, large-v3-turbo, medium.en-q5_0) и обрабатывает загрузку автоматически. Скачивает только из доверенных пространств имён Hugging Face (ggerganov/whisper.cpp и ggml-org). После загрузки используйте switch_model, чтобы активировать её для текущего сеанса.

Параметры
  • model_namestringобязательный

    Название модели для загрузки, например 'large-v3-turbo', 'medium.en-q5_0'. Используйте list_models, чтобы посмотреть, что уже установлено.

generate_subtitles

Генерирует файлы субтитров для аудио- или видеофайла с помощью whisper.cpp. Установите language='auto', чтобы автоматически определить язык речи. Установите translate_to_english=true, чтобы также создать файл субтитров с переводом на английский. Поддерживает выходные форматы SRT и WebVTT (VTT). Когда запрошены и исходные, и переведённые субтитры, сохраняется два файла: один на исходном языке и один английский перевод. Загрузите SRT в VLC через Subtitle → Add Subtitle File. VTT работает в веб-плеерах и HTML5-видео. Поддерживает все стандартные форматы, а также .3gp и .ts.

Параметры
  • backgroundboolean

    Запускается как отдельная фоновая задача, рекомендуется для файлов длительностью более 10 минут. Возвращает идентификатор задания для использования с check_progress. translate_to_english недоступен в фоновом режиме.

  • beam_sizenumber

    Ширина beam search. Больше = точнее, медленнее. По умолчанию 5.

  • best_ofnumber

    Оценивает последовательности-кандидаты. По умолчанию: 5.

  • diarizeboolean

    Выполняет диаризацию говорящих по стереозаписи. Требует стереоаудио.

  • file_pathstringобязательный

    Абсолютный путь к файлу в Windows.

  • gpu_devicenumber

    Индекс устройства GPU/Vulkan для систем с несколькими GPU. Переопределяет значение по умолчанию из переменной окружения WHISPER_GPU_DEVICE. Посмотри в логе запуска whisper-cli — там указан индекс, соответствующий нужной видеокарте.

  • languagestring

    Код языка (например, ja, es, fr, de) или 'auto' для автоматического определения. По умолчанию: en.

  • output_formatenum

    srt = субтитры SubRip (по умолчанию, максимальная совместимость), vtt = WebVTT (веб и видео HTML5).

  • promptstring

    Строка предшествующего контекста для лексики предметной области или имён говорящих.

  • temperaturenumber

    Температура сэмплирования (по умолчанию 0.7).

  • threadsnumber

    Потоки CPU. По умолчанию: 2 из 1.

  • tinydiarizeboolean

    Детекция смены говорящего в моно (TinyDiarize). Требует модель tdrz (small.en-tdrz), активируемую через switch_model.

  • translate_to_englishboolean

    Также создаёт файл субтитров с английским переводом вместе с файлом на родном языке. Применимо только когда язык не 'en'. Недоступно в фоновом режиме.

  • vad_modelstring

    Путь к .bin-файлу модели Silero VAD. Удаляет тишину перед транскрибацией.

list_models

Выводит список всех файлов моделей Whisper, установленных в вашей директории models. Показывает имя файла, размер, активна ли модель в данный момент, статус квантования и рекомендованный вариант использования для каждой модели. Не выполняет сетевых вызовов — читает только локальную файловую систему.

Параметры

Без параметров.

start_batch

Запускает автоматическую последовательную пакетную транскрипцию всех нетранскрибированных файлов в папке. Сканирует файлы без соответствующего .txt, сортирует по длительности (сначала самые короткие) и обрабатывает их по одному — как фоновые задачи. Каждый файл проверяется после завершения: пустые или подозрительно короткие результаты помечаются. Пакет сам переходит к следующему файлу без опроса, когда каждый файл заканчивается. Возвращает batch ID — используй его с check_batch_progress. ⚠️ Приватность: когда privacy_mode активен, нужно одно подтверждение перед запуском пакета. Все файлы затем обрабатываются без вашего участия. Текст транскрипции не возвращается в API.

Параметры
  • folder_pathstringобязательный

    Абсолютный путь Windows к папке.

  • languagestring

    Код языка. По умолчанию en.

  • output_formatenum

    timestamps = с таймкодами (по умолчанию), text = обычный текст. Применяется ко всем файлам в пакете.

  • privacy_modeboolean

    Переопределяет режим конфиденциальности для этого пакета. Когда активен, требует одного подтверждения перед началом пакетной обработки. Все файлы обрабатываются без участия оператора, и текст транскрипта не возвращается.

  • threadsnumber

    Потоки CPU. По умолчанию: 2 из 1.

switch_model

Переключает активную модель Whisper для текущей сессии без перезапуска Claude Desktop. Принимает имя файла модели (например, ggml-large-v3-turbo.bin) или полный путь. Модель должна быть уже установлена в вашей директории моделей. Изменение действует в рамках сессии — не сохраняется после перезапуска Claude Desktop.

Параметры
  • model_namestringобязательный

    Имя файла модели (например, ggml-large-v3-turbo.bin) или полный путь. Должен быть файлом .bin в настроенной директории моделей.

transcribe_audio

Транскрибирует одно аудио- или видеофайл с помощью whisper.cpp на Windows. Нативно поддерживает mp3 и wav. Автоматически конвертирует mp4, mkv, avi, mov, webm, m4a, flac, ogg и другие через FFmpeg — ручная конвертация не нужна. По умолчанию вывод в формате с временными метками (таймкоды). Для файлов, обработка которых может занять больше 4 минут, установите background=true — задача выполняется в фоне, а для отслеживания используйте check_progress. ⚠️ Конфиденциальность: текст расшифровки, возвращаемый этим инструментом, обрабатывается API Claude. Передайте privacy_mode=true в этот инструмент, чтобы включить режим ответов только с метаданными — текст расшифровки передаваться не будет. Чтобы включить глобально, установите WHISPER_PRIVACY_MODE=true в переменной окружения. Когда режим конфиденциальности активен, перед каждой операцией требуется подтверждение.

Параметры
  • backgroundboolean

    Запускается как отдельное фоновое задание. Сразу возвращает ID задания. Используйте check_progress для отслеживания. Рекомендуется для файлов, обработка которых занимает более 10 минут.

  • beam_sizenumber

    Ширина поиска луча. Больше значение — точнее, но медленнее. По умолчанию: 5.

  • best_ofnumber

    Число кандидатных последовательностей для оценки. По умолчанию 5.

  • condition_on_prev_textboolean

    Повторно включить обусловливание каждого сегмента на основе его собственного предыдущего вывода. По умолчанию false.

  • diarizeboolean

    Стерео-разделение говорящих - требует стерео-аудио с говорящими на отдельных каналах.

  • durationnumber
  • file_pathstringобязательный

    Абсолютный путь Windows, например C:\Users\You\Downloads\recording.mp4

  • gpu_devicenumber

    Индекс устройства GPU/Vulkan для систем с несколькими GPU. Переопределяет значение по умолчанию из переменной окружения WHISPER_GPU_DEVICE. Посмотри в логе запуска whisper-cli — там указан индекс, соответствующий нужной видеокарте.

  • languagestring

    Код языка (например, en, ja, es, fr) или 'auto' для автоматического определения. По умолчанию — en.

  • max_segment_lengthnumber

    Максимальная длина сегмента в символах.

  • modelstring

    Переопределите путь модели. Оставьте пустым, чтобы использовать активную модель.

  • no_speech_tholdnumber

    Порог уверенности, ниже которого сегменты считаются тишиной. По умолчанию 0.6.

  • offset_tnumber

    Начните транскрипцию с этого смещения в миллисекундах.

  • output_formatenum

    timestamps = с временными метками (по умолчанию), text = обычный текст, json = структурированный JSON, srt = файл субтитров SRT, vtt = файл субтитров WebVTT, lrc = текст песни/караоке LRC, csv = CSV с временными метками.

  • privacy_modeboolean

    Переопределите режим конфиденциальности для этого вызова. true = только метаданные, текст транскрипции не передаётся в API. false = возвращать текст (даже если WHISPER_PRIVACY_MODE=true глобально). Опустите, чтобы использовать глобальную настройку WHISPER_PRIVACY_MODE. При активном режиме требуется подтверждение перед каждой операцией.

  • processorsnumber

    Количество параллельных процессоров. По умолчанию 1.

  • promptstring

    Внедряет предыдущий контекст перед транскрипцией. Повышает точность для специфичной лексики или имён говорящих. Пример: «Имена: Keemstar, DramaAlert».

  • save_to_fileboolean

    Сохраняет стенограмму как .txt рядом с исходным файлом.

  • split_on_wordboolean

    Разбивайте сегменты по границам слов.

  • temperaturenumber

    Температура сэмплирования 0.0–1.0. По умолчанию 0.0 (детерминированный).

  • threadsnumber

    Потоки CPU. По умолчанию: 2 из 1.

  • tinydiarizeboolean

    Моно-определение смены говорящего (TinyDiarize). Отмечает '[SPEAKER_TURN]' при смене говорящего в одноканальном аудио. Требуется модель tdrz (small.en-tdrz) — сначала скачайте её с помощью download_model и активируйте через switch_model.

  • vad_modelstring

    Абсолютный путь к файлу .bin модели Silero VAD. Удаляет тишину перед транскрипцией.

  • word_timestampsboolean

    Выводит по одному слову на каждый сегмент с таймкодом. Пригодится для выравнивания клипов.

transcribe_batch

Транскрибирует несколько аудио/видео файлов в папке в интерактивном режиме, по одному за раз. Показывает предпросмотр каждой расшифровки и ждёт подтверждения перед продолжением. Сохраняет каждую расшифровку как .txt файл рядом с исходником. Файлы, уже расшифрованные (с соответствующим .txt), помечаются как готовые и пропускаются. Поддерживаемые форматы: mp3, wav, mp4, mkv, avi, mov, webm, m4a, flac, ogg. ПРИМЕЧАНИЕ: для больших пакетных задач без присмотра используйте start_batch. ⚠️ Конфиденциальность: предпросмотр расшифровок обрабатывается API Claude. Установите privacy_mode=true, чтобы скрыть предпросмотр и возвращать только метаданные. Когда режим конфиденциальности активен, требуется подтверждение перед каждым файлом.

Параметры
  • file_indexnumber

    Файл для обработки (нумерация с 1). Если параметр опущен, сначала выводится список файлов.

  • folder_pathstringобязательный

    Абсолютный путь Windows к папке.

  • languagestring

    Код языка. По умолчанию en.

  • output_formatenum

    timestamps = с тайм-кодами (по умолчанию), text = обычный текст.

  • privacy_modeboolean

    Переопределяет режим конфиденциальности для этого вызова. Когда активен, требует подтверждения перед каждым файлом и возвращает только метаданные.

  • recursiveboolean

    Включает подпапки. По умолчанию: false.

  • threadsnumber

    Потоки CPU. По умолчанию: 2 из 1.

whisper_server

Запустить, остановить или проверить состояние постоянного сервера модели whisper. Когда сервер работает, активная модель остаётся в VRAM, и каждый вызов transcribe_audio / transcribe_batch обслуживается через localhost без перезагрузки — это устраняет затраты на загрузку модели для каждого файла (значительное ускорение для множества коротких файлов). ⚠️ Постоянная модель занимает GPU VRAM на всё время жизни сервера, поэтому запускайте его осознанно, сделайте свою работу, а затем остановите, чтобы вернуть GPU другим приложениям. Пока сервер работает, фоновые задачи, start_batch, generate_subtitles, а также lrc/csv или расширенные параметры для отдельных вызовов недоступны (им нужен одноразовый CLI, и они будут конкурировать за GPU) — остановите сервер, чтобы их использовать. Привязан только к localhost.

Параметры
  • actionenumобязательный

    start = запускает сервер с активной моделью в памяти; stop = останавливает его и освобождает VRAM; status = сообщает, запущен ли сервер, какая модель резидентна, порт и время работы.

Похожие MCP-сервера

bogdan01m/zapcap-mcp-server

bogdan01m/zapcap-mcp-server

MCP-сервер для ZapCap API: загружайте видео, создавайте задачи с кастомизацией субтитров, стилей и B-roll, отслеживайте прогресс. Упрощает интеграцию AI-ассистентов для автоматизации обработки видео и видеомонтажа.

Python1
gpu-bridge/mcp-server

gpu-bridge/mcp-server

MCP сервер GPU-Bridge предоставляет 30 GPU-сервисов как инструменты для ИИ-агентов: LLM, генерация изображений, аудио и другие. Поддерживает x402 для автономной оплаты без API ключей. Идеален для автономных AI агентов.

JavaScript2
kimtaeyoon83/mcp-server-youtube-transcript

kimtaeyoon83/mcp-server-youtube-transcript

Сервер для извлечения транскриптов и субтитров из YouTube видео. Поддерживает ссылки, Shorts и ID, автоматически подбирает язык и фильтрует рекламу. Полезен разработчикам AI-ассистентов и аналитика...

TypeScript592
stabgan/openrouter-mcp-multimodal

stabgan/openrouter-mcp-multimodal

Мультимодальный MCP-сервер для анализа и генерации текста, изображений, аудио и видео. Интегрируется с Claude Desktop, Cursor и другими клиентами через OpenRouter, давая доступ к 300+ моделям. Вклю...

TypeScript86
samson-art/transcriptor-mcp

samson-art/transcriptor-mcp

MCP-сервер для получения транскриптов и субтитров с YouTube, Twitter, Instagram и ещё 8 платформ. Использует yt-dlp, при отсутствии субтитров задействует Whisper (локально или OpenAI). Полезен для ...

TypeScript20
elevenlabs/elevenlabs-mcp

elevenlabs/elevenlabs-mcp

Официальный MCP-сервер ElevenLabs для синтеза речи, клонирования голосов и транскрибации аудио. Интегрируется с Claude Desktop, Cursor и другими агентами, позволяя генерировать голосовые ответы, создавать звуковые ландшафты и обрабатывать аудиофайлы без переключения контекста.

Python1535
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин