JuhongPark/mcp-server-pronunciation

JuhongPark/mcp-server-pronunciation

от juhongpark
MCP-сервер для голосового общения с ИИ-ассистентом, который в реальном времени оценивает английское произношение, грамматику и беглость. Всё работает локально — аудио не покидает устройство. Полезе...

mcp-server-pronunciation

mcp-server-pronunciation MCP server

Accuracy and safety notice

This project is a local language-learning practice tool. It may contain bugs, runtime errors, inaccurate transcripts, inaccurate pronunciation feedback, or platform-specific recording issues. Pronunciation feedback is a coaching signal, not a standardized-test, clinical, employment, or high-stakes assessment. Review outputs carefully before relying on them. See DISCLAIMER.md.

An MCP (Model Context Protocol) server that lets you talk to your MCP assistant by voice while getting English pronunciation, grammar, and fluency feedback in the same turn. Use it for casual voice chat with light coaching, or switch to drill mode when you want to practice a specific sentence.

Built for Codex CLI, Claude Desktop, Claude Code, Cursor, VS Code, and other MCP clients. Everything runs locally — audio is captured with your mic, transcribed by faster-whisper on-device, and never leaves your machine.

mcp-name: io.github.JuhongPark/pronunciation

Why

Voice MCP servers today treat speech as a typing replacement. English tutor MCP servers are text-only. This one combines the two: you speak freely, your assistant replies, and feedback on what you just said (pronunciation, grammar, fluency) surfaces inside the same tool call so the assistant can weave it into a natural reply — or stay out of the way when you're just chatting.

Инструменты были проиндексированы:
assess

Оценивает последнюю запись (или конкретный аудиофайл) без перезаписи. Когда передан reference_text, ассессор: - Выравнивает речь пользователя по словам относительно эталона (Needleman-Wunsch; одиночные удаления/вставки больше не каскадируют в фантомные замены). - Запускает принудительное выравнивание wav2vec2 CTC, чтобы проверить, какие слова из эталона пользователь действительно произнёс — уменьшает количество ошибочных транскрипций из-за смещения Whisper на редких именах собственных и доменных терминах, напрямую сверяя акустические свидетельства с эталоном. - Предоставляет пословную обратную связь на уровне фонем (ожидаемая и произнесённая IPA, слабые фонемы) из CMUdict. - Предоставляет опциональные подсказки и упражнения по произношению для профиля учащегося, если совпадает набор правил. В комплект входит профиль для корейского L1, включающий такие паттерны, как r/l, th→s, удаление конечных кластеров и вставка гласного в начале слога. - Добавляет заметки по просодии: расстановка ударений в словах, вопросительная интонация в конце повествовательных предложений, паузы хезитации внутри клаузы. Без эталона выполняются только транскрипция и просодия. Аргументы: reference_text: Ожидаемый текст, который пользователь пытался произнести (опционально). audio_path: Путь к WAV-файлу. Если не указан, используется последняя запись. Возвращает: Подробный отчёт об оценке произношения (markdown).

Оценивает записанную попытку произношения

Параметры
  • audio_pathstring | null

    Optional local path to a WAV file to assess. When omitted, the most recent recording from this server session is used.

  • reference_textstring | null

    Optional expected sentence for the recorded audio. When omitted, only transcript and general prosody feedback are returned.

check_mic

Списывает доступные устройства ввода аудио и проверяет доступ к микрофону. Используйте, если пользователь жалуется на проблемы с записью — показывает, какие устройства доступны и какое из них установлено по умолчанию. Возвращает: Список доступных микрофонов.

Проверить устройства микрофона

Параметры

Без параметров.

converse

Записывает речь пользователя, расшифровывает её и возвращает расшифровку и краткий отзыв по английскому. Это основной инструмент для голосовых разговоров: вызовите его, прочитайте расшифровку + отзыв, затем ответьте своими словами в разговорном ключе — вплетая отзыв естественно или упоминая его, только если это важно. Запись автоматически останавливается, когда пользователь заканчивает говорить (определение тишины). Используйте этот инструмент, когда: - Пользователь хочет пообщаться с вами голосом, а не текстом. - Пользователь хочет получать повседневный отзыв по английскому во время разговора. - Вы хотите услышать, что сказал пользователь, а не читать набранное сообщение. Для целенаправленного упражнения, где пользователь читает конкретное предложение, используйте practice. Args: target_hint: Опционально. Устанавливайте только если пользователь явно пытается произнести конкретную фразу (например, он спросил «как сказать X?» и вы сказали ему X). Оставьте пустым для свободной беседы. duration: Максимальная длительность записи в секундах (по умолчанию 30, макс. 120). Автоматически останавливается раньше при тишине. Возвращает: Markdown-отчёт, содержащий расшифровку речи пользователя, краткий отзыв по английскому (произношение + грамматика + беглость) и раздел 'For Claude' с рекомендациями по ответу.

Голосовой разговор с обратной связью на английском языке

Параметры
  • durationnumber

    Maximum recording duration in seconds. The server accepts 1 to 120 seconds and auto-stops earlier on silence.

  • target_hintstring | null

    Optional target sentence or phrase the user is trying to say. Leave null for open-ended voice conversation.

practice

Drill mode: пользователь читает вслух конкретное предложение и получает подробную оценку произношения. Используйте этот режим, когда пользователь явно хочет практиковать чтение определённого предложения, а не для свободного общения. Для голосового разговора с неформальной обратной связью используйте converse. Запись автоматически останавливается, когда пользователь заканчивает говорить. Аргументы: reference_text: предложение, которое пользователь будет читать вслух. duration: максимальная длительность записи в секундах (по умолчанию 15, максимум 120). Возвращает: Подробный отчёт об оценке произношения.

Целенаправленная тренировка произношения

Параметры
  • durationnumber

    Maximum recording duration in seconds. The server accepts 1 to 120 seconds and auto-stops earlier on silence.

  • reference_textstringобязательный

    Exact sentence or phrase the user should read aloud for drill mode.

quick_practice

Выбирает случайное предложение для отработки и сразу запускает тренировку. Объединяет suggest_sentence и practice в один шаг: выбирает предложение по заданным критериям, затем записывает и оценивает. Аргументы: focus: Область фонем. Варианты: "th", "f_v", "r_l", "vowels", "general". Если не указан, выбирается случайно. difficulty: Уровень сложности. Варианты: "beginner", "intermediate", "advanced". Если не указан, выбирается случайно. duration: Максимальная длительность записи в секундах (по умолчанию 15, максимум 120). Возвращает: Предложение для чтения, за которым следует оценка произношения.

Случайное упражнение на произношение

Параметры
  • difficultyenum | null

    Optional practice difficulty filter. Use beginner, intermediate, or advanced. Leave null to choose randomly.

  • durationnumber

    Maximum recording duration in seconds. The server accepts 1 to 120 seconds and auto-stops earlier on silence.

  • focusenum | null

    Optional pronunciation focus filter. Use th, f_v, r_l, vowels, or general. Leave null to choose randomly.

record

Записывает аудио с микрофона без анализа. Запись автоматически останавливается, когда пользователь заканчивает говорить (детекция тишины). Длительность — это максимальное время — можно не ждать полной длительности. В большинстве случаев пользуйтесь converse или practice — они записывают И анализируют за один шаг. Используйте record отдельно только если нужен сырой WAV-файл. Аргументы: duration: Максимальная длительность записи в секундах (по умолчанию 10, максимум 120). Возвращает: Путь к записанному WAV-файлу.

Записать аудио с микрофона

Параметры
  • durationnumber

    Maximum recording duration in seconds. The server accepts 1 to 120 seconds and auto-stops earlier on silence.

retry

Повторить последнее предложение, которое тренировал пользователь. Перезаписывает и переоценивает, используя тот же эталонный текст из предыдущего вызова practice или converse. Используйте это, чтобы дать пользователю попробовать снова после получения обратной связи. Аргументы: duration: Максимальная длительность записи в секундах (по умолчанию 15, максимум 120). Возвращает: Отчет об оценке произношения для новой попытки.

Повтори последнее упражнение по произношению.

Параметры
  • durationnumber

    Maximum recording duration in seconds. The server accepts 1 to 120 seconds and auto-stops earlier on silence.

suggest_sentence

Предлагает тренировочное предложение, которое пользователь может прочитать вслух. Аргументы: focus: Область фокуса на фонемы. Варианты: "th", "f_v", "r_l", "vowels", "general". Если не указано, выбирает случайно. difficulty: Уровень сложности. Варианты: "beginner", "intermediate", "advanced". Если не указано, выбирает случайно. Возвращает: Тренировочное предложение с его областью фокуса и уровнем сложности.

На дворе трава, на траве дрова.

Параметры
  • difficultyenum | null

    Optional practice difficulty filter. Use beginner, intermediate, or advanced. Leave null to choose randomly.

  • focusenum | null

    Optional pronunciation focus filter. Use th, f_v, r_l, vowels, or general. Leave null to choose randomly.

Похожие MCP-сервера

PhononX/cv-mcp-server

PhononX/cv-mcp-server

MCP-сервер для интеграции AI-ассистентов с Carbon Voice. Предоставляет инструменты для голосовых сообщений, управления беседами, папками и рабочими пространствами. Полезен для автоматизации общения...

TypeScript10
mbailey/voice-mcp

mbailey/voice-mcp

VoiceMode добавляет в Claude Code голосовое общение. Разговаривайте с ИИ-агентом вслух, когда печатать неудобно: на прогулке, за готовкой или давая глазам отдых. Поддерживает локальные модели для п...

Python1357
elevenlabs/elevenlabs-mcp

elevenlabs/elevenlabs-mcp

Официальный MCP-сервер ElevenLabs для синтеза речи, клонирования голосов и транскрибации аудио. Интегрируется с Claude Desktop, Cursor и другими агентами, позволяя генерировать голосовые ответы, создавать звуковые ландшафты и обрабатывать аудиофайлы без переключения контекста.

Python1535
mohitbadwal/ringback

mohitbadwal/ringback

MCP-сервер ringback позволяет AI-агенту звонить на ваш телефон и вести двусторонний голосовой диалог с поддержкой прерывания речи (barge-in). Работает на бесплатных self-hosted компонентах (Whisper, Piper TTS, SIP). Полезен разработчикам, которым нужна голосовая связь с ИИ в реальном времени.

Python21
khan2a/telephony-mcp-server

khan2a/telephony-mcp-server

MCP-сервер для телефонии на базе Vonage API. LLM-агенты совершают звонки и отправляют SMS прямо в диалоге. Разработчики AI-приложений получают простой инструмент для голосовых вызовов, отправки соо...

Python13
joinly-ai/joinly

joinly-ai/joinly

MCP сервер joinly.ai даёт AI-агентам возможность в реальном времени участвовать в видеозвонках: говорить, читать чат, получать транскрипцию и список участников. Идеально для разработчиков голосовых ассистентов и автоматизации совещаний.

Python564
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин