supertone-inc/supertone-mcp

supertone-inc/supertone-mcp

от supertone-inc
MCP-сервер для Supertone TTS с набором композитных инструментов: синтез речи, поиск и клонирование голосов, предсказание длительности, управление кредитами. Поддерживает 31 язык, настройки темпа, тона и эмоций. Полезен разработчикам для интеграции голосового вывода в LLM-клиенты (Claude Desktop, ...

supertone-mcp

A composable MCP toolkit for the Supertone TTS API. Rather than a single "speak this text" command, it exposes Supertone's SDK as a set of building-block tools — synthesis, voice discovery, preview, duration/credit prediction, usage tracking, and full voice-cloning CRUD — that an LLM assembles to fulfill a request. Works in Claude Desktop, Cursor, or any MCP-compatible client.

supertone-inc/supertone-mcp MCP server

Covers Korean, English, Japanese, and 31 languages total. Speed (0.5x–2.0x), pitch shift (-24 to +24 semitones), emotion styles, per-call output mode, streaming, and model selection.

Features

Synthesis

  • text_to_speech — Convert text to audio. Per-call control of output_mode (files / resources / both), autoplay, streaming, model, plus include_phonemes / normalized_text. Long text is auto-chunked by the SDK.
  • predict_duration — Estimate audio length (and credit cost) without synthesizing.

Voice discovery (preset)

  • search_voice — Filter the catalog by language, gender, age, use_case, style, model, name, or description.
  • get_voice — Full detail for one voice.
  • preview_voice — Sample audio URLs for a voice (filterable by language/style/model).
Инструменты были проиндексированы:
clone_voice

Создаёт пользовательский голос из одного локального аудиофайла. Ограничения: только WAV или MP3, макс. 3 МБ, ровно один файл. Возвращённый voice_id можно сразу использовать в text_to_speech. Путь поддерживает раскрытие ~ (например, "~/sample.wav").

Параметры
  • audio_pathstringобязательный
  • descriptionstring | null
  • namestringобязательный
delete_custom_voice

Навсегда удаляет кастомный (клонированный) голос. ЭТО НЕОБРАТИМО — после удаления голос нельзя восстановить, а любой сохранённый voice_id, ссылающийся на него, перестанет работать. Перед вызовом подтвердите с пользователем.

Параметры
  • voice_idstringобязательный
edit_custom_voice

Обновляет имя и/или описание существующего пользовательского голоса. Необходимо указать хотя бы имя или описание.

Параметры
  • descriptionstring | null
  • namestring | null
  • voice_idstringобязательный
get_credit_balance

Возвращает оставшийся кредитный баланс Supertone для текущего API-ключа. Используйте это перед длинными TTS-вызовами, чтобы убедиться, что у вас осталось достаточно символов.

Параметры

Без параметров.

get_custom_voice

Получает данные о конкретном пользовательском (клонированном) голосе по voice_id. Возвращает имя и описание голоса. Используйте search_custom_voice, чтобы вывести список пользовательских голосов и найти voice_id.

Параметры
  • voice_idstringобязательный
get_usage_history

Получает историю использования TTS API для текущего ключа API. Возвращает текстовую сводку, разбитую по временным периодам, с указанием использованных минут (и, где доступно, голоса и модели) в каждом периоде. Не принимает параметров: отчёт за недавний период по умолчанию. Используйте это, чтобы проверить, сколько синтеза было израсходовано.

Параметры

Без параметров.

get_voice

Получает полные сведения об одном голосе по voice_id. Возвращает имя, описание, возраст, пол, варианты использования, языки, стили, поддерживаемые модели, количество образцов и URL миниатюры. Используйте preview_voice, чтобы получить фактические URL аудиообразцов.

Параметры
  • voice_idstringобязательный
get_voice_usage

Получает недавнее использование одного голоса по voice_id. Возвращает текстовую сводку с ежедневным использованием голоса в минутах за последний период по умолчанию. Используйте search_voice или search_custom_voice, чтобы найти voice_id.

Параметры
  • voice_idstringобязательный
merge_audio_files

Объединяет два или более локальных аудиофайла в один с помощью ffmpeg. Поддерживает простое склеивание, вставку тишины между фрагментами (gap_ms) или скрещивание с перекрёстным затуханием (crossfade_ms). gap_ms и crossfade_ms взаимоисключают друг друга. Формат выходного файла определяется автоматически по входным (все одного расширения → это расширение; смешанные → mp3) или переопределяется через output_format. Используйте, чтобы сшить несколько результатов text_to_speech в один готовый файл.

Параметры
  • crossfade_msinteger
  • gap_msinteger
  • input_pathsstring[]обязательный
  • output_formatstring | null
predict_duration

Предсказывает ожидаемую длительность аудиовыхода в секундах для заданного текста БЕЗ создания аудиофайла. Принимает те же параметры, что и text_to_speech. Ограничения по длине текста нет: длинный текст автоматически разбивается на части, а расход кредитов и задержка масштабируются пропорционально длине текста. Используйте это, чтобы оценить стоимость кредитов перед синтезом — расход кредитов пропорционален предсказанной длительности.

Параметры
  • languagestring | null
  • modelstring | null
  • output_formatstring | null
  • pitch_shiftinteger | null
  • speednumber | null
  • stylestring | null
  • textstringобязательный
  • voice_idstring | null
preview_voice

Получает ссылки на образцы аудио для голоса. Можно отфильтровать образцы по языку, стилю и модели. Возвращает один URL на каждый подходящий образец. v0.2 НЕ воспроизводит аудио локально — передайте URL вашему клиенту для прослушивания.

Параметры
  • languagestring | null
  • modelstring | null
  • stylestring | null
  • voice_idstringобязательный
search_custom_voice

Выводит список пользовательских (клоновых) голосов, созданных с помощью этого API-ключа. Опциональные фильтры по имени и описанию выполняют частичное совпадение. Пагинация обрабатывается внутри; v0.2 возвращает страницу по умолчанию для SDK.

Параметры
  • descriptionstring | null
  • namestring | null
search_voice

Поиск по каталогу голосов Supertone. Фильтры необязательны и комбинируются по логике AND: name, description, language, gender, age, use_case, style, model. Без фильтров возвращается полный каталог (поведение v0.1 list_voices). Результат — нумерованный список в виде обычного текста; когда задан хотя бы один фильтр, первая строка показывает "Filters applied: ...".

Параметры
  • agestring | null
  • descriptionstring | null
  • genderstring | null
  • languagestring | null
  • modelstring | null
  • namestring | null
  • stylestring | null
  • use_casestring | null
text_to_speech

Генерирует естественно звучащую речь из текста. Используй это, когда пользователь хочет: услышать текст вслух, создать озвучку или голос за кадром, сгенерировать голосовое аудио, послушать, как текст звучит в устной форме, или превратить любой текст в звук. Поддерживается 31 язык, включая корейский, английский и японский. Ограничения по длине текста нет: длинный текст сервис автоматически разбивает на части (автоматическое дробление), а расход кредитов и задержка масштабируются пропорционально длине текста. Задай output_mode ('files', 'resources' или 'both'), чтобы управлять способом возврата аудио, и autoplay=true для воспроизведения на macOS. Эти параметры при каждом вызове ЗАМЕНЯЮТ удалённые переменные окружения SUPERTONE_MCP_OUTPUT_MODE и SUPERTONE_MCP_AUTOPLAY; теперь autoplay по умолчанию выключен. Голос по умолчанию уже настроен — просто вызывай этот инструмент напрямую. Обращайся к search_voice, только если пользователь явно попросит сменить или посмотреть голоса.

Параметры
  • autoplayboolean
  • include_phonemesboolean

    When true, request phoneme timing data alongside the audio (SDK 0.2.3). Defaults to false. Note: the phoneme data is not yet surfaced in the tool response — this is a pass-through flag for now.

  • languagestring | null
  • modelstring | null
  • normalized_textstring | null

    Optional pre-normalized text to use for synthesis (SDK 0.2.3). Only applies to the sona_speech_2 and sona_speech_2_flash models; other models ignore it. When omitted, the SDK default (None) is used.

  • output_formatstring | null
  • output_modestring | null
  • pitch_shiftinteger | null
  • speednumber | null
  • streamingboolean

    When true, stream the audio via the chunked synthesize path instead of a single one-shot request. Streaming is ONLY supported by model=sona_speech_1; using streaming=true with any other model returns a validation error. Defaults to false (one-shot synthesize).

  • stylestring | null
  • textstringобязательный
  • voice_idstring | null

Похожие MCP-сервера

elevenlabs/elevenlabs-mcp

elevenlabs/elevenlabs-mcp

Официальный MCP-сервер ElevenLabs для синтеза речи, клонирования голосов и транскрибации аудио. Интегрируется с Claude Desktop, Cursor и другими агентами, позволяя генерировать голосовые ответы, создавать звуковые ландшафты и обрабатывать аудиофайлы без переключения контекста.

Python1535
evalstate/mcp-hfspace

evalstate/mcp-hfspace

MCP сервер для доступа к моделям Hugging Face Spaces. Поддерживает десятки задач — генерацию, распознавание, синтез — через единый MCP протокол. Идеален для интеграции с Claude Desktop. Использует Gradio эндпоинты, настройка минимальна.

TypeScript389
doctorm333/promptpilot-mcp-server

doctorm333/promptpilot-mcp-server

PromptPilot MCP-сервер генерирует изображения, видео и аудио прямо в Claude, Cursor или Windsurf. Поддерживает 20+ моделей (Flux, Imagen 4, Grok Imagine и др.), есть бесплатные без ключа. Полезен р...

JavaScript2
MkTurner74/botverse-mcp

MkTurner74/botverse-mcp

MCP-сервер и CLI для Botverse: видеотранскодирование (MP4, WebM, GIF, ProRes) и конвертация документов (Markdown, DOCX, PDF, HTML, XLSX) — без AWS и FFmpeg. Подходит для AI-агентов, CI/CD и shell-а...

JavaScript1
elestirelbilinc-sketch/vap-showcase

elestirelbilinc-sketch/vap-showcase

MCP-сервер VAP Media добавляет AI-агентам генерацию изображений Flux, видео Veo и музыки Suno с детерминированным ценообразованием. Управляй затратами, используй готовые инструменты в Claude Deskto...

Python1
mohitbadwal/ringback

mohitbadwal/ringback

MCP-сервер ringback позволяет AI-агенту звонить на ваш телефон и вести двусторонний голосовой диалог с поддержкой прерывания речи (barge-in). Работает на бесплатных self-hosted компонентах (Whisper, Piper TTS, SIP). Полезен разработчикам, которым нужна голосовая связь с ИИ в реальном времени.

Python21
© Каталог MCP, 2026. Все права защищены.
Проект не аффилирован с Anthropic и любыми упомянутыми продуктами.
Все названия и торговые марки принадлежат их владельцам.
Контакты для связи: hi@mcp-katalog.ru

Лука Никитин