backgroundboolean
Запускается как отдельное фоновое задание. Сразу возвращает ID задания. Используйте check_progress для отслеживания. Рекомендуется для файлов, обработка которых занимает более 10 минут.
beam_sizenumber
Ширина поиска луча. Больше значение — точнее, но медленнее. По умолчанию: 5.
best_ofnumber
Число кандидатных последовательностей для оценки. По умолчанию 5.
condition_on_prev_textboolean
Повторно включить обусловливание каждого сегмента на основе его собственного предыдущего вывода. По умолчанию false.
diarizeboolean
Стерео-разделение говорящих - требует стерео-аудио с говорящими на отдельных каналах.
durationnumber
file_pathstringобязательный
Абсолютный путь Windows, например C:\Users\You\Downloads\recording.mp4
gpu_devicenumber
Индекс устройства GPU/Vulkan для систем с несколькими GPU. Переопределяет значение по умолчанию из переменной окружения WHISPER_GPU_DEVICE. Посмотри в логе запуска whisper-cli — там указан индекс, соответствующий нужной видеокарте.
languagestring
Код языка (например, en, ja, es, fr) или 'auto' для автоматического определения. По умолчанию — en.
max_segment_lengthnumber
Максимальная длина сегмента в символах.
modelstring
Переопределите путь модели. Оставьте пустым, чтобы использовать активную модель.
no_speech_tholdnumber
Порог уверенности, ниже которого сегменты считаются тишиной. По умолчанию 0.6.
offset_tnumber
Начните транскрипцию с этого смещения в миллисекундах.
output_formatenum
timestamps = с временными метками (по умолчанию), text = обычный текст, json = структурированный JSON, srt = файл субтитров SRT, vtt = файл субтитров WebVTT, lrc = текст песни/караоке LRC, csv = CSV с временными метками.
privacy_modeboolean
Переопределите режим конфиденциальности для этого вызова. true = только метаданные, текст транскрипции не передаётся в API. false = возвращать текст (даже если WHISPER_PRIVACY_MODE=true глобально). Опустите, чтобы использовать глобальную настройку WHISPER_PRIVACY_MODE. При активном режиме требуется подтверждение перед каждой операцией.
processorsnumber
Количество параллельных процессоров. По умолчанию 1.
promptstring
Внедряет предыдущий контекст перед транскрипцией. Повышает точность для специфичной лексики или имён говорящих. Пример: «Имена: Keemstar, DramaAlert».
save_to_fileboolean
Сохраняет стенограмму как .txt рядом с исходным файлом.
split_on_wordboolean
Разбивайте сегменты по границам слов.
temperaturenumber
Температура сэмплирования 0.0–1.0. По умолчанию 0.0 (детерминированный).
threadsnumber
Потоки CPU. По умолчанию: 2 из 1.
tinydiarizeboolean
Моно-определение смены говорящего (TinyDiarize). Отмечает '[SPEAKER_TURN]' при смене говорящего в одноканальном аудио. Требуется модель tdrz (small.en-tdrz) — сначала скачайте её с помощью download_model и активируйте через switch_model.
vad_modelstring
Абсолютный путь к файлу .bin модели Silero VAD. Удаляет тишину перед транскрипцией.
word_timestampsboolean
Выводит по одному слову на каждый сегмент с таймкодом. Пригодится для выравнивания клипов.