Minimax Speech 2.8 Turbo
minimax-speech-2.8-turbo
MiniMax Speech 2.8 Turbo делает акцент на быстрой и естественной генерации речи; полезна для интерактивного голосовых интерфейсов, быстрых превью и массовой озвучки.
Примечание к API
Заголовок раздела «Примечание к API»- Для поля
output_formatрекомендуется использовать значениеurl; значениеhexможет легко превысить лимит ответа 64M. - Сейчас OdiRouter поддерживает только non-streaming вывод и не поддерживает streaming вывод.
- В обычном режиме одного голоса поле
voice_setting.voice_idдолжно существовать и быть непустым. - При использовании смешанных голосов параметр
timbre_weightsдолжен быть валидным. - Необходимо передать хотя бы одну из двух конфигураций голоса:
voice_setting.voice_idилиtimbre_weights; выбранная конфигурация не должна быть пустой.
Эндпоинты
POST /v1/queue/minimax-speech-2.8-turbo # Создать задачуGET /v1/queue/minimax-speech-2.8-turbo/requests/{request_id}/status # Проверить статусGET /v1/queue/minimax-speech-2.8-turbo/requests/{request_id}/response # Получить результатPUT /v1/queue/minimax-speech-2.8-turbo/requests/{request_id}/cancel # Отменить задачу
Параметры запроса
Заголовок раздела «Параметры запроса»curl --location "https://api.odirouter.ai/model/v1/queue/minimax-speech-2.8-turbo" \ --header "Authorization: Bearer YOUR_API_KEY" \ --header "Content-Type: application/json" \ --data '{ "text": "Hello, welcome to OdiRouter Model API.", "output_format": "url", "voice_setting": { "voice_id": "female-shaonv", "speed": 1.08, "vol": 1, "pitch": 0 }, "audio_setting": { "sample_rate": 32000, "bitrate": 128000, "channel": 1, "format": "mp3" }, "language_boost": "English" }'Текст для синтеза речи. Длина должна быть меньше 10000 символов.
Используйте символы новой строки для разделения абзацев.
Управление паузами: добавьте в текст <#x#>, где x — длительность паузы в секундах. Диапазон: 0.01 - 99.99. Используйте не более двух знаков после запятой. Маркеры пауз должны находиться между произносимыми фрагментами текста и не могут использоваться подряд.
Поддерживаются interjection tags, включая (laughs), (chuckle), (coughs), (clear-throat), (groans), (breath), (pant), (inhale), (exhale), (gasps), (sniffs), (sighs), (snorts), (burps), (lip-smacking), (humming), (hissing), (emm), (sneezes).
Формат выходного аудио.
Варианты: url, hex
По умолчанию: url
Настройки голоса, включая идентификатор голоса, скорость, громкость и высоту тона.
Идентификатор голоса, используемый для синтеза речи. Чтобы использовать смешанные голоса, задайте timbre_weights и оставьте это поле пустым.
Поддерживаются системные голоса, клонированные голоса и голоса, созданные из текста. Идентификаторы системных голосов указаны в списке системных голосов.
Скорость речи. Чем больше значение, тем быстрее речь.
Диапазон: 0.5 - 2
По умолчанию: 1.0
Громкость речи. Чем больше значение, тем громче аудио.
Диапазон: 0 - 10
По умолчанию: 1.0
Высота тона речи.
Диапазон: -12 - 12
По умолчанию: 0
Управляет эмоцией синтезированной речи. Обычно модель выбирает подходящую эмоцию на основе входного текста, поэтому ручная настройка чаще всего не требуется.
Варианты: happy, sad, angry, fearful, disgusted, surprised, calm, fluent
Включать ли нормализацию китайского и английского текста. Это может улучшить чтение чисел, но иногда немного увеличивает задержку.
По умолчанию: false
Читать ли формулы LaTeX вслух. Поддерживается только китайский язык, при включении параметр language_boost устанавливается в Chinese.
Оберните формулы в $$. Если формула содержит \, экранируйте его как \\, например $$x = \\frac{-b \\pm \\sqrt{b^2 - 4ac}}{2a}$$.
По умолчанию: false
Конфигурация смешанных голосов. Можно смешать до 4 голосов. Каждый элемент содержит следующие поля.
Пример:
"timbre_weights": [ { "voice_id": "female-chengshu", "weight": 30 }, { "voice_id": "female-tianmei", "weight": 70 }] Идентификатор голоса, используемый для синтеза речи. Его нужно указывать вместе с weight. Поддерживаются системные голоса, клонированные голоса и голоса, созданные из текста. Идентификаторы системных голосов указаны в списке системных голосов.
Вес каждого голоса в синтезированном аудио. Его нужно заполнять вместе с voice_id. Чем выше вес отдельного голоса, тем сильнее синтезированный голос похож на него.
Диапазон: 1 - 100
Настройки аудио.
Частота дискретизации сгенерированного аудио.
Варианты: 8000, 16000, 22050, 24000, 32000, 44100
По умолчанию: 32000
Битрейт сгенерированного аудио. Этот параметр действует только для аудио mp3.
Варианты: 32000, 64000, 128000, 256000
Передавайте значение как число JSON, например 128000, а не как строку.
По умолчанию: 128000
Формат сгенерированного аудио.
Варианты: mp3, pcm, flac, wav
Количество каналов сгенерированного аудио.
Варианты: 1, 2
По умолчанию: 1
Управление постоянным битрейтом. Если задано true, аудио кодируется с постоянным битрейтом. Сейчас OdiRouter поддерживает только non-streaming вывод, поэтому этот параметр обычно не требуется.
По умолчанию: false
Улучшать ли распознавание для указанного языка или диалекта. Используйте auto, чтобы модель выбрала автоматически.
Варианты: Chinese, Chinese,Yue, English, Arabic, Russian, Spanish, French, Portuguese, German, Turkish, Dutch, Ukrainian, Vietnamese, Indonesian, Japanese, Italian, Korean, Thai, Polish, Romanian, Greek, Czech, Finnish, Hindi, Bulgarian, Danish, Hebrew, Malay, Persian, Slovak, Swedish, Croatian, Filipino, Hungarian, Norwegian, Slovenian, Catalan, Nynorsk, Tamil, Afrikaans, auto
По умолчанию: null
Словарь произношения для настройки произношения отдельных слов.
Задает правила замены произношения для отмеченного текста или символов. В китайском тексте тоны обозначаются числами: первый тон — 1, второй — 2, третий — 3, четвертый — 4, нейтральный — 5.
Пример: ["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
Настройки голосового эффекта. Поддерживаемые форматы аудио: mp3, wav, flac.
Регулировка высоты тона. Значения около -100 дают более низкий голос; значения около 100 — более яркий голос.
Диапазон: -100 - 100
Регулировка интенсивности. Значения около -100 дают более сильный голос; значения около 100 — более мягкий голос.
Диапазон: -100 - 100
Регулировка тембра. Значения около -100 дают более насыщенный голос; значения около 100 — более чистый голос.
Диапазон: -100 - 100
Настройка звукового эффекта. В одном запросе можно выбрать только один эффект.
Варианты: spacious_echo (просторное эхо), auditorium_echo (эхо аудитории), lofi_telephone (телефонное искажение), robotic (электронный голос)
Включать ли генерацию субтитров. Этот параметр действует только для non-streaming вывода.
По умолчанию: false
Гранулярность субтитров.
Варианты: sentence (таймкоды на уровне предложений), word (таймкоды на уровне слов)
По умолчанию: sentence
Добавлять ли маркер аудиоритма в конец синтезированного аудио. Действует только для non-streaming синтеза.
По умолчанию: false
Параметры ответа
Заголовок раздела «Параметры ответа»{ "request_id": "mmsu_01hxyz...", "response_url": "https://api.odirouter.ai/model/v1/queue/minimax-speech-2.8-turbo/requests/mmsu_01hxyz.../response", "status_url": "https://api.odirouter.ai/model/v1/queue/minimax-speech-2.8-turbo/requests/mmsu_01hxyz.../status", "cancel_url": "https://api.odirouter.ai/model/v1/queue/minimax-speech-2.8-turbo/requests/mmsu_01hxyz.../cancel", "queue_position": 0}| Поле | Тип | Описание |
|---|---|---|
request_id | string | Идентификатор задачи, используемый во всех последующих операциях. |
response_url | string | URL для получения итогового результата. |
status_url | string | URL для проверки статуса задачи. |
cancel_url | string | URL для отмены задачи. |
queue_position | int | Текущая позиция в очереди. |