Перейти к содержимому
Главная

Minimax Speech 01 Hd

minimax-speech-01-hd MiniMax Speech 01 HD фокусируется на более высокой точности и естественности речи; полезна для профессиональной озвучки, черновиков дубляжа, голосов персонажей и реалистичного озвученного контента.
  • Для поля output_format рекомендуется использовать значение url; значение hex может легко превысить лимит ответа 64M.
  • Сейчас OdiRouter поддерживает только non-streaming вывод и не поддерживает streaming вывод.
  • В обычном режиме одного голоса поле voice_setting.voice_id должно существовать и быть непустым.
  • При использовании смешанных голосов параметр timbre_weights должен быть валидным.
  • Необходимо передать хотя бы одну из двух конфигураций голоса: voice_setting.voice_id или timbre_weights; выбранная конфигурация не должна быть пустой.

Эндпоинты

POST /v1/queue/minimax-speech-01-hd # Создать задачу
GET /v1/queue/minimax-speech-01-hd/requests/{request_id}/status # Проверить статус
GET /v1/queue/minimax-speech-01-hd/requests/{request_id}/response # Получить результат
PUT /v1/queue/minimax-speech-01-hd/requests/{request_id}/cancel # Отменить задачу
Окно терминала
curl --location "https://api.odirouter.ai/model/v1/queue/minimax-speech-01-hd" \
--header "Authorization: Bearer YOUR_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"text": "Hello, welcome to OdiRouter Model API.",
"output_format": "url",
"voice_setting": {
"voice_id": "female-shaonv",
"speed": 1.08,
"vol": 1,
"pitch": 0
},
"audio_setting": {
"sample_rate": 32000,
"bitrate": 128000,
"channel": 1,
"format": "mp3"
},
"language_boost": "English"
}'
text string required

Текст для синтеза речи. Длина должна быть меньше 10000 символов.

Используйте символы новой строки для разделения абзацев.

Управление паузами: добавьте в текст <#x#>, где x — длительность паузы в секундах. Диапазон: 0.01 - 99.99. Используйте не более двух знаков после запятой. Маркеры пауз должны находиться между произносимыми фрагментами текста и не могут использоваться подряд.

output_format string

Формат выходного аудио.

Варианты: url, hex

По умолчанию: url

voice_setting object

Настройки голоса, включая идентификатор голоса, скорость, громкость и высоту тона.

voice_id string

Идентификатор голоса, используемый для синтеза речи. Чтобы использовать смешанные голоса, задайте timbre_weights и оставьте это поле пустым.

Поддерживаются системные голоса, клонированные голоса и голоса, созданные из текста. Идентификаторы системных голосов указаны в списке системных голосов.

speed number

Скорость речи. Чем больше значение, тем быстрее речь.

Диапазон: 0.5 - 2

По умолчанию: 1.0

vol number

Громкость речи. Чем больше значение, тем громче аудио.

Диапазон: 0 - 10

По умолчанию: 1.0

pitch integer

Высота тона речи.

Диапазон: -12 - 12

По умолчанию: 0

emotion string

Управляет эмоцией синтезированной речи. Обычно модель выбирает подходящую эмоцию на основе входного текста, поэтому ручная настройка чаще всего не требуется.

Варианты: happy, sad, angry, fearful, disgusted, surprised, calm

text_normalization boolean

Включать ли нормализацию китайского и английского текста. Это может улучшить чтение чисел, но иногда немного увеличивает задержку.

По умолчанию: false

latex_read boolean

Читать ли формулы LaTeX вслух. Поддерживается только китайский язык, при включении параметр language_boost устанавливается в Chinese.

Оберните формулы в $$. Если формула содержит \, экранируйте его как \\, например $$x = \\frac{-b \\pm \\sqrt{b^2 - 4ac}}{2a}$$.

По умолчанию: false

timbre_weights array

Конфигурация смешанных голосов. Можно смешать до 4 голосов. Каждый элемент содержит следующие поля.

Пример:

"timbre_weights": [
{
"voice_id": "female-chengshu",
"weight": 30
},
{
"voice_id": "female-tianmei",
"weight": 70
}
]
voice_id string

Идентификатор голоса, используемый для синтеза речи. Его нужно заполнять вместе с weight. Поддерживаются системные голоса, клонированные голоса и голоса, созданные из текста. Идентификаторы системных голосов указаны в списке системных голосов.

weight integer

Вес каждого голоса в синтезированном аудио. Его нужно заполнять вместе с voice_id. Чем выше вес отдельного голоса, тем сильнее синтезированный голос похож на него.

Диапазон: 1 - 100

audio_setting object

Настройки аудио.

sample_rate integer

Частота дискретизации сгенерированного аудио.

Варианты: 8000, 16000, 22050, 24000, 32000, 44100

По умолчанию: 32000

bitrate integer

Битрейт сгенерированного аудио. Этот параметр действует только для аудио mp3.

Варианты: 32000, 64000, 128000, 256000

Передавайте значение как число JSON, например 128000, а не как строку.

По умолчанию: 128000

format string

Формат сгенерированного аудио.

Варианты: mp3, pcm, flac, wav

channel integer

Количество каналов сгенерированного аудио.

Варианты: 1, 2

По умолчанию: 1

force_cbr boolean

Управление постоянным битрейтом. Если задано true, аудио кодируется с постоянным битрейтом. Сейчас OdiRouter поддерживает только non-streaming вывод, поэтому этот параметр обычно не требуется.

По умолчанию: false

language_boost string

Улучшать ли распознавание для указанного языка или диалекта. Используйте auto, чтобы модель выбрала автоматически.

Варианты: Chinese, Chinese,Yue, English, Arabic, Russian, Spanish, French, Portuguese, German, Turkish, Dutch, Ukrainian, Vietnamese, Indonesian, Japanese, Italian, Korean, Thai, Polish, Romanian, Greek, Czech, Finnish, Hindi, Bulgarian, Danish, Hebrew, Malay, Persian, Slovak, Swedish, Croatian, Filipino, Hungarian, Norwegian, Slovenian, Catalan, Nynorsk, Tamil, Afrikaans, auto

По умолчанию: null

pronunciation_dict object

Словарь произношения для настройки произношения отдельных слов.

tone array

Задает правила замены произношения для отмеченного текста или символов. В китайском тексте тоны обозначаются числами: первый тон — 1, второй — 2, третий — 3, четвертый — 4, нейтральный — 5.

Пример: ["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]

voice_modify object

Настройки голосового эффекта. Поддерживаемые форматы аудио: mp3, wav, flac.

pitch integer

Регулировка высоты тона. Значения около -100 дают более низкий голос; значения около 100 — более яркий голос.

Диапазон: -100 - 100

intensity integer

Регулировка интенсивности. Значения около -100 дают более сильный голос; значения около 100 — более мягкий голос.

Диапазон: -100 - 100

timbre integer

Регулировка тембра. Значения около -100 дают более насыщенный голос; значения около 100 — более чистый голос.

Диапазон: -100 - 100

sound_effects string

Настройка звукового эффекта. В одном запросе можно выбрать только один эффект.

Варианты: spacious_echo (просторное эхо), auditorium_echo (эхо аудитории), lofi_telephone (телефонное искажение), robotic (электронный голос)

subtitle_enable bool

Включать ли генерацию субтитров. Этот параметр действует только для non-streaming вывода.

По умолчанию: false

subtitle_type string

Гранулярность субтитров.

Варианты: sentence (таймкоды на уровне предложений), word (таймкоды на уровне слов)

По умолчанию: sentence

aigc_watermark bool

Добавлять ли маркер аудиоритма в конец синтезированного аудио. Действует только для non-streaming синтеза.

По умолчанию: false

{
"request_id": "mmsu_01hxyz...",
"response_url": "https://api.odirouter.ai/model/v1/queue/minimax-speech-01-hd/requests/mmsu_01hxyz.../response",
"status_url": "https://api.odirouter.ai/model/v1/queue/minimax-speech-01-hd/requests/mmsu_01hxyz.../status",
"cancel_url": "https://api.odirouter.ai/model/v1/queue/minimax-speech-01-hd/requests/mmsu_01hxyz.../cancel",
"queue_position": 0
}
ПолеТипОписание
request_idstringИдентификатор задачи, используемый во всех последующих операциях.
response_urlstringURL для получения итогового результата.
status_urlstringURL для проверки статуса задачи.
cancel_urlstringURL для отмены задачи.
queue_positionintТекущая позиция в очереди.