Saltar al contenido

Crear voz

Síntesis de voz compatible con OpenAI (MiniMax Speech 2.8 HD / Turbo); la respuesta son directamente los bytes de audio.

POST/v1/audio/speech

Convierte texto en audio de forma síncrona: la respuesta es el propio audio y no hay tarea que consultar. Funciona directamente con audio.speech.create del SDK de OpenAI; solo cambie el Base URL y model / voice. Los dos modelos de voz pertenecen al grupo independiente MiniMax Speech oficial; las claves de grupos de chat o video no llegan a ellos.

Cualquier otro campo devuelve 400 unknown field, incluidos stream_format, sample_rate, language_boost y voice_setting. Para usarlos, así como para salida en streaming y voces clonadas, use el endpoint nativo POST /v1/t2a_v2; ver la guía de síntesis de voz. Se factura por caracteres: cada carácter chino cuenta como 2.

Encabezados

Authorization:obligatoriostring

Bearer sk-…: una clave de API creada en la consola; su grupo debe incluir el modelo solicitado

Parámetros del cuerpoJSON

model:obligatoriostring

Distingue mayúsculas, sin alias; tts-1 / tts-1-hd no se reconocen

Valoresspeech-2.8-hdspeech-2.8-turbo

input:obligatoriostring

Texto a sintetizar (el endpoint nativo /v1/t2a_v2 admite hasta 10000 caracteres)

Longitud1–4096 caracteres

voice:opcionalstring

ID de voz del sistema, ID de voz clonada o nombre de voz de OpenAI alloy, ash, ballad, cedar, coral, echo, fable, marin, nova, onyx, sage, shimmer, verse (los nombres de OpenAI usan la voz predeterminada). Predeterminado: Chinese (Mandarin)_News_Anchor si el texto contiene caracteres chinos; si no, English_expressive_narrator

response_format:opcionalstring

aac devuelve 400; opus es Ogg a 24 kHz

Valoresmp3opusflacwavpcm

Predeterminado"mp3"

speed:opcionalnumber

Fuera de rango devuelve 400; los valores dentro del rango se ajustan a 0.5–2

Rango0.25–4Predeterminado1

instructions:opcionalstring

Se acepta pero se ignora

Respuesta

200Bytes de audio. Content-Type sigue a response_format: audio/mpeg, audio/ogg, audio/flac, audio/wav, audio/pcm

audio/mpeg Bytes de audio

Errores

400unknown field, input demasiado largo, speed fuera de rango, response_format no admitido
401Falta la clave, la clave no es válida o ha caducado (missing_api_key / invalid_api_key / api_key_expired)
402Se agotó el saldo o la cuota de la clave, del miembro o del departamento (insufficient_quota)
404El modelo no está en el grupo de esta clave (model_not_found) o la ruta no pertenece a ese grupo (route_not_found)
413El cuerpo de la solicitud supera 60 MB (request_too_large)
429Se alcanzó el límite de concurrencia de la cuenta o de la clave (user_concurrency_limit / apikey_concurrency_limit), con Retry-After

Páginas relacionadas