跳到正文

创建语音

OpenAI 兼容的语音合成(MiniMax Speech 2.8 HD / Turbo),响应直接是音频字节。

POST/v1/audio/speech

把文本同步合成为音频,响应就是音频本身,没有任务要轮询。可直接套用 OpenAI SDK 的 audio.speech.create,只改 Base URL 与 model / voice。两个语音模型属于独立分组 MiniMax 语音 官方直连,对话或视频分组的密钥调不到。

其他字段一律返回 400 unknown field,包括 stream_format、sample_rate、language_boost、voice_setting——需要它们以及流式输出、克隆音色,请用原生入口 POST /v1/t2a_v2,见语音合成指南。按字符计费:一个汉字计 2 个字符。

请求头

Authorization:必填string

Bearer sk-…:控制台「API 密钥」里创建的密钥,所属分组须包含请求的模型

请求体参数JSON

model:必填string

区分大小写、无别名;tts-1 / tts-1-hd 不被识别

可选值speech-2.8-hdspeech-2.8-turbo

input:必填string

要合成的文本(原生入口 /v1/t2a_v2 上限 10000 字符)

长度1–4096 字符

voice:可选string

系统音色 ID、克隆音色 ID,或 OpenAI 音色名 alloy、ash、ballad、cedar、coral、echo、fable、marin、nova、onyx、sage、shimmer、verse(OpenAI 音色名落到默认音色)。默认:文本含汉字为 Chinese (Mandarin)_News_Anchor,否则 English_expressive_narrator

response_format:可选string

aac 返回 400;opus 为 24 kHz 的 Ogg 封装

可选值mp3opusflacwavpcm

默认"mp3"

speed:可选number

超出范围返回 400;范围内的值会被钳到 0.5–2

范围0.25–4默认1

instructions:可选string

接受但忽略

返回

200音频字节。Content-Type 随 response_format:audio/mpeg、audio/ogg、audio/flac、audio/wav、audio/pcm

audio/mpeg 音频字节

错误

400unknown field、input 超长、speed 越界、不支持的 response_format
401没带密钥、密钥无效或已过期(missing_api_key / invalid_api_key / api_key_expired)
402余额或密钥 / 成员 / 部门额度用完(insufficient_quota)
404模型不在这把密钥的分组里(model_not_found),或路径不属于该分组(route_not_found)
413请求体超过 60 MB(request_too_large)
429帐户或密钥并发已达上限(user_concurrency_limit / apikey_concurrency_limit),带 Retry-After

相关页面