跳到正文

建立語音

OpenAI 相容的語音合成(MiniMax Speech 2.8 HD / Turbo),回應直接是音訊位元組。

POST/v1/audio/speech

把文字同步合成為音訊,回應就是音訊本身,沒有任務要輪詢。可直接套用 OpenAI SDK 的 audio.speech.create,只改 Base URL 與 model / voice。兩個語音模型屬於獨立分組 MiniMax 語音 官方直連,對話或影片分組的金鑰調不到。

其他欄位一律回傳 400 unknown field,包括 stream_format、sample_rate、language_boost、voice_setting——需要它們以及串流輸出、複製音色,請用原生入口 POST /v1/t2a_v2,見語音合成指南。按字元計費:一個漢字計 2 個字元。

請求標頭

Authorization:必填string

Bearer sk-…:主控台「API 金鑰」中建立的金鑰,所屬分組須包含請求的模型

請求主體參數JSON

model:必填string

區分大小寫、無別名;tts-1 / tts-1-hd 不被識別

可選值speech-2.8-hdspeech-2.8-turbo

input:必填string

要合成的文字(原生入口 /v1/t2a_v2 上限 10000 字元)

長度1–4096 字元

voice:選填string

系統音色 ID、複製音色 ID,或 OpenAI 音色名 alloy、ash、ballad、cedar、coral、echo、fable、marin、nova、onyx、sage、shimmer、verse(OpenAI 音色名落到預設音色)。預設:文字含漢字為 Chinese (Mandarin)_News_Anchor,否則 English_expressive_narrator

response_format:選填string

aac 回傳 400;opus 為 24 kHz 的 Ogg 封裝

可選值mp3opusflacwavpcm

預設"mp3"

speed:選填number

超出範圍回傳 400;範圍內的值會被鉗到 0.5–2

範圍0.25–4預設1

instructions:選填string

接受但忽略

回傳

200音訊位元組。Content-Type 隨 response_format:audio/mpeg、audio/ogg、audio/flac、audio/wav、audio/pcm

audio/mpeg 音訊位元組

錯誤

400unknown field、input 超長、speed 越界、不支援的 response_format
401沒帶金鑰、金鑰無效或已過期(missing_api_key / invalid_api_key / api_key_expired)
402餘額或金鑰 / 成員 / 部門額度用完(insufficient_quota)
404模型不在這把金鑰的分組裡(model_not_found),或路徑不屬於該分組(route_not_found)
413請求體超過 60 MB(request_too_large)
429帳戶或金鑰並行已達上限(user_concurrency_limit / apikey_concurrency_limit),帶 Retry-After

相關頁面