音声を作成
OpenAI 互換の音声合成(MiniMax Speech 2.8 HD / Turbo)。レスポンスはそのまま音声のバイト列です。
/v1/audio/speechテキストを同期的に音声へ合成します。レスポンスは音声そのもので、ポーリングするタスクはありません。OpenAI SDK の audio.speech.create をそのまま使え、Base URL と model / voice を変えるだけです。2 つの音声モデルは独立したグループ MiniMax Speech 公式 に属し、チャットや動画のグループのキーでは呼び出せません。
その他のフィールドはすべて 400 unknown field を返します。stream_format、sample_rate、language_boost、voice_setting も含まれます。これらやストリーミング出力、クローンボイスが必要な場合は、ネイティブエンドポイント POST /v1/t2a_v2 を使ってください。音声合成ガイドを参照してください。文字数で課金され、漢字 1 文字は 2 文字として数えます。
ヘッダー
Bearer sk-…:コンソールの「API キー」で作成したキー。キーのグループにリクエストするモデルが含まれている必要があります
リクエストボディJSON
大文字小文字を区別し、エイリアスはありません。tts-1 / tts-1-hd は認識されません
取りうる値speech-2.8-hdspeech-2.8-turbo
合成するテキスト(ネイティブエンドポイント /v1/t2a_v2 の上限は 10000 文字)
長さ1–4096 文字
システムボイス ID、クローンボイス ID、または OpenAI のボイス名 alloy、ash、ballad、cedar、coral、echo、fable、marin、nova、onyx、sage、shimmer、verse(OpenAI のボイス名は既定のボイスになります)。既定値:テキストに漢字を含む場合は Chinese (Mandarin)_News_Anchor、それ以外は English_expressive_narrator
aac は 400 を返します。opus は 24 kHz の Ogg コンテナです
取りうる値mp3opusflacwavpcm
デフォルト"mp3"
範囲外は 400 を返します。範囲内の値は 0.5–2 に丸められます
範囲0.25–4デフォルト1
受け付けますが無視されます
レスポンス
200音声のバイト列。Content-Type は response_format に応じて audio/mpeg、audio/ogg、audio/flac、audio/wav、audio/pcm
audio/mpeg 音声のバイト列
エラー
unknown field、input が長すぎる、speed が範囲外、非対応の response_formatmissing_api_key / invalid_api_key / api_key_expired)insufficient_quota)model_not_found)、またはパスがそのグループに属さない(route_not_found)request_too_large)user_concurrency_limit / apikey_concurrency_limit)。Retry-After 付き