本文へスキップ

音声を作成

OpenAI 互換の音声合成(MiniMax Speech 2.8 HD / Turbo)。レスポンスはそのまま音声のバイト列です。

POST/v1/audio/speech

テキストを同期的に音声へ合成します。レスポンスは音声そのもので、ポーリングするタスクはありません。OpenAI SDK の audio.speech.create をそのまま使え、Base URL と model / voice を変えるだけです。2 つの音声モデルは独立したグループ MiniMax Speech 公式 に属し、チャットや動画のグループのキーでは呼び出せません。

その他のフィールドはすべて 400 unknown field を返します。stream_format、sample_rate、language_boost、voice_setting も含まれます。これらやストリーミング出力、クローンボイスが必要な場合は、ネイティブエンドポイント POST /v1/t2a_v2 を使ってください。音声合成ガイドを参照してください。文字数で課金され、漢字 1 文字は 2 文字として数えます。

ヘッダー

Authorization:必須string

Bearer sk-…:コンソールの「API キー」で作成したキー。キーのグループにリクエストするモデルが含まれている必要があります

リクエストボディJSON

model:必須string

大文字小文字を区別し、エイリアスはありません。tts-1 / tts-1-hd は認識されません

取りうる値speech-2.8-hdspeech-2.8-turbo

input:必須string

合成するテキスト(ネイティブエンドポイント /v1/t2a_v2 の上限は 10000 文字)

長さ1–4096 文字

voice:任意string

システムボイス ID、クローンボイス ID、または OpenAI のボイス名 alloy、ash、ballad、cedar、coral、echo、fable、marin、nova、onyx、sage、shimmer、verse(OpenAI のボイス名は既定のボイスになります)。既定値:テキストに漢字を含む場合は Chinese (Mandarin)_News_Anchor、それ以外は English_expressive_narrator

response_format:任意string

aac は 400 を返します。opus は 24 kHz の Ogg コンテナです

取りうる値mp3opusflacwavpcm

デフォルト"mp3"

speed:任意number

範囲外は 400 を返します。範囲内の値は 0.5–2 に丸められます

範囲0.25–4デフォルト1

instructions:任意string

受け付けますが無視されます

レスポンス

200音声のバイト列。Content-Type は response_format に応じて audio/mpeg、audio/ogg、audio/flac、audio/wav、audio/pcm

audio/mpeg 音声のバイト列

エラー

400unknown field、input が長すぎる、speed が範囲外、非対応の response_format
401キー未指定、キーが無効または期限切れ(missing_api_key / invalid_api_key / api_key_expired)
402残高、またはキー・メンバー・部門のクォータを使い切った(insufficient_quota)
404モデルがこのキーのグループにない(model_not_found)、またはパスがそのグループに属さない(route_not_found)
413リクエストボディが 60 MB を超えた(request_too_large)
429アカウントまたはキーの同時実行数が上限に達した(user_concurrency_limit / apikey_concurrency_limit)。Retry-After 付き

関連ページ