T2A v2 音声を作成
MiniMax T2A v2 ネイティブのリクエストボディ:全パラメータ、クローンボイス、SSE ストリーミング。JSON レスポンスの音声は 16 進数です。
/v1/t2a_v2MiniMax T2A v2 のリクエストボディをそのまま受け付けるので、公式 SDK のコードは Base URL とキーを変えるだけで再利用できます。ゲートウェイが認識しないフィールドもそのまま渡され、JSON レスポンスも公式の構造を踏襲します(エラーを除く)。2 つの音声モデルは独立したグループ MiniMax Speech 公式 に属し、チャットや動画のグループのキーでは呼び出せません。
ゲートウェイがここで行うのは 3 つだけです:model、text の長さ、stream と output_format を検証する。voice_setting.speed を公式の範囲内に丸める。リクエストボディを 1 MiB 以下に制限する。その他のフィールドで公式の範囲を超える値は、サービスが 400 を返します。
data.audio は 16 進数でエンコードされた音声、extra_info.usage_characters は課金文字数です。stream: true を渡すと SSE に切り替わります:各 data: {...} イベントに 16 進数の音声が 1 区切りずつ入り、最後のチャンクは data.status が 2 で extra_info が付きます。ストリーミングの途中で失敗した場合は、最後に base_resp 付きのイベントを 1 件送ってから切断し、課金されません。書き方はストリーム出力を参照してください。
クローンボイスは voice_setting.voice_id(または timber_weights[].voice_id)に指定します。ボイスの初回合成が成功した時点でクローン料金を 1 回だけ差し引き、使用記録の明細に voice_clone_activation が 1 項目追加されます。OpenAI の構造だけが必要な場合は POST /v1/audio/speech を使ってください。
ヘッダー
Bearer sk-…:コンソールの「API キー」で作成したキー。キーのグループにリクエストするモデルが含まれている必要があります
リクエストボディJSON
大文字小文字を区別、エイリアスなし
取りうる値speech-2.8-hdspeech-2.8-turbo
合成するテキスト。段落は改行で区切ります。ポーズ記号 <#x#>(秒数 0.01–99.99)、インラインの読み指定、感動詞に対応しています。音声合成ガイドを参照。公式は 3000 文字を超える場合はストリーミングを推奨しています
長さ1–10000 文字
true のときレスポンスが SSE に切り替わります
デフォルトfalse
ストリーミングオプション
true のとき最後のチャンクに完全な音声を含めません。ストリーミング時は true を推奨します。そうしないと最後のチャンクで音声全体がもう一度送られ、そのまま連結すると音声が二重になります
デフォルトfalse
その言語や方言の認識を強化します。auto はモデルが自動判定します。広東語のボイスには Chinese,Yue が必要です。指定しなければ設定されません
取りうる値autoChineseChinese,YueEnglishArabicRussianSpanishFrenchPortugueseGermanTurkishDutchUkrainianVietnameseIndonesianJapaneseItalianKoreanThaiPolishRomanianGreekCzechFinnishHindiBulgarianDanishHebrewMalayPersianSlovakSwedishCroatianFilipinoHungarianNorwegianSlovenianCatalanNynorskTamilAfrikaans
発音辞書
元の表記/置換 のルールで、複数を同時に適用できます。置換は通常のテキスト(omg/oh my god)、日本語の仮名(東京/トウキョウ)、括弧内に声調 1–5 を付けたピンイン(处理/(chu3)(li3))、または IPA(resume/(rɪˈzjuːm))にできます
ボイスの調整。公式の意味どおりにそのまま渡し、ゲートウェイ側では検証しません
低く重い → 明るい
範囲-100–100
力強い → 柔らかい
範囲-100–100
厚みのある → 澄んだ
範囲-100–100
音響効果。一度に 1 種類のみ。音響効果を使う場合、非ストリーミングは mp3 / wav / flac、ストリーミングは mp3 のみ対応
取りうる値spacious_echoauditorium_echolofi_telephonerobotic
hex のみ対応。url を渡すと 400 を返します
取りうる値hex
デフォルト"hex"
ボイス設定
システムボイスまたはクローンボイスの ID。大文字小文字、空白、括弧はそのまま渡します。システムボイスを参照
話速。公式の範囲は 0.5–2 で、範囲外の値はゲートウェイが範囲内に丸めます
デフォルト1
音量。0 より大きく、最大 10
範囲≤ 10デフォルト1
ピッチ。0 は元のピッチ
範囲-12–12デフォルト0
指定しなければテキストから自動判定されます。感情を固定したい場合のみ指定してください。fluent、whisper は公式には 2.6 シリーズでのみ利用可能と明記されており、whisper は Speech 2.8 では非対応と明記されています
取りうる値happysadangryfearfuldisgustedsurprisedcalmfluentwhisper
中国語・英語の数字の読み方を正規化します。遅延がわずかに増えます
デフォルトfalse
中国語のみ。数式は $$ で囲みます。有効にすると language_boost は強制的に Chinese になります
デフォルトfalse
音声設定
opus は Ogg/Opus コンテナ
取りうる値mp3pcmflacwavopus
デフォルト"mp3"
サンプリングレート。opus の場合は明示的な指定が必須です。公式は既定値を明記しておらず、公式の例では 32000 を使っています
取りうる値80001600022050240003200044100
ビットレート。mp3 でのみ有効。公式は既定値を明記しておらず、公式の例では 128000 を使っています
取りうる値3200064000128000256000
1 モノラル、2 ステレオ
取りうる値12
デフォルト1
固定ビットレート。ストリーミングの mp3 でのみ有効
デフォルトfalse
レスポンス
200非ストリーミングは JSON。stream: true のときは text/event-stream で、各イベントの data は以下と同じ構造です
16 進数でエンコードされた音声。ストリーミング時はこのチャンクの音声断片
ストリーミングの最後のチャンクで 2
音声のメタデータと課金文字数
課金文字数(正式な値):Unicode 文字 1 つにつき 1、漢字はさらに 1 を加算。句読点、空白、絵文字、ポーズ記号はそれぞれ 1
音声の長さ、ミリ秒
サンプリングレート
音声のバイト数
ビットレート
文字数
音声フォーマット。例:mp3
チャンネル数
成功時は {"status_code": 0, "status_msg": "success"}。エラーはここに入らず、200 以外のステータスコードと error オブジェクトで返されます
成功時は 0
成功時は success
エラー
model が非対応、text が空または 10000 文字超、output_format が hex でない、ボイス ID が存在しない、opus で sample_rate がない、値が公式の範囲外、センシティブな内容などmissing_api_key / invalid_api_key / api_key_expired)insufficient_quota)model_not_found)、またはパスがそのグループに属さない(route_not_found)request body exceeds the 1048576 byte limit (got N bytes)user_concurrency_limit / apikey_concurrency_limit)。Retry-After 付きresponse_size_limit_exceeded):stream: true に切り替える、テキストを短くする、またはビットレートを下げてください