建立 T2A v2 音訊
MiniMax T2A v2 原生請求體:完整參數、複製音色與 SSE 串流;JSON 回應裡的音訊為十六進位。
/v1/t2a_v2原樣接受 MiniMax T2A v2 請求體,官方 SDK 程式碼改 Base URL 與金鑰即可複用;網關不認識的欄位也原樣透傳,JSON 回應同樣沿用官方結構(錯誤除外)。兩個語音模型屬於獨立分組 MiniMax 語音 官方直連,對話或影片分組的金鑰呼叫不到。
網關在這裡只做三件事:校驗 model、text 長度、stream 與 output_format;把 voice_setting.speed 鉗到官方區間;限制請求體 ≤1 MiB。其餘欄位超出官方範圍的值由服務回傳 400。
data.audio 是十六進位編碼的音訊,extra_info.usage_characters 是計費字元數。傳 stream: true 切換為 SSE:每個 data: {...} 事件帶一段十六進位音訊,末塊 data.status 為 2 並附 extra_info;串流中途失敗時最後推一條帶 base_resp 的事件後斷流,不計費。寫法見串流輸出。
複製音色填 voice_setting.voice_id(或 timber_weights[].voice_id)。音色首次合成成功時一併扣一次複製費,使用記錄明細裡多一項 voice_clone_activation。只要 OpenAI 結構,用 POST /v1/audio/speech。
請求標頭
Bearer sk-…:主控台「API 金鑰」中建立的金鑰,所屬分組須包含請求的模型
請求主體參數JSON
區分大小寫、無別名
可選值speech-2.8-hdspeech-2.8-turbo
要合成的文字,段落用換行分隔。支援停頓標記 <#x#>(秒數 0.01–99.99)、行內注音與語氣詞,見語音合成指南。官方建議超過 3000 字元走串流
長度1–10000 字元
true 時回應切換為 SSE
預設false
串流選項
true 時末塊不再攜帶完整音訊。串流時建議設為 true,否則末塊會把整段音訊再發一遍,直接追加會得到雙份音訊
預設false
增強對該語言或方言的辨識;auto 由模型自動判斷。粵語音色需要 Chinese,Yue。不傳則不設定
可選值autoChineseChinese,YueEnglishArabicRussianSpanishFrenchPortugueseGermanTurkishDutchUkrainianVietnameseIndonesianJapaneseItalianKoreanThaiPolishRomanianGreekCzechFinnishHindiBulgarianDanishHebrewMalayPersianSlovakSwedishCroatianFilipinoHungarianNorwegianSlovenianCatalanNynorskTamilAfrikaans
發音詞典
原文/替換 規則,多條同時生效。替換可以是普通文字(omg/oh my god)、日文假名(東京/トウキョウ)、括號裡帶聲調 1–5 的拼音(處理/(chu3)(li3))或 IPA(resume/(rɪˈzjuːm))
音色調整,按官方語義透傳,網關側未校驗
低沉 → 明亮
範圍-100–100
有力 → 柔和
範圍-100–100
渾厚 → 清脆
範圍-100–100
音效,一次只能一種。使用音效時非串流支援 mp3 / wav / flac,串流只支援 mp3
可選值spacious_echoauditorium_echolofi_telephonerobotic
只支援 hex;傳 url 回傳 400
可選值hex
預設"hex"
音色設定
系統音色或複製音色 ID,大小寫、空格、括號原樣傳,見系統音色
語速,官方區間 0.5–2;超出該區間的值由網關鉗到區間內
預設1
音量,大於 0、最大 10
範圍≤ 10預設1
音高,0 為原始音高
範圍-12–12預設0
不傳則由文字自動判斷,只在需要固定情緒時指定。fluent、whisper 官方只寫明 2.6 系列可用;whisper 在 Speech 2.8 上明確不支援
可選值happysadangryfearfuldisgustedsurprisedcalmfluentwhisper
中英文數字讀法歸一,延遲略增
預設false
僅中文;公式用 $$ 包裹。開啟後 language_boost 被強制為 Chinese
預設false
音訊設定
opus 為 Ogg/Opus 封裝
可選值mp3pcmflacwavopus
預設"mp3"
取樣率;opus 時必須顯式傳。官方未寫明預設值,官方示例用 32000
可選值80001600022050240003200044100
位元率,僅 mp3 生效。官方未寫明預設值,官方示例用 128000
可選值3200064000128000256000
1 單聲道、2 立體聲
可選值12
預設1
固定位元率;僅串流 mp3 生效
預設false
回傳
200非串流為 JSON;stream: true 時為 text/event-stream,每個事件的 data 與下面同構
十六進位編碼的音訊;串流時為本塊的音訊片段
串流末塊為 2
音訊中繼資料與計費字元數
計費字元數(權威值):每個 Unicode 字元計 1,漢字再加 1;標點、空格、emoji 與停頓標記各計 1
音訊時長,毫秒
取樣率
音訊位元組數
位元率
字數
音訊格式,如 mp3
聲道數
成功時為 {"status_code": 0, "status_msg": "success"};錯誤不走這裡,而是非 200 狀態碼加 error 物件
成功為 0
成功為 success
錯誤
model 不支援、text 為空或超過 10000 字元、output_format 不是 hex、音色 ID 不存在、opus 沒帶 sample_rate、取值超出官方範圍、敏感內容等missing_api_key / invalid_api_key / api_key_expired)insufficient_quota)model_not_found),或路徑不屬於該分組(route_not_found)request body exceeds the 1048576 byte limit (got N bytes)user_concurrency_limit / apikey_concurrency_limit),帶 Retry-Afterresponse_size_limit_exceeded):改用 stream: true、縮短文字或降低位元率