创建 T2A v2 音频
MiniMax T2A v2 原生请求体:完整参数、克隆音色与 SSE 流式;JSON 响应里的音频为十六进制。
/v1/t2a_v2原样接受 MiniMax T2A v2 请求体,官方 SDK 代码改 Base URL 与密钥即可复用;网关不认识的字段也原样透传,JSON 响应同样沿用官方结构(错误除外)。两个语音模型属于独立分组 MiniMax 语音 官方直连,对话或视频分组的密钥调不到。
网关在这里只做三件事:校验 model、text 长度、stream 与 output_format;把 voice_setting.speed 钳到官方区间;限制请求体 ≤1 MiB。其余字段超出官方范围的值由服务返回 400。
data.audio 是十六进制编码的音频,extra_info.usage_characters 是计费字符数。传 stream: true 切换为 SSE:每个 data: {...} 事件带一段十六进制音频,末块 data.status 为 2 并附 extra_info;流式中途失败时最后推一条带 base_resp 的事件后断流,不计费。写法见流式输出。
克隆音色填 voice_setting.voice_id(或 timber_weights[].voice_id)。音色首次合成成功时一并扣一次克隆费,使用记录明细里多一项 voice_clone_activation。只要 OpenAI 结构,用 POST /v1/audio/speech。
请求头
Bearer sk-…:控制台「API 密钥」里创建的密钥,所属分组须包含请求的模型
请求体参数JSON
区分大小写、无别名
可选值speech-2.8-hdspeech-2.8-turbo
要合成的文本,段落用换行分隔。支持停顿标记 <#x#>(秒数 0.01–99.99)、内联注音与语气词,见语音合成指南。官方建议超过 3000 字符走流式
长度1–10000 字符
true 时响应切换为 SSE
默认false
流式选项
true 时末块不再携带完整音频。流式时建议设为 true,否则末块会把整段音频再发一遍,直接追加会得到双份音频
默认false
增强对该语言或方言的识别;auto 由模型自动判断。粤语音色需要 Chinese,Yue。不传则不设置
可选值autoChineseChinese,YueEnglishArabicRussianSpanishFrenchPortugueseGermanTurkishDutchUkrainianVietnameseIndonesianJapaneseItalianKoreanThaiPolishRomanianGreekCzechFinnishHindiBulgarianDanishHebrewMalayPersianSlovakSwedishCroatianFilipinoHungarianNorwegianSlovenianCatalanNynorskTamilAfrikaans
发音词典
原文/替换 规则,多条同时生效。替换可以是普通文本(omg/oh my god)、日文假名(東京/トウキョウ)、括号里带声调 1–5 的拼音(处理/(chu3)(li3))或 IPA(resume/(rɪˈzjuːm))
音色调整,按官方语义透传,网关侧未校验
低沉 → 明亮
范围-100–100
有力 → 柔和
范围-100–100
浑厚 → 清脆
范围-100–100
音效,一次只能一种。使用音效时非流式支持 mp3 / wav / flac,流式只支持 mp3
可选值spacious_echoauditorium_echolofi_telephonerobotic
只支持 hex;传 url 返回 400
可选值hex
默认"hex"
音色设置
系统音色或克隆音色 ID,大小写、空格、括号原样传,见系统音色
语速,官方区间 0.5–2;超出该区间的值由网关钳到区间内
默认1
音量,大于 0、最大 10
范围≤ 10默认1
音高,0 为原始音高
范围-12–12默认0
不传则由文本自动判断,只在需要固定情绪时指定。fluent、whisper 官方只写明 2.6 系列可用;whisper 在 Speech 2.8 上明确不支持
可选值happysadangryfearfuldisgustedsurprisedcalmfluentwhisper
中英文数字读法归一,延迟略增
默认false
仅中文;公式用 $$ 包裹。开启后 language_boost 被强制为 Chinese
默认false
音频设置
opus 为 Ogg/Opus 封装
可选值mp3pcmflacwavopus
默认"mp3"
采样率;opus 时必须显式传。官方未写明默认值,官方示例用 32000
可选值80001600022050240003200044100
码率,仅 mp3 生效。官方未写明默认值,官方示例用 128000
可选值3200064000128000256000
1 单声道、2 立体声
可选值12
默认1
固定码率;仅流式 mp3 生效
默认false
返回
200非流式为 JSON;stream: true 时为 text/event-stream,每个事件的 data 与下面同构
十六进制编码的音频;流式时为本块的音频片段
流式末块为 2
音频元数据与计费字符数
计费字符数(权威值):每个 Unicode 字符计 1,汉字再加 1;标点、空格、emoji 与停顿标记各计 1
音频时长,毫秒
采样率
音频字节数
码率
字数
音频格式,如 mp3
声道数
成功时为 {"status_code": 0, "status_msg": "success"};错误不走这里,而是非 200 状态码加 error 对象
成功为 0
成功为 success
错误
model 不支持、text 为空或超过 10000 字符、output_format 不是 hex、音色 ID 不存在、opus 没带 sample_rate、取值超出官方范围、敏感内容等missing_api_key / invalid_api_key / api_key_expired)insufficient_quota)model_not_found),或路径不属于该分组(route_not_found)request body exceeds the 1048576 byte limit (got N bytes)user_concurrency_limit / apikey_concurrency_limit),带 Retry-Afterresponse_size_limit_exceeded):改用 stream: true、缩短文本或降低码率