先说答案:在 HopBase 上做数字人口播有两条链路——kling-avatar 用 1-5 张人物照片 + 一段音频直接生成开口说话的视频(时长由音频决定);kling-lip-sync 给已有视频换台词/换语言(先人脸识别拿 session,再提交对口型任务)。可灵全线按官方牌价 75 折计费,任务失败不扣钱。本文给出可直接抄的完整调用流程。
两条链路怎么选
| kling-avatar(数字人) | kling-lip-sync(对口型) | |
|---|---|---|
| 输入 | 1-5 张人物图 + 音频 | 已有视频 + 新音频 |
| 典型用途 | 从零做口播:电商讲解、知识号、企业宣传 | 成片本地化:翻译台词、批量换文案 |
| 时长 | 由输入音频决定 | 由输入素材决定,按秒计费、5 秒下限 |
| 计费桶 | avatar_<分辨率>,按秒 | lip_sync,按秒(另有人脸识别按次) |
实战 A:照片变口播(kling-avatar)
第一步,提交任务。人物图给 1-5 张,音频在 extra.sound_file(公网 HTTP(S) 地址)与 extra.audio_id 中二选一;时长由音频决定,不要传 duration:
curl https://api.hop-base.com/v1/video/generate \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "kling-avatar",
"images": [{"url": "https://cdn.example.com/host.png"}],
"extra": {"sound_file": "https://cdn.example.com/voice.mp3"}
}'202 响应返回形如 kt57x… 的任务 ID。第二步,轮询任务:
curl https://api.hop-base.com/v1/video/tasks/kt57xYOUR_TASK_ID \
-H "Authorization: Bearer sk-你的密钥"状态走 queued → processing → completed / failed。第三步,完成后从 outputs 取 HopBase 中继地址,支持浏览器直接播放;请及时转存,插件不长期保存源文件。
三个容易踩的坑:素材 url 必须公网可直接下载(内网、相对路径、带认证的地址会被同步拒绝);每个素材项 url 与 file_id 只能二选一;素材内容(分辨率/格式/大小)由腾讯侧异步校验,不合规会在提交几分钟后以任务失败告终——但失败不计费。
实战 B:已有视频换台词(kling-lip-sync)
先对源视频做人脸识别(按次计费):
curl https://api.hop-base.com/v1/kling/faces \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{"videos":[{"url":"https://cdn.example.com/source.mp4"}]}'拿到 session 和人脸列表后,提交对口型任务——face_choose 必须恰好一项,含非空 face_id 与 sound_file:
curl https://api.hop-base.com/v1/video/generate \
-H "Authorization: Bearer sk-你的密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "kling-lip-sync",
"extra": {
"session_id": "face-session-id",
"face_choose": [{"face_id": "face-1", "sound_file": "https://cdn.example.com/voice-en.mp3"}]
}
}'注意:对口型按秒计费且有 5 秒下限(4 秒成片按 5 秒收);目前不支持指定音色,voice_ids / extra.voice_list 请勿发送。
计费:75 折与「失败不扣钱」
可灵经 HopBase 全线为官方牌价 75 折,代表档:kling-v3-omni 720p 无声 ¥0.45/秒(官方 ¥0.60)、1080p 有声 ¥0.75/秒(官方 ¥1.00)。数字人/对口型的具体桶价以 模型目录 与控制台实时口径为准。计费规则对生产友好:只有腾讯侧确认任务成功、产物合法且有计费时长时才产生一次扣费——排队失败、内容不合规、生成中断都不花钱,重试无心理负担。完整价目见 价格页可灵面板。
商用场景参考
电商口播矩阵:一套主播照片 + 批量商品讲解音频,循环调 avatar,多 SKU 一晚跑完;出海本地化:中文成片 + 翻译配音走 lip-sync,一条素材变 N 国语言;企业数字员工:固定形象 + 周更文案,把「拍摄」从内容流水线里删掉。搭配 Seedance 场景片段 混剪,一个 API Key 就是一条完整视频产线。
常见问题
能自选音色吗?暂不可以,等腾讯确认对应 SKU 后开放;当前音频内容完全由你上传的 sound_file 决定,可先用任意 TTS 生成。
从哪开始?控制台 注册建 Key(需已配置可灵 VOD 的分组),完整请求契约见 可灵接入文档;正式调用前先 GET /v1/models 确认密钥实际可用的模型 ID。