Skip to content
上新Kimi K3 已上线:月之暗面旗舰、1M 上下文、缓存命中低至 $0.30/M查看模型价格
HopBase
← 返回博客

可灵数字人 API 接入实战:一张照片 + 一段音频,生成开口说话的口播视频

先说答案:在 HopBase 上做数字人口播有两条链路——kling-avatar 用 1-5 张人物照片 + 一段音频直接生成开口说话的视频(时长由音频决定);kling-lip-sync 给已有视频换台词/换语言(先人脸识别拿 session,再提交对口型任务)。可灵全线按官方牌价 75 折计费,任务失败不扣钱。本文给出可直接抄的完整调用流程。

两条链路怎么选

kling-avatar(数字人)kling-lip-sync(对口型)
输入1-5 张人物图 + 音频已有视频 + 新音频
典型用途从零做口播:电商讲解、知识号、企业宣传成片本地化:翻译台词、批量换文案
时长由输入音频决定由输入素材决定,按秒计费、5 秒下限
计费桶avatar_<分辨率>,按秒lip_sync,按秒(另有人脸识别按次)

实战 A:照片变口播(kling-avatar)

第一步,提交任务。人物图给 1-5 张,音频在 extra.sound_file(公网 HTTP(S) 地址)与 extra.audio_id二选一;时长由音频决定,不要传 duration:

curl https://api.hop-base.com/v1/video/generate \
  -H "Authorization: Bearer sk-你的密钥" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kling-avatar",
    "images": [{"url": "https://cdn.example.com/host.png"}],
    "extra": {"sound_file": "https://cdn.example.com/voice.mp3"}
  }'

202 响应返回形如 kt57x… 的任务 ID。第二步,轮询任务:

curl https://api.hop-base.com/v1/video/tasks/kt57xYOUR_TASK_ID \
  -H "Authorization: Bearer sk-你的密钥"

状态走 queued → processing → completed / failed。第三步,完成后从 outputs 取 HopBase 中继地址,支持浏览器直接播放;请及时转存,插件不长期保存源文件。

三个容易踩的坑:素材 url 必须公网可直接下载(内网、相对路径、带认证的地址会被同步拒绝);每个素材项 urlfile_id 只能二选一;素材内容(分辨率/格式/大小)由腾讯侧异步校验,不合规会在提交几分钟后以任务失败告终——但失败不计费。

实战 B:已有视频换台词(kling-lip-sync)

先对源视频做人脸识别(按次计费):

curl https://api.hop-base.com/v1/kling/faces \
  -H "Authorization: Bearer sk-你的密钥" \
  -H "Content-Type: application/json" \
  -d '{"videos":[{"url":"https://cdn.example.com/source.mp4"}]}'

拿到 session 和人脸列表后,提交对口型任务——face_choose 必须恰好一项,含非空 face_idsound_file:

curl https://api.hop-base.com/v1/video/generate \
  -H "Authorization: Bearer sk-你的密钥" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kling-lip-sync",
    "extra": {
      "session_id": "face-session-id",
      "face_choose": [{"face_id": "face-1", "sound_file": "https://cdn.example.com/voice-en.mp3"}]
    }
  }'

注意:对口型按秒计费且有 5 秒下限(4 秒成片按 5 秒收);目前不支持指定音色,voice_ids / extra.voice_list 请勿发送。

计费:75 折与「失败不扣钱」

可灵经 HopBase 全线为官方牌价 75 折,代表档:kling-v3-omni 720p 无声 ¥0.45/秒(官方 ¥0.60)、1080p 有声 ¥0.75/秒(官方 ¥1.00)。数字人/对口型的具体桶价以 模型目录 与控制台实时口径为准。计费规则对生产友好:只有腾讯侧确认任务成功、产物合法且有计费时长时才产生一次扣费——排队失败、内容不合规、生成中断都不花钱,重试无心理负担。完整价目见 价格页可灵面板

商用场景参考

电商口播矩阵:一套主播照片 + 批量商品讲解音频,循环调 avatar,多 SKU 一晚跑完;出海本地化:中文成片 + 翻译配音走 lip-sync,一条素材变 N 国语言;企业数字员工:固定形象 + 周更文案,把「拍摄」从内容流水线里删掉。搭配 Seedance 场景片段 混剪,一个 API Key 就是一条完整视频产线。

常见问题

能自选音色吗?暂不可以,等腾讯确认对应 SKU 后开放;当前音频内容完全由你上传的 sound_file 决定,可先用任意 TTS 生成。

从哪开始?控制台 注册建 Key(需已配置可灵 VOD 的分组),完整请求契约见 可灵接入文档;正式调用前先 GET /v1/models 确认密钥实际可用的模型 ID。