AIM 数字人视频生成器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_34d5ae4c/aim-digital-human-video。
技能介绍
解决的问题
当用户已有一个人物图片,希望它按指定音频或文案“开口说话”时,通常要处理 TTS、base64 上传、网关提交、轮询状态和密钥位置等多个步骤。这个 skill 把这些操作收敛成一条可复现流程:输入图片与音频/文案,输出可直接使用的视频链接。
核心工作流
- 输入:人物图片本地路径;音频三选一:现成
--audio-path、文案加语音样本--text/--voice-sample/--voice-sample-text、文案加预设语音--voice-preset。 - 生成:若提供文案,先通过 AEP 网关做 TTS;随后读取图片和音频,转 base64,提交
/video2,服务端返回 TOS 公开 URL。 - 轮询:用
ffprobe读取音频时长,按阶段调整 HTTP HEAD 轮询频率,减少无效请求。
边界与注意
- 密钥只写入 skill 根目录
.env,键名为aim-secret-key;未配置时需先完成自检。 - 单次轮询默认 60 分钟超时,超时不代表失败,后续由
.task-history.jsonl回扫确认。 - 动作描述
prompt不主动暴露;默认无音频且无指定语音时使用“中文女”预设。
使用场景
- 拿到客户头像图片后,用一段文案和中文女声让数字人播报产品更新。
- 已有品牌口播音频,需要把指定人物图片驱动成同步说话的视频。
- 用一段语音样本克隆音色,再输入脚本生成指定人物的宣传视频。
- 在密钥已配置的环境中,提交生成任务并轮询返回公开视频链接。
适合人员
- 需要把客户头像变成口播视频的营销内容制作人员
- 已有品牌音频或文案、想快速产出数字人播报的运营
- 需要调用 AEP 网关生成视频并轮询 TOS 链接的工程师
- 需要配置 aim-secret-key 并复跑数字人生成脚本的集成人员