Agent Skills
返回列表
AIM 数字人视频生成器

AIM 数字人视频生成器

设计多媒体 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_34d5ae4c/aim-digital-human-video。

技能介绍

解决的问题

当用户已有一个人物图片,希望它按指定音频或文案“开口说话”时,通常要处理 TTS、base64 上传、网关提交、轮询状态和密钥位置等多个步骤。这个 skill 把这些操作收敛成一条可复现流程:输入图片与音频/文案,输出可直接使用的视频链接。

核心工作流

  • 输入:人物图片本地路径;音频三选一:现成 --audio-path、文案加语音样本 --text / --voice-sample / --voice-sample-text、文案加预设语音 --voice-preset。
  • 生成:若提供文案,先通过 AEP 网关做 TTS;随后读取图片和音频,转 base64,提交 /video2,服务端返回 TOS 公开 URL。
  • 轮询:用 ffprobe 读取音频时长,按阶段调整 HTTP HEAD 轮询频率,减少无效请求。

边界与注意

  • 密钥只写入 skill 根目录 .env,键名为 aim-secret-key;未配置时需先完成自检。
  • 单次轮询默认 60 分钟超时,超时不代表失败,后续由 .task-history.jsonl 回扫确认。
  • 动作描述 prompt 不主动暴露;默认无音频且无指定语音时使用“中文女”预设。

使用场景

  • 拿到客户头像图片后,用一段文案和中文女声让数字人播报产品更新。
  • 已有品牌口播音频,需要把指定人物图片驱动成同步说话的视频。
  • 用一段语音样本克隆音色,再输入脚本生成指定人物的宣传视频。
  • 在密钥已配置的环境中,提交生成任务并轮询返回公开视频链接。

适合人员

  • 需要把客户头像变成口播视频的营销内容制作人员
  • 已有品牌音频或文案、想快速产出数字人播报的运营
  • 需要调用 AEP 网关生成视频并轮询 TOS 链接的工程师
  • 需要配置 aim-secret-key 并复跑数字人生成脚本的集成人员