Agent Skills
返回列表
AI照片唱歌视频

AI照片唱歌视频

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_87b8e34f/photo-singing-video。

技能介绍

核心问题:从静态图像到动态歌唱

给定一张静态人像照片和一段唱歌音频,如何生成一个开口唱歌、表情自然的视频?这个需求常见于制作祝福短片、趣味内容或虚拟形象表演。关键挑战在于音频驱动动画,确保嘴型、面部肌肉运动与歌曲节奏、情感保持同步,同时保持人物特征、背景和整体构图的稳定。简单的自动配音工具可能无法实现逼真的唱歌动作,而视频编辑工作流又过于复杂,不适合快速生成。

工作流程与技术要点

本技能提供了一条清晰的流水线,专注于解决上述问题:

  1. 输入验证与准备:流程始于对两个硬性输入的严格检查:

人像照片:必须是一张清晰可访问的图片,技能会记录其格式 (MIME type)、尺寸、画幅、是否有透明通道 (Alpha channel) 等技术属性。
唱歌音频:必须是一个简短的歌曲片段(非口播语音),并验证其格式、时长和大小。
* 技能会复用已知的上下文信息(如用途、背景),并仅要求提供缺失项。对于本地文件,使用安全的上传助手传输。

  1. 模型准入与配置:在调用生成服务前,会先查询可用模型列表 (beatra.models.list),筛选出支持 image_to_video 能力且兼容当前图片和音频格式的模型。这是一个关键的技术过滤步骤,确保后续流程可行。
  1. 任务提交与执行:通过随包的 mcp_client.py 工具,构造一个包含图片、音频、提示词(指导演唱风格)和时长的冻结请求 (client_request_id),并调用 beatra.videos.animate 接口提交任务。音频时长决定视频时长,系统会选择一个不截断音频的最小支持时长。
  1. 轮询与结果交付:提交后,持续轮询任务状态 (beatra.tasks.get) 直到完成。最终交付视频素材或链接,并报告实际状态、使用的模型、尺寸、时长和计费详情。最后会审阅视频质量,检查人物一致性、唱歌同步性和背景稳定性。

适用边界与关键约束

  • 专注唱歌:本技能专为“唱歌”动作优化。其他需求应路由到对应工作流:如说话口播(数字人口播)、宠物说话、通用图生视频或音乐主导的视频。
  • 音频是唯一驱动源:歌词文本不起作用,必须使用真实的音频文件来驱动嘴型和表情动画。
  • 付费与状态管理:更换输入素材(人像、音频)或关键参数(提示词、模型)会生成一个新的、独立的付费任务。支持任务重放、查询和取消,但需遵循严格的防重复付费原则。
  • 质量预期:目标是产生有表现力的唱歌动作和稳定的画面,但不承诺完美口型同步或精确保留所有细节。对于需要大幅修改人像的情况,应先使用图像编辑工具处理。
  • 安全与更新:运行时工具 (mcp_client.py) 会静默检查更新,但不影响当前任务执行,且仅从官方固定地址下载,保证安全。

使用场景

  • 使用家人或朋友的已有清晰照片,配合一段现成的唱歌音频片段,快速生成一个会开口唱歌的生日祝福视频。
  • 为社交媒体账号制作趣味内容,将品牌卡通吉祥物或插画人物的静态图片,配上一段定制歌曲音频,转化为动态表演短片。
  • 在数字纪念或怀旧项目中,将历史人像照片或老照片与一段怀旧歌曲音频结合,生成动态的“老照片唱歌”纪念视频。
  • 为虚拟主播或数字人IP项目进行前期效果验证,使用一张角色设计图和一段demo音频,快速预览其唱歌时的口型与表情表现。

适合人员

  • 需要为客户或亲友制作个性化祝福视频的活动策划或内容创作者,手头有合适的照片和一段歌曲片段。
  • 负责运营趣味或怀旧主题社交媒体账号的编辑,希望通过老照片动态化等方式制作吸引人的内容。
  • 游戏、动画或虚拟形象设计工作室的初级设计师或制作人,需要快速验证静态角色在唱歌场景下的视觉效果。
  • 个人用户想为家庭聚会、宠物留念等场合制作一段生动有趣的纪念短片,已有一张照片和喜欢的背景音乐。