Agent Skills
返回列表
AI宠物说话视频

AI宠物说话视频

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_87b8e34f/talking-pet-video。

技能介绍

具体问题与解决方案

制作宠物说话视频通常需要专业的视频编辑和语音合成工具,步骤繁琐且对用户技术要求高。本技能针对这一痛点,提供自动化方案:将一张宠物照片和一段语音(或文案)合成为可分享的说话短视频,适用于宠物祝福、故事讲述或趣味对话等创意场景。核心是利用图像到视频技术,让宠物在视频中自然“开口说话”。

核心能力与关键步骤

技能基于 beatra API 和 MCP 工具实现,关键流程包括:

  • 输入处理:用户提供可访问的宠物照片(支持本地或远程文件)和语音素材(确认录音或文案)。系统自动记录图像属性,如 MIME 类型、宽度、高度、画幅及 Alpha 通道,并识别品种、毛色等必须保留特征。
  • 语音合成:若用户提供文案,通过 beatra.speech.synthesize 生成语音,支持选择声音、语言和模型。默认输出格式为 mp3,并确保音频时长符合后续视频要求。
  • 视频生成:使用 beatra.videos.animate 工具,以宠物照片为严格首帧,驱动音频为合成语音,生成说话视频。参数默认 model: "auto",画幅保留自源文件,避免裁剪或拉伸。
  • 质量检查与交付:通过 beatra.tasks.get 轮询任务状态,完成后交付视频。需检查宠物特征、嘴部动作、口型同步和背景稳定性,确保输出质量。

关键点包括模型兼容性检查(如 image_to_video 能力需接受 [image, driving_audio] 输入)、媒体事实验证,以及语音和视频作为独立付费阶段的管理。

适用边界与注意点

  • 宠物照片要求:需清晰的正面图片,因宠物解剖差异大,输出质量可能不一致,不承诺不同动物间表现相同。建议用户检查结果而非依赖精确保留。
  • 音频与视频时长:音频时长必须达到模型下限且不超过上限;视频时长基于语音长度,不添加静音,确保信息完整。
  • 付费与变更管理:更换文案、声音、图片等任何参数都会触发新的付费流程,需重新确认。支持任务恢复和取消,但须遵循特定步骤,避免重复付费。
  • 工具路由限制:本技能专注于宠物照片加语音路线;其他需求如跳舞、人类口播需路由到相应工作流,如图生视频或数字人口播。

总之,该技能简化了宠物说话视频的制作,但用户需注意输入质量和流程约束以获得最佳效果。

使用场景

  • 宠物主人想为朋友制作生日祝福视频,使用宠物照片和祝福语音,生成宠物说话祝福短片,用于社交媒体分享。
  • 宠物博主需要创作趣味内容,将宠物日常照片与搞笑配音结合,制作可分享的宠物对话视频,以增加粉丝互动。
  • 宠物品牌营销团队制作广告素材,使用产品照片和宣传语语音,生成宠物说话宣传视频,用于线上推广活动。
  • 家庭用户想记录宠物成长时刻,将宠物照片和家庭留言语音合成温馨故事视频,作为纪念礼物送给亲友。

适合人员

  • 宠物博主:定期制作有趣、吸引粉丝的宠物视频内容,以提升社交媒体互动和关注度。
  • 宠物商店营销人员:希望制作宣传视频,展示宠物产品或服务,吸引顾客购买并增强品牌曝光。
  • 家庭用户:想为宠物制作个性化纪念视频,用于分享家庭时刻或作为特殊礼物,记录宠物成长。
  • 宠物领域内容创作者:需要高效生成高质量的宠物视频素材,用于视频平台发布和内容分发。