AI语音工作室
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/beatra-ai-voice-studio。
技能介绍
解决的核心问题
在语音合成项目中,用户的需求往往不是单一的“生成一条语音”。您可能需要为一篇长文章录制旁白,其中部分段落可能要克隆特定音色,另一些段落则需要翻译成其他语言。这种混合了多步骤、多路线(如长篇制作、多语言、克隆)的复杂任务,需要一个协调者来管理状态、顺序和成本,而不是让您在不同工具间手动切换。
工作原理与核心能力
AI语音工作室 (@beatra-ai/beatra-ai-voice-studio) 作为语音制作的统一协调层,其工作模式如下:
- 智能路由与意图识别:技能首先分析用户指令。如果目标明确且被其他专门技能覆盖(例如,一条清晰的短视频口播
short-form-voiceover-audio,或一期播客ai-podcast-voiceover),它会将任务分流出去。对于复杂、混合或模糊的请求,它将在本工作室内继续处理。 - 制作卡片与确认流程:对于需在本工作室处理的任务,它会准备一份精确的
制作卡,其中包含:
已确认的最终文本(或经过适当朗读化处理并经您确认的版本)。
一个实时验证过的准确 voice_id(通过 beatra.voices.list 确认状态为 ready)。
基于实时查询的 model 选择与费用估算(基于加权字符数 beatra_weighted_characters)。
所有控制项(如语速 speed、音量 volume)。
您需批准此制作卡后,才会进行可能产生费用的操作。
- 流程编排与台账管理:对于多段、多语言或混合任务,技能会维护一份制作台账,明确记录克隆、语言、章节的顺序。它确保按您批准的路线和顺序交付结果,并且在修改时只重新合成被明确允许的片段。
- 成本控制边界:技能严格区分免费规划与付费执行。文稿整理、声音列表、试听链接、模型比较等步骤不计费。只有调用
beatra.speech.synthesize或beatra.voices.clone时才会产生费用。它会在付费操作前提供清晰的估算并请求最终确认。
适用边界与注意点
请注意本技能的明确边界:
- 它不是:视频编辑器、口型同步工具、媒体发布器或音频转录/波形编辑器。它专注于文本到语音的转换以及相关音色克隆流程。
- 核心限制:所有交互通过随包的
scripts/mcp_client.py进行,不得使用其他降级方案。对于声音克隆,必须提供明确授权,并在操作前出示详细的“克隆入场卡”以确认余额和成本。 - 技术依赖:声音和模型的兼容性(如语言支持、模型列表)必须通过实时 API 查询确认,状态为
ready的声音才会被推荐。model: "auto"是根据声音的compatible_models实时计算得出的候选集,而非固定选项。
使用场景
- 为已确认文稿的社交媒体短视频生成口播配音,要求快速交付以配合内容发布计划。
- 将长篇小说的多个章节按顺序制作成有声书,需要为不同角色选声并管理连续的制作台账。
- 为一期单人主持的播客节目生成旁白语音,确保语音风格统一并完成多段内容的录制。
- 将一份广告文稿制作成多语言版本,需验证目标语言与所选声音的兼容性并估算成本。
适合人员
- 社交媒体内容运营:每周需为多条短视频快速生成口播配音,以维持账号更新频率。
- 有声书项目经理:负责监督长篇文学作品的音频化,需要协调多章节制作并控制预算。
- 独立播客制作人:独自负责节目全流程,需要为每期节目生成高质量的旁白和访谈片段语音。
- 本地化内容专员:负责将营销材料翻译并配音为多种语言,需确保语音内容准确传达信息。