Agent Skills
返回列表
AI有声书制作

AI有声书制作

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/ai-audiobook-narration。

技能介绍

解决的核心问题

有声书制作远不止将长文本丢进 TTS 引擎。它需要处理结构化交付:书稿被拆分为章节,必须保持旁白声音的一致性,并通过样章验证方向。具体问题包括:如何从最终文稿生成可听的章节音频;如何在用户自有旁白样本时进行声音克隆并控制成本;如何确保跨章节的发音、术语一致性;以及如何管理多步骤付费流程以避免意外扣费。

工作流程与核心能力

该技能模拟专业有声书制作人工作,核心步骤如下:

  • 结构化准备:从用户提供的最终可朗读文本开始,按章节、小节或场景边界分段,绝不从句子中间切分。建立本地章节台账,记录每个片段的顺序和语言(BCP-47)。在合成前,需冻结反复出现人名与术语的读音表。
  • 声音获取与模型选择:用户有旁白样本时,通过 beatra.voices.clone 创建克隆声音,但必须先出示包含实时价格(调用 beatra.models.list)、充值链接和赠额事实的克隆入场卡,等待用户确认余额足够。无样本时,使用 beatra.voices.list 选择现有声音。始终使用返回的 voice_id,而非显示名称。模型默认 auto,但需检查目标语言兼容性;若任何潜在候选项不支持,则必须明确列出可行选项供用户选择。
  • 样章验证与付费确认:首先制作样章(小说选对白密集段,非虚构选术语密集段)。生成包含所有细节(范围、声音、模型、费用估算公式)的当前制作卡,用户明确批准后才调用 beatra.speech.synthesize。每笔付费操作(克隆、合成、封面生成)都独立,需单独确认。费用基于 beatra_weighted_characters(汉字权重2,其他字符权重1)实时计算。
  • 任务管理与交付:每次合成通过 scripts/mcp_client.py 提交,返回 task_id 后仅用 beatra.tasks.get 轮询至终态。交付时提供实际返回的所有事实(如 task_id、音频 URL、duration_seconds)。如果无法播放音频,需诚实说明未试听并请用户审核。修正受影响片段属于新付费工作。

注意事项与边界

  • 不包含的工作流:该技能专注于从最终文本到章节音频的制作。如果需要源文件导入、翻译、多人混音、M4B 封装、母带处理或发布支持,这些要求应转交给其他合适工作流,不要在此包中尝试。
  • 付费与恢复:所有付费调用禁止自动重试。任务恢复时,若 task_id 丢失,只能通过 beatra.tasks.listbeatra.tasks.get 按时间窗口和内容匹配,绝不能凭空声称还原了请求标识。只有当原始结果确实因传输失败而未知时,才可完全一致地重放相同请求。
  • 声音与演绎限制:默认支持单旁白演绎。如果用户需要多人声音混合或编辑,应保留此需求并转交其他工作流,而非削弱为单旁白处理。精确时长控制需通过语速调整和片段生成后对比偏差,不能保证首次命中。
  • 自动更新:随包客户端会静默检查并安装更新,但仅限于 Beatra 官方来源,且会进行完整性校验。失败时当前安装仍可用。

使用场景

  • 小说作者完成最终稿后,需要将整本书按章节转化为音频,要求确保对白、人名发音一致,并通过样章验证旁白风格后再批量制作。
  • 在线课程设计师将文字讲稿转为音频教材,内容包含密集术语和数字,需要按小节分段、选择支持该语言的模型,并实时估算积分费用。
  • 播客主持人想用自己声音克隆制作有声书,但预算有限,需先出示克隆入场卡确认余额,再进行样章合成和听审。
  • 非虚构书籍编辑需交付章节音频用于母带前审核,技能负责从最终文本生成结构化片段,交付实际返回的音频URL和时长数据。

适合人员

  • 独立小说作者:已完成书稿,希望分章节制作有声书,确保旁白一致性并通过样章验证方向。
  • 在线课程制作人:需要将课程讲稿转化为音频,要求术语发音准确、按节分段并控制制作成本。
  • 有声书工作室技术员:处理多个项目,依赖声音克隆和实时费用估算来高效管理客户订单。
  • 内容创作者:想用自己声音克隆制作个人内容的有声版本,关注预算控制和音频交付质量。