Agent Skills
返回列表
Gemini 2.5 多语言语音合成

Gemini 2.5 多语言语音合成

设计多媒体 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f95f21b8/dlazy-gemini-2-5-tts。

技能介绍

解决的问题

在多语言产品、自动化工作流或原型验证中,团队常常需要把文本快速转成可交付音频,但本地 TTS 部署成本高,模型自然度又未必稳定。gemini 2.5 tts 把 Gemini 2.5 文本转语音 封装成命令式技能,适合在 Agent 流程中按需调用:给一段 prompt、参数或本地文件路径,返回 dLazy API 生成的音频结果,而不是要求工程师自行维护模型服务。

核心工作方式

该技能是 @dlazy/cli 的轻量封装,核心是调用 dLazy 托管接口完成推理与媒体处理。关键步骤包括:

  • 鉴权:通过 CLI 保存 dLazy API key,或每次通过 DLAZY_API_KEY 传入;key 可从 dLazy 控制台轮换或吊销。
  • 调用:执行 dlazy gemini-2.5-tts,传入 prompt 与相关参数;参数也支持 @N、@stdin 等管道引用,便于串联上游输出。
  • 文件处理:若传入本地图片、视频或音频路径,技能会交给 dLazy 媒体存储处理,最终输出 URL 通常由 files.dlazy.com 托管。
  • 异步任务:带 --no-wait 时返回 task 字段,需要继续用 dlazy status 轮询结果。

适用边界与注意点

它适合需要稳定云推理结果的场景,不适合完全离线或数据不出内网的要求,因为 prompt、参数与本地文件路径可能经过 dLazy API。遇到 unauthorized、insufficient_balance 或后端安全策略错误时,应按提示补齐 key、充值或调整输入。该技能主要提供语音生成调用能力,不负责音频后期、字幕对齐或复杂音色工程。

使用场景

  • 在自动化工作流中把英文新闻稿转成旁白音频,用于产品演示视频。
  • 为多语言应用生成西班牙语和日语提示音,替换当前本地 TTS 输出。
  • 在原型阶段快速把 Markdown 文案转成可试听音频,验证发音是否自然。
  • 通过 `--no-wait` 提交批量语音生成任务,再用 `dlazy status` 轮询结果。

适合人员

  • 需要把产品文案批量转成多语言旁白的产品工程师。
  • 在 Agent 流程里调用云 TTS 完成语音资产生成的全栈开发者。
  • 做原型验证并需要快速试听自然度、而不是自建推理服务的内容技术负责人。