Gemini 2.5 多语言语音合成
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f95f21b8/dlazy-gemini-2-5-tts。
技能介绍
解决的问题
在多语言产品、自动化工作流或原型验证中,团队常常需要把文本快速转成可交付音频,但本地 TTS 部署成本高,模型自然度又未必稳定。gemini 2.5 tts 把 Gemini 2.5 文本转语音 封装成命令式技能,适合在 Agent 流程中按需调用:给一段 prompt、参数或本地文件路径,返回 dLazy API 生成的音频结果,而不是要求工程师自行维护模型服务。
核心工作方式
该技能是 @dlazy/cli 的轻量封装,核心是调用 dLazy 托管接口完成推理与媒体处理。关键步骤包括:
- 鉴权:通过 CLI 保存 dLazy API key,或每次通过
DLAZY_API_KEY传入;key 可从 dLazy 控制台轮换或吊销。 - 调用:执行
dlazy gemini-2.5-tts,传入 prompt 与相关参数;参数也支持@N、@stdin等管道引用,便于串联上游输出。 - 文件处理:若传入本地图片、视频或音频路径,技能会交给 dLazy 媒体存储处理,最终输出 URL 通常由
files.dlazy.com托管。 - 异步任务:带
--no-wait时返回task字段,需要继续用dlazy status轮询结果。
适用边界与注意点
它适合需要稳定云推理结果的场景,不适合完全离线或数据不出内网的要求,因为 prompt、参数与本地文件路径可能经过 dLazy API。遇到 unauthorized、insufficient_balance 或后端安全策略错误时,应按提示补齐 key、充值或调整输入。该技能主要提供语音生成调用能力,不负责音频后期、字幕对齐或复杂音色工程。
使用场景
- 在自动化工作流中把英文新闻稿转成旁白音频,用于产品演示视频。
- 为多语言应用生成西班牙语和日语提示音,替换当前本地 TTS 输出。
- 在原型阶段快速把 Markdown 文案转成可试听音频,验证发音是否自然。
- 通过 `--no-wait` 提交批量语音生成任务,再用 `dlazy status` 轮询结果。
适合人员
- 需要把产品文案批量转成多语言旁白的产品工程师。
- 在 Agent 流程里调用云 TTS 完成语音资产生成的全栈开发者。
- 做原型验证并需要快速试听自然度、而不是自建推理服务的内容技术负责人。