Agent Skills
返回列表
小右语音助手

小右语音助手

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_aae27d93/openclawhearspeak。

技能介绍

解决的问题

在本地 Linux 终端里,语音助手常常需要联网唤醒、手动控制录音时长,并且和 Web UI 会话互相干扰。openclawHearSpeak 面向这类场景,用离线关键词唤醒、自动端点检测和独立会话,把“唤醒、听清、问 Agent、播回答”串成一条本地语音链路。

工作方式与注意点

  • 唤醒与录音:使用 sherpa-onnx 做离线关键词检测,默认唤醒词为“小右”;启动后进入后台静默监听,听到唤醒词后开始录音,并用 VAD 判断用户开始和结束说话。资料中提到用户说完后约 1.5s 自动结束录音,唤醒后超过 5s 未说话会超时退出。
  • 识别与对话:语音通过 SILICONFLOW_API_KEY 配置的硅基流动 ASR 服务识别为中文普通话文本,再交给 OpenClaw Agent 处理。回复采用消息订阅方式流式接收,并使用独立干净会话,避免与 Web UI 会话冲突;网关处理中会周期性播报等待提示。
  • 输出与设备:最终回答通过 Edge-TTS 合成语音播放,并过滤 emoji、图标等不适合朗读的内容。首次运行会自动检测麦克风、校准底噪,并下载 KWS 模型、生成提示音。

适用边界方面,它更适合 Python 3.8+、Linux、ALSA 环境下,使用 USB 麦克风和扬声器进行中文普通话对话。要注意麦克风与扬声器距离过近会造成回声,首次启动保持环境安静,唤醒后尽快说话,且不要同时运行多个实例,否则容易发生设备冲突。

使用场景

  • 在 Linux 终端用 USB 麦克风配置离线语音问答,通过“小右”唤醒并向 Agent 提问。
  • 在安静环境完成首次麦克风检测和底噪校准,并验证 Edge-TTS 能否正常播报回答。
  • 在已有 OpenClaw 网关时,用独立会话进行语音提问,避免与 Web UI 会话相互污染。
  • 在长时间运行中调整静音结束、唤醒等待和校准时长,减少录音提前结束或误唤醒。

适合人员

  • 维护 OpenClaw 网关的 Linux 工程师,希望用离线唤醒麦克风直接进行中文语音问答。
  • 搭建语音桌面原型的技术作者,需要自动检测麦克风、校准底噪并验证 TTS 播报。
  • 负责会议终端验收的硬件测试工程师,要检查 USB 麦克风、扬声器回声和设备热插拔。
  • 调试 Agent 会话隔离的后端工程师,希望用独立语音会话提问并观察流式回复。