小右语音助手
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_aae27d93/openclawhearspeak。
技能介绍
解决的问题
在本地 Linux 终端里,语音助手常常需要联网唤醒、手动控制录音时长,并且和 Web UI 会话互相干扰。openclawHearSpeak 面向这类场景,用离线关键词唤醒、自动端点检测和独立会话,把“唤醒、听清、问 Agent、播回答”串成一条本地语音链路。
工作方式与注意点
- 唤醒与录音:使用
sherpa-onnx做离线关键词检测,默认唤醒词为“小右”;启动后进入后台静默监听,听到唤醒词后开始录音,并用 VAD 判断用户开始和结束说话。资料中提到用户说完后约1.5s自动结束录音,唤醒后超过5s未说话会超时退出。 - 识别与对话:语音通过
SILICONFLOW_API_KEY配置的硅基流动 ASR 服务识别为中文普通话文本,再交给OpenClaw Agent处理。回复采用消息订阅方式流式接收,并使用独立干净会话,避免与 Web UI 会话冲突;网关处理中会周期性播报等待提示。 - 输出与设备:最终回答通过
Edge-TTS合成语音播放,并过滤emoji、图标等不适合朗读的内容。首次运行会自动检测麦克风、校准底噪,并下载 KWS 模型、生成提示音。
适用边界方面,它更适合 Python 3.8+、Linux、ALSA 环境下,使用 USB 麦克风和扬声器进行中文普通话对话。要注意麦克风与扬声器距离过近会造成回声,首次启动保持环境安静,唤醒后尽快说话,且不要同时运行多个实例,否则容易发生设备冲突。
使用场景
- 在 Linux 终端用 USB 麦克风配置离线语音问答,通过“小右”唤醒并向 Agent 提问。
- 在安静环境完成首次麦克风检测和底噪校准,并验证 Edge-TTS 能否正常播报回答。
- 在已有 OpenClaw 网关时,用独立会话进行语音提问,避免与 Web UI 会话相互污染。
- 在长时间运行中调整静音结束、唤醒等待和校准时长,减少录音提前结束或误唤醒。
适合人员
- 维护 OpenClaw 网关的 Linux 工程师,希望用离线唤醒麦克风直接进行中文语音问答。
- 搭建语音桌面原型的技术作者,需要自动检测麦克风、校准底噪并验证 TTS 播报。
- 负责会议终端验收的硬件测试工程师,要检查 USB 麦克风、扬声器回声和设备热插拔。
- 调试 Agent 会话隔离的后端工程师,希望用独立语音会话提问并观察流式回复。