Moondream 本地视觉理解
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_543d2acf/moondream-vision-zc。
技能介绍
解决什么问题
当工程师需要在聊天或自动化流程中读取本地图片,又不想把图像直接传到外部视觉 API 时,moondream-vision-zc 提供一个较轻量的入口。它把本地 Ollama 中的 Moondream 模型接入 OpenClaw,让图片或本地文件路径可以直接生成自然语言描述。
技能如何工作
- 技能依赖本地 Ollama 服务与 Moondream 模型,脚本通过 Ollama REST API 发送 base64 图像和可选提示词。
- 在 OpenClaw 中注册后,可用
!moondream <image_path>这类命令触发图像理解。 - 返回结果可继续作为上下文交给
GPT-OSS-120B,用于摘要、分析、文案扩写或跨模态推理。 - 由于 Moondream 偏轻量,资料给出的性能约为普通笔记本 CPU 1‑2 秒/图像,GPU 可进一步加速。
边界与注意点
- 需要本地 Ollama 服务可用,且
11434端口可访问。 - Ollama 对单张图片约
5 MB有限制,过大图片建议先压缩。 - 如果返回为空,应检查 prompt 是否非空,或在 payload 中加入空
system字段。 - 它更适合做本地快速图像描述和前置理解;复杂结论仍需结合更大语言模型二次分析。
使用场景
- 在 OpenClaw 聊天中发送商品截图,生成可用于归档或核对的图片文字描述。
- 把本地路径指向的报错截图先转成简洁描述,再交给 GPT-OSS-120B 做原因分析。
- 在自动化脚本中调用本地 Ollama 的 Moondream 模型,获取单张图片的文字描述。
- 将图片描述作为系统提示,辅助撰写新闻稿、摘要或跨模态推理。
适合人员
- 需要把本地 UI 截图转成文字描述、且不想上传原始截图的自动化工程师
- 在 OpenClaw 中搭建多模态工作流、希望图像先由本地 VLM 概括的应用开发者
- 使用 Ollama 本地模型、想将图像描述接入 GPT-OSS-120B 的 AI 工程师
- 需要在普通 CPU 上快速完成单张图像理解、再交给大语言模型分析的工程师