Agent Skills
返回列表
Moondream 本地视觉理解

Moondream 本地视觉理解

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_543d2acf/moondream-vision-zc。

技能介绍

解决什么问题

当工程师需要在聊天或自动化流程中读取本地图片,又不想把图像直接传到外部视觉 API 时,moondream-vision-zc 提供一个较轻量的入口。它把本地 Ollama 中的 Moondream 模型接入 OpenClaw,让图片或本地文件路径可以直接生成自然语言描述。

技能如何工作

  • 技能依赖本地 Ollama 服务与 Moondream 模型,脚本通过 Ollama REST API 发送 base64 图像和可选提示词。
  • 在 OpenClaw 中注册后,可用 !moondream <image_path> 这类命令触发图像理解。
  • 返回结果可继续作为上下文交给 GPT-OSS-120B,用于摘要、分析、文案扩写或跨模态推理。
  • 由于 Moondream 偏轻量,资料给出的性能约为普通笔记本 CPU 1‑2 秒/图像,GPU 可进一步加速。

边界与注意点

  • 需要本地 Ollama 服务可用,且 11434 端口可访问。
  • Ollama 对单张图片约 5 MB 有限制,过大图片建议先压缩。
  • 如果返回为空,应检查 prompt 是否非空,或在 payload 中加入空 system 字段。
  • 它更适合做本地快速图像描述和前置理解;复杂结论仍需结合更大语言模型二次分析。

使用场景

  • 在 OpenClaw 聊天中发送商品截图,生成可用于归档或核对的图片文字描述。
  • 把本地路径指向的报错截图先转成简洁描述,再交给 GPT-OSS-120B 做原因分析。
  • 在自动化脚本中调用本地 Ollama 的 Moondream 模型,获取单张图片的文字描述。
  • 将图片描述作为系统提示,辅助撰写新闻稿、摘要或跨模态推理。

适合人员

  • 需要把本地 UI 截图转成文字描述、且不想上传原始截图的自动化工程师
  • 在 OpenClaw 中搭建多模态工作流、希望图像先由本地 VLM 概括的应用开发者
  • 使用 Ollama 本地模型、想将图像描述接入 GPT-OSS-120B 的 AI 工程师
  • 需要在普通 CPU 上快速完成单张图像理解、再交给大语言模型分析的工程师