Agent Skills
返回列表
小笨羊图片工具集

小笨羊图片工具集

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @org-rn88lg3j/pic。

技能介绍

解决什么问题

在工程流程里,图片信息往往散落在 OCR 文本、证件字段、目标框和分类标签中。开发者如果只是把图片交给多模态模型,容易出现字段不稳定、无法调用结构化视觉接口、敏感证件缺少校验规则等问题。小笨羊图片工具集 把这些能力封装成可被 Agent 调用的 Python 工具函数,让大模型负责理解意图和路由,代码负责调用后端 API。

如何工作

核心能力分为四类:

  • 通用 OCR:scripts.tools.ocr、scripts.tools.ocr_pro,支持图片链接或 Base64,适合文档、截图、广告牌等文本识别。
  • 证件与业务 OCR:身份证、护照、港澳通行证、银行卡、营业执照、驾驶证、行驶证等,返回结构化字段,并支持如身份证号、银行卡号的校验。
  • 检测与识别:行人、车辆、火焰、手机、电动自行车、安全帽、反光衣、手势、鸟类、昆虫、植物、菜品、宠物情绪等,输出检测框、置信度或类别标签。
  • 视觉模型任务:ImageNet 分类、COCO 目标检测、旋转目标检测、人体姿态估计、实例分割等,适合需要边界框、掩膜或关键点的场景。

关键步骤是:检查 XBY_APIKEY,按用户意图选择 scripts.tools.* 函数,提取必填参数,如 dataUrl 或 dataBase64,调用后整理原始 JSON 再展示。参数不完整时应询问用户,而不是猜测。

适用边界

这个技能依赖外部 API,不是本地离线工具;调用前要确保密钥可用,并注意敏感图片的权限与合规。它对“可识别、可框选、可分类”的视觉任务覆盖较广,但不适合需要复杂推理、跨图比对或私有领域训练的请求。识别结果仍可能受图片质量、遮挡、分辨率影响,生产环境应结合人工复核。

使用场景

  • 审核团队处理身份证、护照、银行卡照片时,抽取证件字段并校验号码有效性。
  • 质检工程师检查产线截图中的火焰、安全帽和反光衣,输出目标框与风险标签。
  • 数据工程师将截图中的文本、车牌和物体标签整理为结构化字段入库。
  • 算法工程师调用 COCO 检测、姿态估计和实例分割结果,验证多模型输出。

适合人员

  • 负责证件审核的后台工程师,需要把照片里的字段稳定抽成 JSON。
  • 做安防视频抽帧分析的算法工程师,需要检测火焰、行人和车辆并输出框。
  • 构建多模态 Agent 的应用工程师,需要让模型按意图调用视觉 API。
  • 处理票据与表格图片的数据工程师,需要 OCR、车牌和物体标签入库。