Agent Skills
返回列表
📁

PPT 图片内容识别

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_46974ee3/ppt-image-extract。

技能介绍

问题

PPT 里不少关键信息并不在文本框中:梯形图、电路图、实物图、流程图常常只作为图片存在。普通文本提取只能拿到标题和少量说明,容易漏掉核心结构、接线关系、设备型号或操作步骤。对需要把课件、方案或技术材料转成可检索文字的场景来说,这种只读文字、看不到图的缺口很常见。

工作方式

该技能在 Windows 侧把 PPT 转成可识别的页面图片,再交给多模态模型做视觉理解。核心链路是:

  • 页面导出:通过 WPS 或 PowerPoint COM 将每页导出为 PNG,对 .ppt 旧格式兼容性较好,也可批量处理多个文件。
  • 图片识别:使用支持图像输入的模型读取导出图,识别图中的文字、结构关系和关键知识点。资料中验证过的模型包括 qclaw/pool-minimax-m3 与 qclaw/kimi2.6。
  • 并行处理:为避免主会话被大量识图结果撑满,技能会把图片拆给子代理处理,每批约 10-20 张,完成后再汇总。
  • 结果落盘:识别内容可整理成文字报告,必要时生成带图片和说明的 docx 文档。

适用边界

它适合以图为主、需要人工校对后再入库的材料转换。局限也很明确:仅支持 Windows,因为依赖本地 COM 自动化;识别精度取决于所选多模态模型,复杂梯形图或密集电路图仍可能漏掉线号、引脚或局部标注;超过 500 页 的文件耗时较长,建议分批运行。若默认模型不支持图片输入,需要显式切换到支持视觉理解的模型。

使用场景

  • 电气工程师要把培训 PPT 里的梯形图和接线图识别成文字,便于后续检索。
  • 技术支持要把含设备实物图、故障截图的 PPT 转成文字,便于归档和排查。
  • 课程助教要把含流程图、实验步骤图的课件转成文字摘要,供学生复习。
  • 方案工程师要把方案 PPT 中图片里的系统架构和流程说明提取成评审底稿。

适合人员

  • PLC 工程师:要把梯形图、接线图 PPT 里的图片内容整理成可检索文字。
  • 技术支持工程师:要把设备实物图、故障截图 PPT 转成可归档的文字说明。
  • 课程助教:要把含流程图、实验步骤图的课件转成文字摘要,供学生复习。
  • 方案工程师:要把方案 PPT 中图片里的系统架构、流程说明提取为评审底稿。