PPT 图片内容识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_46974ee3/ppt-image-extract。
技能介绍
问题
PPT 里不少关键信息并不在文本框中:梯形图、电路图、实物图、流程图常常只作为图片存在。普通文本提取只能拿到标题和少量说明,容易漏掉核心结构、接线关系、设备型号或操作步骤。对需要把课件、方案或技术材料转成可检索文字的场景来说,这种只读文字、看不到图的缺口很常见。
工作方式
该技能在 Windows 侧把 PPT 转成可识别的页面图片,再交给多模态模型做视觉理解。核心链路是:
- 页面导出:通过 WPS 或 PowerPoint COM 将每页导出为
PNG,对.ppt旧格式兼容性较好,也可批量处理多个文件。 - 图片识别:使用支持图像输入的模型读取导出图,识别图中的文字、结构关系和关键知识点。资料中验证过的模型包括
qclaw/pool-minimax-m3与qclaw/kimi2.6。 - 并行处理:为避免主会话被大量识图结果撑满,技能会把图片拆给子代理处理,每批约 10-20 张,完成后再汇总。
- 结果落盘:识别内容可整理成文字报告,必要时生成带图片和说明的
docx文档。
适用边界
它适合以图为主、需要人工校对后再入库的材料转换。局限也很明确:仅支持 Windows,因为依赖本地 COM 自动化;识别精度取决于所选多模态模型,复杂梯形图或密集电路图仍可能漏掉线号、引脚或局部标注;超过 500 页 的文件耗时较长,建议分批运行。若默认模型不支持图片输入,需要显式切换到支持视觉理解的模型。
使用场景
- 电气工程师要把培训 PPT 里的梯形图和接线图识别成文字,便于后续检索。
- 技术支持要把含设备实物图、故障截图的 PPT 转成文字,便于归档和排查。
- 课程助教要把含流程图、实验步骤图的课件转成文字摘要,供学生复习。
- 方案工程师要把方案 PPT 中图片里的系统架构和流程说明提取成评审底稿。
适合人员
- PLC 工程师:要把梯形图、接线图 PPT 里的图片内容整理成可检索文字。
- 技术支持工程师:要把设备实物图、故障截图 PPT 转成可归档的文字说明。
- 课程助教:要把含流程图、实验步骤图的课件转成文字摘要,供学生复习。
- 方案工程师:要把方案 PPT 中图片里的系统架构、流程说明提取为评审底稿。