PPT页面识别转JSON工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_65333ed1/ppt-page-recognition。
技能介绍
问题背景
PPT 文件在办公和演示中广泛使用,但其内容通常以非结构化形式存储,难以进行程序化分析、数据提取或与其他系统集成。手动转换为 JSON 等结构化格式耗时且易出错,尤其是在处理多页、复杂布局或图片型页面时,容易丢失层级、语义和连接关系。
核心工作流程
这个技能通过自动化识别 PPT 页面的结构和内容,生成忠实还原原始语义的结构化 JSON 文件。关键步骤包括:
- 识别前检查:在正式识别开始前,必须检查目标
.pptx同目录下是否存在同名 PDF。如果 PDF 缺失,会提醒用户选择先补 PDF 或仅用 PPT 继续。同时,检查当前模型是否支持视觉能力;如果不支持,会提醒用户切换模型,以避免静默跳过关键步骤。
- 原生结构识别:运行
scripts/recognize_ppt_deck.py --vision-mode off脚本,优先提取 PPT 的原生 OOXML 结构,生成初步 JSON。这个步骤侧重于文本、层级和布局信息,输出包含页面类型如timeline、logo-wall等字段。
- 视觉补全:如果识别结果中产生
vision_tasks(例如对低文本覆盖率页面的slide_visual_recovery),并且当前模型支持视觉,则自动利用同名 PDF 导出的截图(存储在output/screenshots/)进行补全。视觉任务专注于恢复图片型区域的文字、指标和连接关系。
- 合并与清理:通过
scripts/apply_vision_tasks.py将视觉任务结果合并到初步 JSON 中,生成最终merged JSON。成功后,运行scripts/cleanup_intermediate_outputs.py删除中间文件,如任务结果 JSON 和审计报告,确保工作区只保留一份交付结果。
技能支持多种页面家族,如 people-matrix、metrics、peer-panels 等,并通过 missing_r风险字段 诚实标明无法可靠恢复的区域。
注意事项
- 适用边界:技能最适合可编辑的
.pptx文件,即文本保留在 OOXML 结构中的场景。如果 PPT 主要是截图、扁平化图示或扫描页,文本覆盖率可能下降,connector推断更依赖视觉判断,但仍需多模态补全。
- 硬性规则:必须优先使用原生结构而不是 OCR;对图片型页面默认进行视觉补全,无需用户额外确认;不允许静默跳过 PDF 或模型检查步骤;最终输出只有一份 JSON,中间产物如
vision_task_results.json必须清理。
- 避免的错误:不允许压平结构,例如将时间线或 logo 分组墙降级为普通列表;不能丢失小标签、页脚或侧边窄列等语义区域;必须显式保留冲突数据集,不能只保留一个版本。这些规则确保转换结果的完整性和准确性。
使用场景
- 当需要将季度汇报 PPT 中的图表数据自动提取到 BI 工具进行可视化分析时,使用技能识别页面结构并生成 JSON。
- 在迁移企业历史 PPT 到新知识库系统时,用技能恢复每页的层级关系和布局语义,确保内容完整可检索。
- 处理包含时间线、logo 墙等复杂布局的营销 PPT,用技能提取并结构化并列分组和指标数据。
- 为 AI 训练构建多模态数据集时,将 PPT 文件转换为 JSON 格式,保留页面类型和连接关系供模型学习。
适合人员
- 需要将 PPT 中的数据自动导入分析平台进行趋势预测的数据分析师。
- 负责批量处理公司产品 PPT 并提取结构化信息更新内容管理系统的运营专员。
- 在开发文档理解 AI 应用时,需将 PPT 内容转换为可解析 JSON 的算法工程师。
- 要求将分散在部门 PPT 中的项目时间线统一整合到 ERP 系统中的项目经理。