Agent Skills
返回列表
PPTX 内容提取

PPTX 内容提取

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_36f0dcbb/ppt-readers。

技能介绍

解决的问题

Read 工具遇到 .pptx 时只能报二进制不可显示,而工程师经常需要快速查看幻灯片文本、表格、备注和图片数量。用 python-pptx 又可能在沙箱环境因 lxml 的 .so 签名问题触发 ImportError。这个技能把 .pptx 当作 ZIP + XML 解析,避免第三方依赖带来的环境风险。

工作方式

  • 仅处理 Office 2007+ 的 .pptx,不支持旧版 .ppt。
  • 使用 zipfile 打开包结构,并用 xml.etree.ElementTree 解析 presentationml 与 drawingml 命名空间。
  • 输出文件名、幻灯片总数、每页文本的缩进层级、表格的 | 分隔内容、备注页内容,以及每页图片数量统计。
  • 推荐调用系统自带的 python3,避免沙箱中动态库签名不一致。

适用边界

它适合把 PPTX 转成可读文本快照,不适合提取图片内容或做视觉还原。文件路径含空格时要用引号包裹;大量图片文件只会得到数量,不能得到图片本体。

使用场景

  • 会议前需要把 .pptx 讲义转成纯文本,便于检索关键句
  • 评审材料时快速浏览每页文本、备注和表格,不打开 Office
  • 批量检查 .pptx 是否包含图片,并统计每页图片数量
  • 把 .pptx 中的表格内容导出为分隔文本,用于后续核对

适合人员

  • 处理会议材料的后端工程师:需要把 .pptx 快速转成可检索文本
  • 做自动化脚本的 Python 工程师:想避免 python-pptx 的沙箱依赖问题
  • 整理培训资料的助教:需要提取幻灯片文本、备注和表格内容
  • 做文档审计的技术支持:需要统计 .pptx 图片数量但不依赖 Office