PPTX 内容提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_36f0dcbb/ppt-readers。
技能介绍
解决的问题
Read 工具遇到 .pptx 时只能报二进制不可显示,而工程师经常需要快速查看幻灯片文本、表格、备注和图片数量。用 python-pptx 又可能在沙箱环境因 lxml 的 .so 签名问题触发 ImportError。这个技能把 .pptx 当作 ZIP + XML 解析,避免第三方依赖带来的环境风险。
工作方式
- 仅处理 Office 2007+ 的
.pptx,不支持旧版.ppt。 - 使用
zipfile打开包结构,并用xml.etree.ElementTree解析presentationml与drawingml命名空间。 - 输出文件名、幻灯片总数、每页文本的缩进层级、表格的
|分隔内容、备注页内容,以及每页图片数量统计。 - 推荐调用系统自带的
python3,避免沙箱中动态库签名不一致。
适用边界
它适合把 PPTX 转成可读文本快照,不适合提取图片内容或做视觉还原。文件路径含空格时要用引号包裹;大量图片文件只会得到数量,不能得到图片本体。
使用场景
- 会议前需要把 .pptx 讲义转成纯文本,便于检索关键句
- 评审材料时快速浏览每页文本、备注和表格,不打开 Office
- 批量检查 .pptx 是否包含图片,并统计每页图片数量
- 把 .pptx 中的表格内容导出为分隔文本,用于后续核对
适合人员
- 处理会议材料的后端工程师:需要把 .pptx 快速转成可检索文本
- 做自动化脚本的 Python 工程师:想避免 python-pptx 的沙箱依赖问题
- 整理培训资料的助教:需要提取幻灯片文本、备注和表格内容
- 做文档审计的技术支持:需要统计 .pptx 图片数量但不依赖 Office