通用文档读取器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_053d27d0/user-053d27d0-document-reader。
技能介绍
解决什么问题
当 AI 需要分析附件或压缩包里的材料时,先面临格式碎片化:PDF 要抽文本,xlsx 要按 Sheet 展开,pptx 要按 Slide 分块,zip、rar、7z 又需要先列文件再选目标。人工预处理容易打断上下文,也不适合批量查看。
技能如何工作
Document Reader 将办公文档和压缩包读取统一成“列出 → 选择 → 输出文本”的流程:
- 办公文档:支持
pdf、docx、xlsx、pptx、rtf、odt、html/htm,以及txt、md、json、xml、py、js等纯文本文件。 - 压缩包:支持
zip、tar、tgz、tar.bz2、rar、7z,可先列出文件,再读取指定文档。 - 输出形式:人类可读文本或
JSON程序接口;文件名匹配大小写不敏感,找不到精确匹配时会尝试模糊匹配。 - 结构处理:
xlsx按 Sheet 输出为表格文本,pptx按 Slide 分块,便于按段分析。
适用边界与注意点
它面向“内容提取”而不是文档编辑:适合 AI 分析、附件速览、数据提取和预处理;不适合修改原文、转换排版或复杂表格公式还原。pdf 依赖 poppler-utils,扫描版或加密 PDF 的提取质量取决于底层解析;压缩包只能列出和读取内部文档,不会自动解压到磁盘。
使用场景
- 收到供应商发来的 zip 附件时,先列出内部 PDF 和 xlsx,再抽取报价表与合同文本给 AI 比对。
- 将多个 pptx 和 docx 中的会议纪要逐段读取,输出 JSON 供大模型总结决议事项与待办。
- 对包含 tar.gz 的项目资料包,按文件名模糊匹配找到 HTML 报告与 txt 日志,提取正文用于排查。
- 从 Excel 工作簿中按 Sheet 读取指标表,转成表格文本,再交给 AI 做口径核对与差异说明。
适合人员
- 需要审阅供应商报价包的销售或采购,诉求是从 zip 中快速定位 PDF、xlsx 并提取正文比对。
- 整理会议纪要的 PM 或助理,诉求是把 pptx/docx 段落和 JSON 输出交给 AI 总结待办。
- 处理项目资料包的运维或数据工程师,诉求是列出 tar.gz/7z 文件并读取 HTML、txt 日志排查。
- 做文档数据预处理的算法工程师,诉求是批量读取办公文档并输出 JSON 或文本供模型消费。