全能本地文档处理专家
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_734b3090/office-toolkit-local。
技能介绍
解决什么问题
当办公文档需求跨越 Excel、Word、PDF、PPT、Markdown 和 CSV 时,工程师常常需要在多个库、模板规则、编码和格式保真之间反复切换。尤其处理中文公文、长数字、公式、模板填充、PDF 合并或批量转换时,容易出现字体缺失、精度丢失、引用偏移和输出不可复现。该技能把这类本地文档处理约束成可执行流程:先明确输入输出,再选择合适引擎,最后做交付前检查。
如何工作
它面向纯本地 Python场景,不依赖外部 API。创建和编辑 Excel 时使用 openpyxl 处理公式、样式、图表与数据验证,用 pandas 做数据清洗与重塑;处理 Word 时通过 python-docx 完成模板填充、页眉页脚、目录与中文排版;读取和拆分 PDF 时组合 PyMuPDF 与 pdfplumber,加密或解密则用 pypdf;生成 PPT 时使用 python-pptx 设置幻灯片、图表与字号。
关键步骤通常包括:
- 预检文件:确认路径、数量、格式和是否被占用。
- 选择引擎:按任务类型选择单元格级控制、数据分析、文本提取或格式转换路径。
- 执行转换:输出到新路径,避免覆盖原文件,并保留模板、样式、合并单元格与打印设置。
- 交付前检查:验证长数字列为文本、公式无错误、中文字体设置完整、图表标签为中文。
适用边界
该技能适合可本地解析的文档,而不是依赖在线协作服务或复杂设计文件的场景。扫描件 PDF 没有文本层时需要 OCR;加密 PDF 只能提示输入密码;涉及宏或 VBA 的内容会被跳过。Word 转 PDF 若追求高保真,通常需要依赖系统命令行转换方案;大文件建议按页、按块或 read_only/write_only 模式处理,避免一次性加载导致内存压力。
使用场景
- 整理销售周报时,把多张 Excel 表清洗、合并,并生成带图表的 Word 报告。
- 交付前批量处理合同 PDF,合并多份文件、添加中文水印并导出加密版本。
- 把产品说明 Markdown 转成 Word 文档,保留标题、列表、代码块和表格结构。
- 维护 Word 模板时批量替换 {{key}} 占位符,同时处理段落和表格中的字段。
适合人员
- 需要把业务表格转成对外报告、且不能上传数据到云端的数据分析师。
- 经常处理合同、发票和扫描件 PDF,要合并、提取文本并加水印的运营人员。
- 用 Python 维护内部知识库,要把 Markdown 批量转成 Word 或 PPT 的工程团队成员。
- 负责财务底稿和月度汇总,要求长数字保留为文本、公式引用不偏移的业务分析师。