办公文档三件套(Word/Excel/PDF)
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_69794d19/office-doc-suite。
技能介绍
日常办公文档处理痛点
处理 .docx、.xlsx、.pdf 是高频工作,但常遇到几个麻烦:格式在传递中走样,手动处理多个文件耗时且易错,担忧上传文件到云端的隐私风险,以及面对旧版 .xls/.doc 格式时的兼容性问题。
办公文档三件套如何工作
这是一套完全本地的 Python 工具集,针对上述问题提供了具体解决方案:
核心处理能力
- Word (
.docx) 处理:不仅能生成文档,更擅长replace保真替换——在修改占位文字(如【姓名】)时,严格保留原有字体、段落和样式。批量替换功能replace-batch可一次处理多组映射。 - Excel (
.xlsx) 处理:超越简单读取。merge能智能合并多个表格并自动去重表头;stats和report支持对指定列进行快速求和、平均值等统计,生成带合计行的汇总报表。 - PDF 处理:覆盖从合并、拆分到提取文字、转图片(需
pymupdf)的全流程。split支持灵活的页码范围(如1-3,5);protect和decrypt管理文件安全,解密 AES 加密文件时需要pycryptodome库。
关键工作流程
- 环境自检:运行
python scripts/setup_check.py check确认依赖(python-docx,openpyxl,PyPDF2等)已就位。 - 旧格式转换:对于
.xls或.doc,首先使用convert_legacy.py进行转换。.xls转.xlsx依赖xlrd库;.doc转.docx需要本地安装 LibreOffice。 - 执行与验证:根据需求调用具体脚本(如
docx_tool.py,xlsx_tool.py,pdf_tool.py)。所有命令都必须指定-o输出到新文件,绝不覆盖原文件。执行后,建议检查输出文件的内容和大小。
适用边界与注意事项
此套件定位为轻量级本地处理工具,擅长结构化数据和标准格式文档,但并非全能:
- 它不擅长:处理带有复杂排版(艺术字、专业图表)、宏代码的文档,也无法提取扫描件 PDF 中的文字(需先 OCR)。
- 核心原则:本地运行、保真处理、不覆盖源文件。所有操作都在你的电脑上完成,数据不会上传。
- 明确指引:遇到
.doc旧文件,脚本会引导你使用 WPS/Word 另存为.docx;遇到错误,脚本会输出中文错误原因和解决建议。
使用场景
- 月底需要将销售、财务、人事三个部门的月度数据表合并成一份总表,并自动计算销售额合计。
- 每周需处理一份Word会议纪要模板,将里面的【与会人】、【日期】等占位符替换为实际信息,并保持原有格式。
- 收到一份50页的合同PDF,需要将其中第3-5页的补充协议单独拆分出来,并为整份合同添加页码。
- 客户发来旧版的.xls格式销售数据表,需要先将其转换为现代.xlsx格式,然后才能进行数据透视分析。
适合人员
- 行政或运营人员:负责定期合并多个部门提交的Excel数据报表,并生成汇总报告。
- 项目管理或秘书岗位:需要频繁根据模板快速生成格式规范的周报、会议纪要等Word文档。
- 法务或合同管理人员:处理大量PDF合同文件,进行拆分、合并、加密或信息提取。
- 财务或数据分析人员:收到外部合作方提供的旧格式数据文件,需先转换格式再进行处理分析。