DOCX 文档工具包
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/cn-docx。
技能介绍
解决的问题
很多 Word 任务卡在格式、批注、修订和媒体元数据上:纯文本会丢失结构,直接改 XML 又容易破坏 document.xml、comments.xml 和 run 边界。这个技能面向需要稳定读写 .docx 的文档流程,把创建、编辑、分析与可视化拆成可执行路径,而不是只给一段转换命令。
工作方式与适用边界
- 读取:用
pandoc转 Markdown 获取正文与修订,需要批注、复杂格式、嵌入媒体或元数据时解包查看原始 XML。 - 新建:用
docx-js以Document、Paragraph、TextRun构建文件,再Packer.toBuffer()导出。 - 编辑:用 Python Document 库处理 OOXML,解包、修改、保存、打包;对他人文档或法律、学术、商业、政府文档优先走修订工作流,并按 3 到 10 个相关变更分批处理。
- 视觉增强:新文档或复杂概念可用自然语言描述生成示意图,输出可保存到
figures/,用于工作流、架构、数据流等说明。 - 分析:必要时转为 PDF,再用
pdftoppm输出页面图像,辅助检查排版、页码与视觉结构。
注意:简单正文提取可只走 Markdown;涉及保留原始格式、批注和 tracked changes 时必须回到 XML 层。不要依赖 Markdown 行号定位 XML,行号会随编辑变化。
使用场景
- 审阅合同修订时,按章节批量标记日期、当事方与条款的删除和插入,避免改到无关文本。
- 新建技术方案时,用 docx-js 生成带标题、表格和说明图的 Word 文档,并导出给团队评审。
- 分析长文档排版时,把 DOCX 转成 PDF 再渲染为页面 JPEG,检查页眉、分页和图片位置。
- 读取带批注的 Word 时,先转 Markdown 看正文,再解包 XML 定位批注、媒体和元数据。
适合人员
- 需要处理合同或学术稿件的法律/学术编辑,要求在保留原始格式下完成可追踪修改。
- 要交付正式文档的技术写作者,希望用脚本生成结构一致的 DOCX 并插入示意图。
- 维护报告模板的运营或咨询顾问,需要批量提取正文、批注和媒体用于二次整理。
- 做文档质量检查的产品经理,需要把 DOCX 渲染成页面图像核对排版、分页与视觉元素。