DOCX 文档处理
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_9a74e0f8/docx-fromcpdex。
技能介绍
问题
很多 .docx 任务不只是读正文:新建格式复杂的 Word、修改他人文档、保留 tracked changes、提取批注/媒体/元数据、把文档转图查看,都需要分别处理 XML、Pandoc、PDF 和 OOXML 细节。常见难点在于 .docx 是 ZIP+XML,普通文本替换容易破坏 run、段落、批注、修订和样式。
工作方式
该技能按任务分流,核心流程强调先读完整参考文档,再根据任务选择工具链:
- 读取解析:用
pandoc转 Markdown,保留结构;需要批注、媒体、元数据时解包读取word/document.xml、word/comments.xml、word/media/。 - 新建文档:使用
docx-js的Document、Paragraph、TextRun,通过Packer.toBuffer()导出.docx。 - 编辑文档:用 Python OOXML 工具解包、调用 Document 库修改 DOM,再打包回
.docx。 - 审阅红线:先转成带修订的 Markdown,按 3-10 个变更分批定位 XML 节点,只标记被替换文本,保留未变 run 的
RSID,最后打包并复核。 - 转图检查:经 LibreOffice 转 PDF,再用
pdftoppm输出page-*.jpg,便于视觉校对。
注意点
适合需要精确控制 Word XML 的工程师工作流;不适合只做简单文本替换。如果只需读取正文,Markdown 足够;如果要保留法律文本中的批注、修订和样式,必须进入 OOXML 层检查。处理他人文档、法律、学术、业务或政府材料时,资料明确要求走修订流程;生成代码应保持简洁,避免多余变量和打印。
使用场景
- 法务审阅合同时,把 3-10 条修订拆成批次写入 OOXML,并保留未变更 run 的 RSID。
- 产品文档更新时,用 docx-js 从 TypeScript 生成带标题、段落和文本运行的 Word 文件。
- 验收文档排版前,用 LibreOffice 转 PDF 再用 pdftoppm 输出页面 JPEG 查看。
- 分析投标书正文与批注时,先 pandoc 转 Markdown,再解包读取 comments.xml 和 media。
适合人员
- 需要把合同条款改成可追踪修订的法务工程师
- 用 TypeScript 生成规范 Word 交付文档的工程师
- 要检查批注、媒体和元数据并输出页面图标的文档工程师
- 维护 .docx XML 工作流的自动化工程师