Agent Skills
返回列表
文档处理工具

文档处理工具

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_5b9d6131/dxt-7035。

技能介绍

解决什么问题

大模型处理办公文档时,常卡在格式差异、大文件上下文溢出和中文字符编码上。document-skills 用一组脚本把 PDF、DOCX、XLSX、PPTX、HTML、CSV、JSON、TXT 等文件转成可读取文本,并保留检索、摘要、比对的执行路径。

核心工作方式

  • 文本提取:通过 scripts/extract_text.py 读取内容;大文件建议先用 -o 落盘,再分段读取,避免一次性进入上下文。
  • 格式转换:scripts/convert_format.py 支持 PDF → txt/md、DOCX → txt/md/html、XLSX → csv/json/txt、PPTX → txt/md、HTML → txt、CSV → json/xlsx、JSON → csv、TXT → pdf/docx。
  • 检索与摘要:scripts/search_doc.py 支持正则、-i 忽略大小写和 -C N 上下文;摘要通常先提取文本,再让模型按章节或页码范围分析。
  • 大文档策略:PDF 可用 --pages 分块,XLSX 可用 --sheet 逐表处理,其他文件可先导出再局部读取。

适用边界

它更适合结构化或半结构化文档的批处理与模型预处理,而不是 OCR、排版还原或跨格式内容编辑。遇到中文编码问题可尝试 --encoding gbk / --encoding gb18030;缺少依赖或文件损坏时,需要按提示安装依赖或更换解析库。

使用场景

  • 法务审查 DOCX/PDF 合同时,用正则检索条款并摘取上下文。
  • 数据运营将多份 XLSX 明细转 CSV/JSON,再按字段检索和摘要。
  • 技术写作把 PPTX/HTML 材料提取为 Markdown,供模型摘要整理。
  • 测试分析比较两份 XLSX 或 PDF 的差异,定位单元格与文本变更。

适合人员

  • 合同审查人员:需要快速定位 DOCX/PDF 中的关键条款并提取上下文。
  • 数据运营:需要把多份 XLSX 汇总成 CSV/JSON 并检查字段变化。
  • 技术文档工程师:需要把 PPTX/HTML 转成 Markdown 并做结构化摘要。
  • 测试分析人员:需要比较两份文档或表格的差异并整理变更清单。