Agent Skills
返回列表
本地多文档交叉查重器

本地多文档交叉查重器

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,将 @user_509b3ac1/tender-similarity-analyzer 安装到我的 AI 助手中。

技能介绍

要解决的问题

在招投标、方案评审、文档合规检查等场景里,常见痛点不是“有没有重复”,而是重复发生在哪一段、和哪一份文件相似、整体风险有多高。如果只看全文相似度,容易把标题、编号、短句式模板误判为正文重复;如果逐段人工比对,又很难覆盖多份 .docx、.pdf、.txt 或 .md 文件。本地多文档交叉查重器 面向这种多文档交叉比对问题,目标是给出段落级的可复核结果,而不是一个不可解释的总分数。

技能如何工作

它主要围绕“正文识别 + 段落对齐 + 相似度判定 + 报告生成”这几步工作:

  • 输入侧:支持 2 份及以上文件,可读取 Word、PDF、纯文本和 Markdown 文档。
  • 正文过滤:对章节编号、短标题和模板化片段做识别过滤,减少标题被计入重复率的噪声。
  • 段落处理:对过短的碎片段落尝试与上下文合并,避免零散句子造成误判。
  • 相似度计算:基于 TF-IDF 向量等方式计算段落相似度,并按文本长度使用动态阈值,例如短文本用更高阈值、长文本用较低阈值。
  • 结果输出:生成 HTML 查重报告,包含总体统计、重复率进度条、段落对分布、状态判定、重复段落原文对比等。
  • 改写建议:可选生成修改建议,但只作为建议输出,不直接写入源文件。

报告中的状态会按正文重复率给出分层判断:低于 10% 视为通过,10%~30% 为警告,30% 及以上为不合格。这个阈值更适合作为人工复核入口,而不是最终合规结论。

适用边界与注意点

该技能适合本地离线处理招投标、方案书、技术文档或合规材料。文件默认仅在本机读取,不依赖外部服务上传内容,也不修改源文件;首次运行时可能需要安装 python-docx、pdfplumber、scikit-learn 和 Jinja2 等 Python 依赖。

需要注意:它对扫描版 PDF、复杂表格、图片内文字或高度定制排版的文档支持程度取决于文本提取质量;重复率阈值偏向工程经验,正式投标前应仍由业务负责人确认;改写建议只用于辅助编辑,不应被视为法律或合规意见。

使用场景

  • 投标团队在递交前把同一项目的多份技术标文档放到本机,用段落级查重定位与历史文件重复的段落。
  • 方案负责人收到多版投标书后,需要快速生成 HTML 报告,查看正文重复率、重复段对比和状态判定。
  • 合规审核人员离线检查 .docx/.pdf/.md 标书,确认没有超过 30% 的正文重复片段。
  • 文档编辑在修改 AI 生成标书时,先比较多个版本,获取只建议不改源文件的改写方向。

适合人员

  • 投标项目负责人:递交前确认多份技术标正文重复率不触发风险。
  • 标书审核专员:离线核对 .docx/.pdf/.md 文件中的重复段落并导出 HTML 证据。
  • 合规与风控人员:用通过/警告/不合格阈值复核投标文件是否存在高重复片段。
  • 技术写作编辑:对比多版方案文档,基于改写建议调整重复表述但不直接改文件。