Agent Skills
返回列表
RAG 知识库治理引擎

RAG 知识库治理引擎

知识管理 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e9af5021/rag-knowledge-curator。

技能介绍

解决什么问题

企业 RAG 系统常遇到“检索不到、答非所问”的问题。原因往往不在模型,而在入库资料:网页残留的导航、页眉页脚、重复段落、乱码和广告噪声会污染向量索引;缺少主题、版本、来源等元数据,也让检索结果难以解释和追溯。rag-knowledge-curator 将非结构化文档治理为高质量、可审计的 RAG 就绪数据集,从源头减少低质量语料进入向量库。

如何工作

技能按入库前治理流程执行:

  • 文本清洗:移除乱码、页眉页脚、重复段落、广告噪声与不可见字符,保留有效语义内容。
  • 智能分块:根据 chunk_strategy 切分文本,保持上下文边界,避免切断完整业务逻辑、表格说明或 代码块。
  • 元数据抽取:为分块标注主题、实体、版本、适用对象、密级和来源,便于按标签过滤与追溯。
  • 质量评分:从完整性、准确性、时效性、可读性四个维度打分,并说明低分项原因。
  • 输出版本化清单:生成处理摘要、分块预览、标签、质量分和治理建议,便于接入向量数据库与人工复核管道。

适用边界

该技能更适合文档、SOP、技术手册、产品说明等文本语料的入库前治理。它不替代向量数据库部署、权限控制、实时数据同步或业务审核。对于高度结构化数据库、日志流、图片 OCR 结果,需要结合外部工具补充抽取和校验。

使用场景

  • 把多份技术手册去噪、分块并标注版本、主题与适用对象,准备入库。
  • 对 FAQ 语料做治理前检查,找出低质分块并给出补全和更新建议。
  • 把产品说明转成可追溯分块,生成质量分和标签,用于向量库管道。
  • 审阅知识库入库清单时,按主题、密级和来源过滤分块并复核低分项。

适合人员

  • 负责企业知识库建设的算法工程师,需要把非结构化文档治理成可检索分块。
  • 维护 SOP 和技术文档的运营文档团队,入库前需要去噪、分块和标注密级。
  • 搭建 RAG 管道的数据工程师,需要生成带元数据和评分的入库清单。
  • 负责知识审核的管理员,需要查看低质分块原因并决定补全或更新。