RAG 知识库治理引擎
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e9af5021/rag-knowledge-curator。
技能介绍
解决什么问题
企业 RAG 系统常遇到“检索不到、答非所问”的问题。原因往往不在模型,而在入库资料:网页残留的导航、页眉页脚、重复段落、乱码和广告噪声会污染向量索引;缺少主题、版本、来源等元数据,也让检索结果难以解释和追溯。rag-knowledge-curator 将非结构化文档治理为高质量、可审计的 RAG 就绪数据集,从源头减少低质量语料进入向量库。
如何工作
技能按入库前治理流程执行:
- 文本清洗:移除乱码、页眉页脚、重复段落、广告噪声与不可见字符,保留有效语义内容。
- 智能分块:根据
chunk_strategy切分文本,保持上下文边界,避免切断完整业务逻辑、表格说明或代码块。 - 元数据抽取:为分块标注主题、实体、版本、适用对象、密级和来源,便于按标签过滤与追溯。
- 质量评分:从完整性、准确性、时效性、可读性四个维度打分,并说明低分项原因。
- 输出版本化清单:生成处理摘要、分块预览、标签、质量分和治理建议,便于接入向量数据库与人工复核管道。
适用边界
该技能更适合文档、SOP、技术手册、产品说明等文本语料的入库前治理。它不替代向量数据库部署、权限控制、实时数据同步或业务审核。对于高度结构化数据库、日志流、图片 OCR 结果,需要结合外部工具补充抽取和校验。
使用场景
- 把多份技术手册去噪、分块并标注版本、主题与适用对象,准备入库。
- 对 FAQ 语料做治理前检查,找出低质分块并给出补全和更新建议。
- 把产品说明转成可追溯分块,生成质量分和标签,用于向量库管道。
- 审阅知识库入库清单时,按主题、密级和来源过滤分块并复核低分项。
适合人员
- 负责企业知识库建设的算法工程师,需要把非结构化文档治理成可检索分块。
- 维护 SOP 和技术文档的运营文档团队,入库前需要去噪、分块和标注密级。
- 搭建 RAG 管道的数据工程师,需要生成带元数据和评分的入库清单。
- 负责知识审核的管理员,需要查看低质分块原因并决定补全或更新。