PKM 知识库检索
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e3c9e60f/test2333。
技能介绍
解决的问题
当用户询问的是某个 avatar 的私人知识库(PKM),而不是通用网页或产品资料时,普通搜索容易把公开信息、噪声片段和真正的客户维护数据集混在一起。test2333 把这类请求收敛到一个明确的数据集检索流程:以 dataset_id 为入口,调用 PKM 检索接口,再从返回的分片中提取最相关内容,避免把 PDF 预览、图片碎片或低相关片段直接丢给用户。
技能如何工作
这个技能不是硬编码密钥,也不自行推导客户可见的 dataset_id。它读取 skills/pkm-retrieval/config.json 中的 base_url、dataset_id 与 api_key,再对 POST /v1/datasets/{dataset_id}/retrieve 发起请求。核心步骤包括:
- 确认用户已经提供
dataset_id和检索 query; - 将 UI 中的 Vector Search 理解为 API 的
semantic_search场景; - 优先使用最高分 chunk,忽略明显噪声的长尾;
- 用简短摘要回答,并在有帮助时附上源文档名。
如果只有 avatar_id,技能会停在客户面向流程外,询问 dataset_id,不会默认走 avatar_id -> pkb_{avatar_id} -> dataset lookup 的内部路径。
适用边界
它适合客户已维护 PKM 数据集、且任务确实依赖私有资料检索的场景。不适合通用知识问答、缺少 dataset_id 且用户无法补充的情况,或应走 Avatar 对话流程而非直接数据集检索的任务。输出风格偏简洁:先给答案,再补来源;找不到相关内容时会明确说明,而不是生成未经检索支撑的推断。
使用场景
- 客服工程师在用户引用 avatar 私有笔记时,用 dataset_id 调 PKM 接口查找出处并摘要回答。
- 支持团队收到只有 avatar_id 的检索请求时,先向用户索要 dataset_id,再执行 PKM 查询。
- 业务运营需要确认客户上传文件中某个流程要求,从最高分 chunk 提取答案并附源文档名。
- 应用开发调试 avatar 知识库答案来源,区分 semantic_search 结果与噪声 PDF 片段。
适合人员
- 负责 avatar 客服知识库维护,需要按 dataset_id 查询客户私有资料的支持工程师
- 要核对客户上传文件中的流程条款,并输出带来源摘要的业务运营
- 在 avatar 应用里接入私有检索接口、需要处理缺 dataset_id 分支的开发者
- 排查 PKM 检索结果噪声、需要识别最高分 chunk 与 PDF 片段的数据工程师