ETL 管道生成器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-etl-pipeline-generator。
技能介绍
面向知识图谱的数据接入问题
原始数据常散落在 CSV、JSON、数据库、REST API 和流式源中,字段不一致、实体边界不清、关系需要推断,直接灌入图存储会污染 schema 和查询结果。ETL 管道生成器把这一过程拆成可配置、可重跑的 Extract、Transform、Load 三个阶段,减少手工拼脚本和临时排查成本。
技能如何工作
它根据数据源、转换规则、目标系统和质量要求生成结构化管道设计:
- Extract:接入文件、数据库、API、数据仓库或流式源,形成原始数据流。
- Transform:执行实体检测、关系推断、schema 映射、去重、类型转换、校验与过滤,把杂乱输入整理为
graph-ready结构。 - Load:写入
Neo4j、RDF Triple Store、ArangoDB、TigerGraph或CSV/JSON等目标。
关键产物包括 YAML 管道配置、DAG 定义、Python/Scala/SQL 脚本、数据流图、监控告警配置和文档。执行路径通常覆盖配置校验、连接器初始化、抽取、转换、质量检查、加载、结果验证与指标收集。
适用边界与注意点
该技能更偏向管道设计与配置生成,适合需要自动化接入、知识图谱填充和数据质量校验的场景。它不替代业务语义判断:实体定义、关系规则和约束策略仍需由团队明确。对于高并发流式处理、复杂权限隔离或生产级容灾,需要结合 Airflow、Spark、Great Expectations 等系统落地,并补充测试、版本控制和凭据管理。
使用场景
- 从 CSV、JSON 和数据库抽取客户数据,生成可重跑的 ETL 配置以写入 Neo4j。
- 将 REST API 返回的订单流拆成实体与关系,产出 DAG 和转换规则供管道执行。
- 为 RDF 三元组生成目标 schema 映射、去重和校验步骤,避免脏数据进入图存储。
- 设计多源数据接入的监控告警与错误恢复方案,覆盖行数指标和失败重试。
适合人员
- 负责知识图谱数据接入的数据工程师:需要把多源原始数据整理成 graph-ready 结构并生成管道配置。
- 设计图数据库应用的后端工程师:需要把 API、数据库和文本数据转换成实体、关系并写入 Neo4j/RDF。
- 治理数据质量的分析师:需要在 ETL 中加去重、类型转换、校验和错误处理规则,减少脏数据。
- 搭建自动化数据流程的平台工程师:需要产出 DAG、YAML、监控告警和文档,便于团队复用与排障。