智能数据治理
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_69009747/data-governance-autopilot。
技能介绍
要解决的问题
数据治理常卡在元数据分散、血缘缺失、质量规则靠人肉维护:表结构变更后文档失真,敏感字段识别依赖经验,审计前需要临时拼表。该技能把治理流程收敛为可执行管道,用YAML、采集器、检查引擎替代纯文档驱动。
工作方式
- 元数据采集与血缘:多源元数据采集器扫描表结构、注释、存储统计,支持
--incremental增量采集;自动推导字段/表级血缘,覆盖集成链路。 - 质量检查:用六维规则定义
severity: critical等约束,检查引擎执行并输出质量评分,便于按优先级维护规则。 - 敏感数据处理:AI 分类分级引擎识别敏感字段,按
L3部分脱敏保留分析价值,L4/L5可采用 Tokenization 替代 Masking。 - 审计输出:生成合规审计报告,并映射 DAMA 知识领域,标注数据架构、数据安全、元数据管理等覆盖程度。
适用边界
该技能侧重数据架构、建模、安全、质量、元数据等自动治理;对数据存储、集成互操作、主数据仅做部分覆盖。分类准确率受--threshold影响,误报时可人工标注反馈;脱敏策略需按下游分析需求权衡。
使用场景
- 数仓表结构变更后,自动采集新元数据并推导字段血缘,定位下游受影响的报表链路。
- 上线前对 DW 层跑六维质量规则,筛出 critical 字段并生成质量评分与失败证据。
- 审计前识别 L3-L5 敏感字段,按策略脱敏或 Tokenization,输出合规审计报告。
- 千表级元数据采集变慢时,用 --incremental 仅扫描 last_modified 有变化的表。
适合人员
- 数据工程师:需要在多源表结构变更后维护元数据、血缘和存储统计。
- 质量分析师:需要用 YAML 规则、severity 与质量评分定位 critical 问题。
- 安全与合规负责人:需要完成敏感字段分级、脱敏策略和审计证据整理。
- 数仓负责人:需要在 DW 层检查引用完整性、质量规则与治理覆盖度。