Agent Skills
返回列表
大数据管理与应用

大数据管理与应用

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a045eab5/bigdata-management。

技能介绍

要解决的问题

当需求提到实时看板、数据湖迁移、Spark 调优,但缺少数据量、延迟、团队栈时,方案容易停在工具堆砌。该技能先把输入约束清楚:业务场景、关注环节、技术栈偏好、问题是理论、实现还是方案设计。

工作方式与边界

  • 采集与存储:覆盖 Kafka、Flume、DataX、HDFS、Ceph、Iceberg、Hudi、Delta Lake 等组件取舍。
  • 处理与查询:围绕 Spark、Flink、Kafka Streams、Airflow、ClickHouse、Doris、Trino、Druid 给出批流、调度与 OLAP 思路。
  • 治理与安全:结合 Atlas、DataHub、Great Expectations、Ranger 等讨论目录、血缘、质量和权限。

它要求输出可执行建议:架构取舍、工具对比、关键参数、文本流程图和必要代码示例。边界:更偏方案设计与工程咨询,不替代压测、上线、运维和成本核算;遇到新兴组件或私有实现,需回查官方文档和社区案例。

使用场景

  • 设计日均十亿级日志的实时分析链路,确定 Kafka、Flink 与 OLAP 引擎分工。
  • 把传统 Hive 数据仓库迁往 Iceberg 或 Hudi 数据湖,并制定分阶段迁移与回退方案。
  • 排查 Spark SQL 任务慢、shuffle 高或数据倾斜,输出分区、内存与参数调优清单。
  • 为风控推荐场景建立数据质量校验与血缘追踪,覆盖表结构、指标口径和访问权限。

适合人员

  • 负责实时数仓选型的后端工程师,需要确定 Kafka、Flink、ClickHouse 或 Doris 的组合。
  • 做数据平台治理的数据工程师,需要整理数据目录、血缘、质量规则与权限策略。
  • 主导数仓到湖仓迁移的架构师,需要比较 Iceberg、Hudi、Delta Lake 并制定迁移路线。
  • 分析 Spark 作业性能的开发同学,需要定位 shuffle、分区、内存与倾斜问题。