Agent Skills
返回列表
Pandas Profiling 数据探索

Pandas Profiling 数据探索

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_922b1001/pandas-profiling。

技能介绍

问题

当拿到一个 pandas DataFrame 时,工程师经常要先确认数据是否可用于建模、报表或 ETL:哪些列存在缺失、类型是否一致、取值范围是否异常、重复与分布是否值得继续处理。手工写 describe()、isna().sum() 等检查容易遗漏,且不同项目里重复实现。

技能能力

Pandas Profiling 面向这类自动化数据探索场景,把对 pandas 数据的常见检查收敛成一个可调用技能。核心是围绕输入 DataFrame 执行 profiling:检查列结构、缺失情况、取值分布等基础质量信号,帮助先判断数据是否干净、字段含义是否可用。它适合在数据接入、调试、模型特征准备前使用;对已经明确字段语义的分析任务,仍需结合业务上下文判断。

使用场景

  • 拿到第三方 CSV 加载为 DataFrame 后,先检查缺失、类型和取值范围,判断能否进入清洗。
  • 模型特征准备前,对候选字段做基础分布与缺失统计,排除明显异常列。
  • ETL 脚本上线前,用 profiling 输出确认表结构、缺失值和字段取值是否符合预期。
  • 调试 pandas pipeline 时,快速查看中间 DataFrame 的结构和缺失情况。

适合人员

  • 需要把 CSV 或 SQL 结果转成 pandas 后先做质量检查的数据分析师。
  • 上线特征或报表脚本前要确认 DataFrame 字段与缺失状态的数据工程师。
  • 调试 pandas 管道并定位中间数据异常的研究工程师。
  • 接手未知数据集、先判断能否继续分析的分析工程师。