Pandas Profiling 数据探索
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_922b1001/pandas-profiling。
技能介绍
问题
当拿到一个 pandas DataFrame 时,工程师经常要先确认数据是否可用于建模、报表或 ETL:哪些列存在缺失、类型是否一致、取值范围是否异常、重复与分布是否值得继续处理。手工写 describe()、isna().sum() 等检查容易遗漏,且不同项目里重复实现。
技能能力
Pandas Profiling 面向这类自动化数据探索场景,把对 pandas 数据的常见检查收敛成一个可调用技能。核心是围绕输入 DataFrame 执行 profiling:检查列结构、缺失情况、取值分布等基础质量信号,帮助先判断数据是否干净、字段含义是否可用。它适合在数据接入、调试、模型特征准备前使用;对已经明确字段语义的分析任务,仍需结合业务上下文判断。
使用场景
- 拿到第三方 CSV 加载为 DataFrame 后,先检查缺失、类型和取值范围,判断能否进入清洗。
- 模型特征准备前,对候选字段做基础分布与缺失统计,排除明显异常列。
- ETL 脚本上线前,用 profiling 输出确认表结构、缺失值和字段取值是否符合预期。
- 调试 pandas pipeline 时,快速查看中间 DataFrame 的结构和缺失情况。
适合人员
- 需要把 CSV 或 SQL 结果转成 pandas 后先做质量检查的数据分析师。
- 上线特征或报表脚本前要确认 DataFrame 字段与缺失状态的数据工程师。
- 调试 pandas 管道并定位中间数据异常的研究工程师。
- 接手未知数据集、先判断能否继续分析的分析工程师。