结构化数据分析
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,将 @org-02qudk26/data-analysis-cn 安装到 AI 助手中。
技能介绍
要解决的问题
Agent 分析 CSV、Excel、Parquet 或 JSON 时,常陷入两种极端:要么只输出均值、计数等表层结果,要么直接套模型却忽略缺失、偏度、共线性和小样本。结果是 p 值看似显著,业务含义不清;或者静默解析错误导致后续统计失效。
技能如何工作
该技能按可审计的统计流程推进:
- 数据探查:读取为
pandasDataFrame,检查形状、列类型、首末行和编码问题。 - 描述统计:数值列计算均值、中位数、标准差、偏度、峰度;类别列计算取值计数与众数。
- 趋势与模式:时序数据做滚动平均、百分比变化和季节性分解;非时序数据用 group-by 与透视表发现跨类别模式。
- 相关与检验:计算
Pearson、Spearman相关,并在合适时执行 t 检验、卡方检验或ANOVA,同时报告效应量和置信区间。 - 异常检测:结合 IQR 与 z 分数标记离群点,并区分错误、罕见事件和有效信号。
最后把发现按业务影响或统计显著性排序,写成包含限制条件的报告。
适用边界
它适合结构化表格数据的描述性分析、相关性判断和初步推断检验,不适合替代领域建模、因果推断或高精度预测。当关键列缺失超过 30%、分布偏度超过 |2.0|、预测变量相关性超过 0.9 或样本量 n < 30 时,应优先检查插补偏差、非参数检验、正则化或 bootstrap 方法。
使用场景
- 收到销售 CSV 后,检查数据质量并计算各地区的均值、标准差与异常值。
- 对带日期索引的指标做滚动平均、季节性分解,判断趋势和周期。
- 比较多个实验组,执行 t 检验或卡方检验,并报告 p 值与效应量。
- 在 Parquet 数据中查找相关矩阵和共线性问题,给后续建模提出建议。
适合人员
- 做业务报表的分析师,需要把多份表格转成可复核的描述统计与异常说明。
- 数据工程师,需要给 Agent 一套先探查再检验的结构化数据处理流程。
- 产品研究员,需要比较版本实验组,判断差异是否显著且是否实际重要。
- 运营分析,需要按地区、产品线分组,发现异常值和相关关系。