AI 结构化数据分析
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_3c6cb52e/data-analysis-skillhub。
技能介绍
问题
结构化数据看似可直接出结论,但真实 CSV、Excel、Parquet 和 JSON 常有列偏移、编码错误、缺失值、偏态分布和小样本。直接让代理画趋势或跑回归,可能把静默解析错误当成业务信号。这里需要把数据检查、统计计算和结论表述拆开,让每一步都能被审查。
工作方式
该技能围绕 pandas、scipy.stats、statsmodels 和 numpy 建立分析流程:先用 DataFrame 检查形状、列类型和首尾样本;再计算均值、中位数、标准差、偏度、峰度与类别计数;随后用滚动均值、季节分解、group-by 和透视表识别趋势。关键判断依赖相关矩阵、t 检验、卡方检验、ANOVA,并要求同时报告 p 值、置信区间和效应量。异常值用 IQR 与 z-score 检查,缺失值、偏度、共线性和小样本有对应处理。
适用边界
它适合结构化数据探索与统计报告,不替代领域建模。当目标变量缺失超过 30%、分布严重偏态、预测变量高度共线或 n < 30 时,需要显式降级方法。混合类型列、非平稳时序和混淆变量都应在结论中标注限制,避免把统计显著直接解释成业务因果。
使用场景
- 收到多份区域销售 CSV,需汇总均值偏度并做 t 检验判断组间差异显著性
- 有 12 个月运营指标序列,需做季节性分解并标记周期性异常点
- 数据集关键列缺失 35%,需评估插补偏差后决定用完整子集分析
- A/B 实验原始数据需卡方检验加效应量报告,判断转化率差异显著性
适合人员
- 数据分析师:每周处理多份业务 CSV,需快速产出描述统计与假设检验报告
- 产品经理:拿到 A/B 测试原始数据,需判断指标差异是否具有统计显著性
- 量化研究员:处理时序因子数据,需季节性分解和离群点标记
- 数据工程师:接入 Parquet 数据管道,需在下游建模前做列类型与缺失值检查