Agent Skills
返回列表
📊

结构化数据分析

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,将 @org-02qudk26/data-analysis-cn 安装到 AI 助手中。

技能介绍

要解决的问题

Agent 分析 CSV、Excel、Parquet 或 JSON 时,常陷入两种极端:要么只输出均值、计数等表层结果,要么直接套模型却忽略缺失、偏度、共线性和小样本。结果是 p 值看似显著,业务含义不清;或者静默解析错误导致后续统计失效。

技能如何工作

该技能按可审计的统计流程推进:

  • 数据探查:读取为 pandas DataFrame,检查形状、列类型、首末行和编码问题。
  • 描述统计:数值列计算均值、中位数、标准差、偏度、峰度;类别列计算取值计数与众数。
  • 趋势与模式:时序数据做滚动平均、百分比变化和季节性分解;非时序数据用 group-by 与透视表发现跨类别模式。
  • 相关与检验:计算 Pearson、Spearman 相关,并在合适时执行 t 检验、卡方检验或 ANOVA,同时报告效应量和置信区间。
  • 异常检测:结合 IQR 与 z 分数标记离群点,并区分错误、罕见事件和有效信号。

最后把发现按业务影响或统计显著性排序,写成包含限制条件的报告。

适用边界

它适合结构化表格数据的描述性分析、相关性判断和初步推断检验,不适合替代领域建模、因果推断或高精度预测。当关键列缺失超过 30%、分布偏度超过 |2.0|、预测变量相关性超过 0.9 或样本量 n < 30 时,应优先检查插补偏差、非参数检验、正则化或 bootstrap 方法。

使用场景

  • 收到销售 CSV 后,检查数据质量并计算各地区的均值、标准差与异常值。
  • 对带日期索引的指标做滚动平均、季节性分解,判断趋势和周期。
  • 比较多个实验组,执行 t 检验或卡方检验,并报告 p 值与效应量。
  • 在 Parquet 数据中查找相关矩阵和共线性问题,给后续建模提出建议。

适合人员

  • 做业务报表的分析师,需要把多份表格转成可复核的描述统计与异常说明。
  • 数据工程师,需要给 Agent 一套先探查再检验的结构化数据处理流程。
  • 产品研究员,需要比较版本实验组,判断差异是否显著且是否实际重要。
  • 运营分析,需要按地区、产品线分组,发现异常值和相关关系。