数据建模与可视化
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_1581d31c/data-modeling-viz-v2。
技能介绍
要解决的问题
很多数据任务卡在不确定的地方:拿到 CSV / Excel 后,AI 容易直接跳到建模、画图或给结论,却缺少目标变量确认、数据质量检查和模型方向判断。结果可能是用回归解释分类数据、忽略缺失值、把相关性说成因果,或者生成图表却没有业务解释。
这个技能如何工作
该技能按标准数据分析工作流约束输出:数据理解 → EDA → 模型选择 → 建模验证 → 可视化解释。
- 边界处理优先:先检查行数、列名、缺失值;缺失比例高时暂停询问,全部为分类变量时转向频率分析、交叉表和卡方检验。
- EDA 先行:对数值列做分布、相关系数和热力图,对分类列做占比、箱线图或交叉表,并围绕用户指定的目标变量分析。
- 模型选择可解释:根据线性、非线性、分类、时序或探索型问题,选择线性回归、随机森林、逻辑回归、趋势分解或
PCA等方向,并说明理由。 - 验证与输出:输出
R²、RMSE、MAE、准确率、F1等指标,同时给出关键发现、业务解释和局限性。
适用边界
它适合中小规模表格数据的探索分析、关系解释和基础建模,不适合直接承担 XGBoost、神经网络、大规模分布式处理或专业地理/网络可视化;遇到这些场景需要扩展外部技能。
使用场景
- 拿到销售 CSV 后,需要检查缺失值、识别关键变量并输出相关性分析图。
- 对 Excel 用户行为表做 EDA,比较不同渠道的转化率并生成箱线图。
- 需要基于历史营收预测趋势,并给出测试集指标与业务解释。
- 用 matplotlib/seaborn 绘制变量关系和模型结果,形成数据分析报告。
适合人员
- 数据分析师:需要快速完成表格数据 EDA、相关性分析和基础建模。
- 产品运营:想从用户行为 Excel 中找关键影响因素并解释业务含义。
- 工程师:需要用 Python 绘图脚本生成可复用的关系图和模型结果图。
- 业务顾问:要把统计结果翻译成建议,同时说明相关性与样本量局限。