AutoML 自动机器学习
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_b09806db/automl。
技能介绍
解决什么问题
表格模型调参常常依赖人工试错:learning_rate、num_leaves、特征清洗、模型切换和集成策略都需要反复运行与比较。这个技能把 CSV 表格数据建模封装成可自主运行的实验循环,让代理在 CPU 环境 下围绕目标指标持续尝试、评估和保留有效配置。
工作方式
核心流程从参数开始:读取 data_path、target_col、task_type、metric、time_budget 和 max_experiments。随后进行数据检查、初始化 workspace,并建立 baseline。实验循环中,技能会分析 results.tsv,按优先级设计实验:超参调优 > 模型切换 > 特征工程 > 集成;修改 train.py,运行训练并解析验证指标、内存和耗时,再根据收益决定 commit 或 revert。它支持分类、回归和多分类任务,可覆盖 accuracy、f1_macro、rmse、mae、r2 等指标,并在可用时输出特征重要性和过拟合诊断。
适用边界
它更适合中等规模结构化数据、预算有限且希望得到可解释传统 ML 配置的场景。若数据缺失严重、目标列不明确、需要深度学习或长周期大模型训练,应先做数据治理或改用更适合的管线。实验循环会自主推进,直到达到 max_experiments 或被用户停止。
使用场景
- 给定一份带目标列的 CSV 文件,要求在 CPU 环境下自动完成分类或回归建模并输出最优传统 ML 配置。
- 已有 baseline 模型但指标停滞,需要按调参、换模型、特征工程和集成的优先级持续做实验并保留有效改动。
- 数据量约 10 万行以内,想用 LGB、XGB 等模型快速比较 `f1_macro`、`rmse` 等指标,而不是手写训练脚本。
- 需要查看训练-验证差距、特征重要性和被保留/丢弃实验数量,以判断模型是否存在过拟合。
适合人员
- 负责把销售、客服或用户行为表变成预测模型的算法工程师,希望减少手调超参时间。
- 做客户流失、价格响应或风险分类的业务分析师,需要可解释的传统 ML 模型和评估报告。
- 使用 AI 代理做数据实验的工程师,希望代理能自主运行训练、记录结果并回退无效配置。
- 维护数据科学流水线的平台工程师,需要把 CSV 建模、baseline 和实验记录纳入统一流程。