Agent Skills
返回列表
智能数据分析

智能数据分析

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_af28adda/chat2duckdb-cloudcba。

技能介绍

需要解决的核心问题

数据分析工作常始于一个陌生的数据文件(如 CSV、Excel),工程师面临几个典型痛点:

  • 手动探索低效:需要编写脚本或记忆繁琐的库函数来获取基本统计信息。
  • SQL 编写易错:手写查询时,列名拼写错误、语法疏漏(如多加分号)会导致反复调试。
  • 验证流程缺失:对大数据集或复杂查询,直接执行风险高,缺乏轻量级的抽样验证机制。

智能数据分析技能旨在通过 DuckDB 引擎和自然语言接口,提供一个从“理解数据”到“获取洞察”的自动化分析流程。

技能如何工作:核心能力与关键步骤

该技能围绕 DuckDB 的 SQL 分析能力构建,其核心工作流如下:

1. 数据注册与探索

  • 使用 Pandas 将 CSV、JSON、Parquet 等格式的数据文件注册为 DuckDB 中的 data 表。
  • 通过 describe 模式,生成包括表结构、数值统计、分类分布、日期范围和缺失值在内的完整数据画像。

2. 智能查询生成与执行

  • 自然语言转 SQL:将用户的分析意图(如“按类别统计平均价格”)直接生成对应的 SELECT 语句。
  • 自动 SQL 校正引擎

- 修复语法错误(如多余分号、引号不匹配)。
- 基于编辑距离自动纠正列名错误(例如将 categroy 匹配为 category)。
- 规范化 SQL 关键字大小写和中文标点。

  • 重试与抽样:查询失败时自动重试(默认 3 次),支持通过 --sample_fraction 参数在小样本上快速验证逻辑。

3. 结果分析与持久化

  • 输出查询结果表格、执行时间及重试次数。
  • 基于结果生成业务洞察(如占比、趋势)。
  • 可选地将分析结果或中间表持久化到 DuckDB 数据库文件(通过 --persist_db_path 参数),便于后续多表关联。

适用边界与关键注意点

该技能专注于 DuckDB SQL 方言,不兼容 MySQL、PostgreSQL 等其他数据库的专有语法。请特别注意:

  • 先探索后查询:始终建议先使用 describe 模式了解数据结构和质量,再构建查询。
  • 复杂查询验证:对涉及大量计算或连接的复杂查询,务必先用抽样参数(如 --sample_fraction 0.1)进行验证。
  • 资源限制:处理超大数据集时,应结合 LIMIT 子句或聚合查询,避免内存不足。Pandas 仅用于初始文件读取,所有分析计算必须通过 DuckDB SQL 完成,以确保性能和一致性。
  • 字段名处理:对于包含空格、连字符或中文的特殊字段名,SQL 中必须使用双引号包裹(如 "销售-额"),技能引擎会尝试自动校正未加引号的情况。

遵循这些实践,可以高效、可靠地完成从原始数据到分析结论的端到端流程。

使用场景

  • 当接手一份新的销售数据 CSV 文件时,使用数据探索模式快速获取列结构、数值分布和缺失值统计,以评估数据质量。
  • 业务团队需要分析产品类别表现,通过自然语言描述(如“统计每个类别上月销售额”)生成并执行 SQL 查询,直接获取洞察。
  • 在对大型订单表执行多表连接查询前,先通过抽样参数在 10% 数据样本上验证逻辑,避免全表扫描导致的性能问题。
  • 完成查询后,需要将结果自动保存为 Excel 文件,以便与非技术同事分享或用于制作可视化仪表板。

适合人员

  • 数据分析师:每周需要处理多份新数据集,快速探索数据结构并编写 SQL 查询以生成定期报告。
  • 业务分析师:希望通过自然语言描述获取销售或运营数据洞察,减少对 SQL 语法的依赖。
  • 数据工程师:在数据处理流程中集成自动化的 SQL 错误校正和重试机制,提高管道的稳定性和容错能力。
  • 产品经理:需要定期分析用户行为数据,使用抽样功能安全地测试不同查询逻辑,以支持产品决策。