Agent Skills
返回列表
📊

科学数据探索性分析

数据分析 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/exploratory-data-analysis。

技能介绍

要解决的问题

科研数据文件常常是“黑盒”:拿到 .fastq、.h5ad、.czi、.parquet 后,先要知道它是什么格式、含哪些字段、适合用什么库读取、有没有缺失或异常。手动查文档、写读取脚本和做摘要统计,容易遗漏格式细节,也难以形成可复用的分析计划。exploratory-data-analysis 把这类前置工作标准化为一次可执行的 EDA。

技能如何工作

该技能以文件路径为输入,围绕格式识别、元数据提取、质量检查和报告生成展开:

  • 文件类型检测:根据扩展名归类到化学分子、生物信息学、成像、光谱、组学或通用科学数据等类别。
  • 加载格式信息:读取对应 references/*.md,获取典型数据、用例、Python 库和 EDA 方法,例如 pandas、h5py、biopython。
  • 执行分析:对表格检查维度、缺失值、重复项和异常值;对序列检查长度、GC 含量和质量分数;对图像检查 X/Y/Z/C/T、位深和元数据;对数组检查 shape、dtype 和无效值。
  • 输出报告:按 assets/report_template.md 生成 Markdown 报告,包含文件元数据、格式说明、统计摘要、关键发现、预处理建议、可视化和下一步分析方案。

适用边界与注意点

它适合分析前摸底和下游规划,而不是完整建模或深度统计检验。大型文件建议抽样、分块或内存映射读取;未知扩展名需要用户补充格式线索。若目标领域依赖专用库,需先安装 pysam、rdkit、tifffile 等依赖。对于多文件比较,应分别 EDA 后再做汇总,避免把不同来源的格式假设混在一起。

使用场景

  • 拿到 FASTQ 文件,先检查序列数、长度、GC 含量并输出质量摘要。
  • 收到 .h5ad 表达矩阵,需查看维度、数据分布并给出下游分析建议。
  • 处理显微镜 .czi 图像,需确认 X/Y/Z/C/T、位深和通道元数据。
  • 整理 CSV 实验数据,需统计缺失值、重复项和异常值并保存 EDA 报告。

适合人员

  • 生物信息工程师:拿到 FASTQ/BAM 前,需要快速判断格式、库依赖和质量风险。
  • 化学研究员:分析 .pdb/.cif 时,需要明确结构字段、读取方式和 EDA 方法。
  • 数据工程师:接手 .parquet/.h5ad 时,需要先检查 schema、分布和缺失值。
  • 科研学生:面对 .czi/.tif 图像,需要确认维度、通道和强度统计。