数据清洗与格式转换工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_176cb31c/data-clean-transform。
技能介绍
要解决的具体问题
数据进入分析或建模前,常常先卡在格式和字段质量上:CSV、JSON、XML、YAML、Excel、TSV 互相混杂,表头不一致,空值、重复行、异常值、乱码和错误编码频繁出现。手工清洗容易漏规则,脚本又常常只适配某一类文件。这个技能把常见脏数据问题收敛到一组可复用的清洗与转换能力里。
技能如何工作
它按文件输入、规则处理、结果输出组织工作流。核心能力包括:
- 格式互转:在
CSV、JSON、XML、YAML、Excel、TSV之间做结构化转换。 - 数据清洗:处理去重、空值、异常值修复和格式标准化。
- 编码修复:检测乱码,并在
UTF-8、GBK、GB2312、Latin1等编码之间转换。 - 正则处理:用正则表达式提取、替换或拆分列。
- 列操作:重命名、映射、拆分、合并列,以及做类型转换。
- 数据校验:对邮箱、手机号、身份证、地址等字段做格式验证。
- 批量处理:支持目录级文件转换和清洗,适合成批处理同结构文件。
适用边界与注意点
它适合本地文件或目录中的数据清洗、格式统一和字段标准化,尤其是分析前需要快速把杂乱数据整理成可用表结构的场景。若任务涉及实时数据流、复杂 ETL 编排、数据库事务、权限治理或跨系统同步,需要把它作为其中一个处理环节,而不是完整的数据平台。处理敏感字段前,应明确脱敏和保留策略。
使用场景
- 分析前把供应商 CSV、Excel 和 JSON 统一成同一表结构,便于后续统计。
- 清洗用户反馈表中的重复行、空值和异常手机号,输出可入库的规范数据。
- 修复 GBK 或 Latin1 文件中的乱码,并批量转换为 UTF-8 的 CSV。
- 用正则从地址列拆出省、市、区字段,再对邮箱和身份证做格式校验。
适合人员
- 数据分析师:在建模前需要把多来源文件转成统一 CSV 或 Excel 并做基础清洗。
- 后端工程师:处理日志或接口导出文件时需要修复编码乱码、拆分字段和校验格式。
- 运营分析师:汇总供应商或活动数据时需要去重、空值处理和批量转换文件。
- ETL 脚本维护者:需要把固定结构文件的清洗规则整理成可复用处理步骤。