敏感文件脱敏
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_c0e4b78f/anonymize-sensitive-files。
技能介绍
问题背景
向外部团队交付文档时,常常需要保留格式与结构,同时删除姓名、电话、账号、密钥等敏感值。直接查找替换容易漏掉 DOCX、Excel、PDF 中的隐藏字段,也会让同一实体在不同位置变成不同假值,导致业务无法复核。
工作方式
该 Skill 在本地按“扫描 -> 脱敏 -> 校验”运行,默认不覆盖原件,并生成独立脱敏副本:
- 先执行
scan,检查warnings、skipped_inputs和finding_counts,识别高风险格式或无法处理区域。 - 脱敏时使用
--manifest保存本次替身值,保证同一原值在单次运行中映射到同一假值。 - 校验时复用同一份规则、词表和
manifest,确认没有残留发现、没有未处理输入,再交付结果。 DOCX、Excel、PDF按格式边界处理;PDF 使用真实 redaction,而不是视觉黑框。
适用边界
它不承诺处理所有文档内容:批注、图表、宏、扫描页、图片文字、复杂公式、非 UTF-8 文本和外部链接等需要人工复核。若发现漏检,应先补失败测试,再更新字段规则并重跑扫描、脱敏和校验。
使用场景
- 交付客户合同前,对 DOCX、Excel、PDF 中的姓名、账号、密钥做脱敏并保留格式结构。
- 对外发布调研结果前,批量处理 CSV、JSON、YAML 文本中的敏感字段,并生成可校验的脱敏副本。
- 排查误报或漏检时,用 scan 查看 warnings、finding_counts,再按字段规则重跑脱敏和 verify。
- 交接项目资料时,用 manifest 保持同一原值映射一致,并导出受控映射供后续校验。
适合人员
- 负责对外交付合同、报价单和调研报告的商务或法务助理,需要把敏感字段替换成稳定假值。
- 处理客户数据集的分析师,需要在不覆盖原始 CSV、JSON、YAML 的情况下生成脱敏副本。
- 做文档自动化或 Agent 流程的工程师,要把扫描、脱敏、校验接入 Python 3.10+ 工作流。
- 需要审计输出结果的数据安全工程师,要检查 warnings、残留发现与未处理输入后再放行。