银行流水扫描件 OCR 整理
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_d2f40577/bank-statement-ocr。
技能介绍
解决的问题
银行流水扫描件常见于诉讼、审计和个人资产核对,通常是 PDF 页面,无法直接筛选、汇总或按银行拆分。人工录入日期、摘要、收支、余额和对方户名容易出错,且难以保留“哪一页来自哪条记录”的来源信息。该技能面向这类场景,将银行流水 PDF 扫描件转换为结构化 Excel 文件,并按银行生成独立工作表。
技能如何工作
整个流程偏工程化:先检查视觉 OCR API 配置;再用 PyMuPDF 将 PDF 转为 200 DPI 的 PNG 页面;随后由 scripts/batch_worker.py 对页面做并发 OCR,并把每页结果写入 JSON。之后通过 overrides.json 处理常见异常,例如某页银行名识别错误、PDF 页面数与实际内容不一致、文件映射关系需要修正。最终 scripts/generate_excel.py 生成 {原PDF名}_AI整理.xlsx。
生成的 Excel 按银行分表,表内包含:
- 标题行:
{归属人} - {银行名} 流水明细 - 来源行:PDF 名与记录数
- 常用列:
日期、摘要、收入、支出、余额、对方户名等 来源页码列- 底部统计:总记录数、收入/支出笔数与金额、净额
适用边界与注意点
它不是“一键全对”的识别工具。扫描件质量、字体、印章遮挡和跨页字段缺失都会影响结果。尤其银行名存在相近识别风险,如 CMB 可能被误判为 CCB 或 ICBC,因此流程要求核对每页银行映射和户名。若一页缺少户名,技能采用前向继承规则;同一 PDF 可能包含多个账户持有人,输出表会体现不同归属人。适合需要快速形成初稿并人工复核的流程,不适合无人确认直接作为财务或法律证据使用。
使用场景
- 诉讼律师收到多份银行流水 PDF,需要按银行拆成 Excel 并保留来源页码以便核对。
- 审计人员将跨页扫描件识别为 JSON,再修正错认银行并生成带统计的流水表。
- 法务会计要把多个账户流水合并到按银行分表的 Excel,并标注归属人与来源页。
- 数据分析师从银行 PDF 提取日期、摘要、收支、余额,形成可筛选表格。
适合人员
- 需要把诉讼材料中银行流水 PDF 转成可按银行核对的 Excel 的律师
- 需要审核扫描件 OCR 结果并修正银行名和归属人的审计人员
- 需要汇总多个账户流水并保留来源页码的法务会计
- 需要从银行流水提取结构化字段做核对的数据分析师