PDFlux 文档转 Markdown
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-pdflux-pdf2markdown。
技能介绍
要解决的问题
本地文档经常需要进入 LLM 工作流,但直接读取 PDF 或扫描件容易在正文顺序、表格结构、字段抽取上出错。pdflux-pdf2markdown 把这件事收敛为一次同步 API 调用:输入单个本地文件,输出可用于后续处理的 Markdown 或 JSON。
技能如何工作
技能要求直接调用 scripts/upload_to_markdown.js,不要自行重写请求流程。脚本从 PAODINGAI_API_KEY 读取 Bearer 密钥,向 PDRouter 的 POST /openapi/{serviceCode}/file/markdown 发送文件;若响应包含 markdown 字段则打印 Markdown,否则打印 JSON。若传入 output-markdown-path,同一内容还会写入指定文件。进度和错误写入 stderr,失败返回非零退出码。
适用边界
默认不包含图表或图片数据;需要嵌入图片时设置 PDFLUX_INCLUDE_IMAGES=true,但会显著增加 token 消耗。它适合摘要、字段抽取、表格比较、规则校验等下游任务的第一步;如果用户只要转换结果,可直接输出 Markdown;如果只是取字段或表格,应基于解析结果筛选,而不是回显完整原文。
使用场景
- 处理合同或报告 PDF,先把正文和表格解析成 Markdown,再做摘要或字段抽取。
- 用户要求把本地文档转成 Markdown,脚本一次性调用 PDFlux 同步 API 并直接返回结果。
- 下游规则校验需要读取表格字段,先运行脚本生成 Markdown,再从结果中筛选必要内容。
- 在文档处理流水线开头,把单个文件转成可读取文本,供后续脚本比较表格或提取正文。
适合人员
- 需要把合同、报告或说明书解析成 Markdown 再做摘要的文档工程师。
- 要从 PDF 表格中提取字段并写入自动化脚本的数据工程师。
- 在 LLM 工作流中需要稳定获取文档正文与表格结构的 AI 应用开发者。
- 需要按用户指令直接输出转换结果或仅提取必要内容的 RAG 系统负责人。