Agent Skills
返回列表
文献收割机:自动 PDF 与引用查找器

文献收割机:自动 PDF 与引用查找器

行业专业 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_82882ca7/reference-harvester。

技能介绍

问题

写论文或做文献管理时,PDF 里的参考文献常以数字列表、作者-标题混排或仅含 URL 的形式出现;文本抽取还会把 https://、DOI 和路径拆出空格,导致 doi.org/ 10.1016/... 无法直接使用。若只做简单正则,会得到截断标题、缺失作者、错误 BibTeX,以及把 HTML 错误页当成 PDF。

工作方式

Reference Harvester 把流程拆成可执行脚本:先用 pdfplumber 抽取全文,再用 parse_references.py 识别 References、参考文献、Bibliography 等小节,按编号引用和作者优先引用两种格式解析。它会修复断开的 URL,剥离页码、页眉和脚注标记,输出包含 index、title、url、doi、arxiv_id、raw 的 JSON。随后通过 WebFetch 访问 DOI/URL 补全 authors、journal、volume、pages 等字段,再由 generate_bib.py 生成 BibTeX;对预印本使用 unpublished,对期刊论文使用 article。下载侧会优先处理 arXiv,再尝试 direct PDF、PMC/EuropePMC、MDPI、Nature/Springer OA、PLoS、RSC、Wiley、Elsevier 等来源,并用 %PDF- 魔数校验文件头。

适用边界

该技能适合从单篇论文 PDF 中批量整理参考文献,不适合解析正文脚注式引用或需要登录权限的受限文献。对反爬较强的出版商,即使 OA 也可能返回 403,需要人工下载;对 Vancouver、内联引用等非标准格式,可能需要检查抽取文本并调整解析启发式。

使用场景

  • 拿到一篇会议论文PDF,要提取References、修复DOI空格并生成可导入Zotero的BibTeX文件。
  • 整理arXiv参考文献时,按arXiv ID批量下载PDF,并校验文件头避免把错误页存成PDF。
  • 对无arXiv ID的OA文献,尝试PMC、MDPI、Springer下载PDF,并生成缺失清单。
  • 向合作者交付未找到文献表,生成横向Word表格,含作者、标题、来源和可点击链接。

适合人员

  • 写论文时需要从PDF参考文献批量整理BibTeX的研究生
  • 管理实验室文献库、要把OA论文PDF与元数据对齐的研究助理
  • 做技术报告引用核查、需要确认DOI和下载页链接的工程师
  • 维护学术资料包、需向合作者交付缺失引用清单的博士后