Agent Skills
返回列表
arXiv 论文与源码下载

arXiv 论文与源码下载

行业专业 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_c6886734/arxiv-paper-downloader-plus。

技能介绍

问题

工程师读取 arXiv 论文时,常常需要同时处理几件小事:从 abs/pdf 链接提取 ID、下载 PDF 或 LaTeX 源码、批量保存后整理文件名。手动复制 ID、等待下载、再重命名容易出错,尤其是论文标题含 :、/、? 等字符或标题过长时。

工作方式

该技能围绕 scripts/download_arxiv.py 工作,使用 Python 标准库,不引入额外依赖。它支持:

  • 单篇下载:输入 arXiv ID、arxiv.org/abs/ID 或 arxiv.org/pdf/ID,自动保存 PDF 并按论文标题重命名
  • 关键词检索:通过 arXiv API 查询结果,再让用户选择 ID 下载
  • 源码下载:使用 --source 获取 .tar.gz LaTeX 源文件
  • 批量下载:一次命令处理多个 ID,并记录成功/失败数量

关键流程是:解析用户消息中的 ID 或 URL,确定输出目录,调用脚本下载,最后返回文件路径。若标题冲突,会自动追加 (1)、(2);过长标题会在词边界截断;批量请求之间保留 0.5s 间隔。

注意

不是所有论文都有源码,arXiv 可能返回 403;元数据请求超时为 30s,下载超时为 120s。若 export.arxiv.org 被网络限制,需要重试或更换网络环境。

使用场景

  • 阅读 arXiv 论文时,从 abs 或 pdf 链接直接下载 PDF,并按标题整理文件名。
  • 按关键词检索 arXiv,比较元数据后选择几篇论文批量保存到本地目录。
  • 复现论文实验前,下载 arXiv 的 LaTeX 源码 tar.gz,提取代码与图表。
  • 整理文献资料时,把多篇 arXiv 论文一次性下载,并避免文件名冲突覆盖。

适合人员

  • 追踪新论文的算法研究者:按 arXiv ID/URL 保存 PDF 和源码,便于离线阅读与复现。
  • 做文献综述的研究生:按关键词检索、挑选候选论文,再批量下载并整理文件名。
  • 复现模型的工程师:下载 LaTeX 源包,提取代码、配置和图表资产。
  • 维护论文资料库的技术写作者:统一命名,避免特殊字符和长标题导致的文件混乱。