arXiv 论文与源码下载
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_c6886734/arxiv-paper-downloader-plus。
技能介绍
问题
工程师读取 arXiv 论文时,常常需要同时处理几件小事:从 abs/pdf 链接提取 ID、下载 PDF 或 LaTeX 源码、批量保存后整理文件名。手动复制 ID、等待下载、再重命名容易出错,尤其是论文标题含 :、/、? 等字符或标题过长时。
工作方式
该技能围绕 scripts/download_arxiv.py 工作,使用 Python 标准库,不引入额外依赖。它支持:
- 单篇下载:输入 arXiv ID、
arxiv.org/abs/ID或arxiv.org/pdf/ID,自动保存 PDF 并按论文标题重命名 - 关键词检索:通过 arXiv API 查询结果,再让用户选择 ID 下载
- 源码下载:使用
--source获取.tar.gzLaTeX 源文件 - 批量下载:一次命令处理多个 ID,并记录成功/失败数量
关键流程是:解析用户消息中的 ID 或 URL,确定输出目录,调用脚本下载,最后返回文件路径。若标题冲突,会自动追加 (1)、(2);过长标题会在词边界截断;批量请求之间保留 0.5s 间隔。
注意
不是所有论文都有源码,arXiv 可能返回 403;元数据请求超时为 30s,下载超时为 120s。若 export.arxiv.org 被网络限制,需要重试或更换网络环境。
使用场景
- 阅读 arXiv 论文时,从 abs 或 pdf 链接直接下载 PDF,并按标题整理文件名。
- 按关键词检索 arXiv,比较元数据后选择几篇论文批量保存到本地目录。
- 复现论文实验前,下载 arXiv 的 LaTeX 源码 tar.gz,提取代码与图表。
- 整理文献资料时,把多篇 arXiv 论文一次性下载,并避免文件名冲突覆盖。
适合人员
- 追踪新论文的算法研究者:按 arXiv ID/URL 保存 PDF 和源码,便于离线阅读与复现。
- 做文献综述的研究生:按关键词检索、挑选候选论文,再批量下载并整理文件名。
- 复现模型的工程师:下载 LaTeX 源包,提取代码、配置和图表资产。
- 维护论文资料库的技术写作者:统一命名,避免特殊字符和长标题导致的文件混乱。