arXiv MCP Server(cyanheads) logo

arXiv MCP Server(cyanheads)

★★★★ 4.2/5
访问官网
分类
MCP
定价
免费
访问
直连可用

快速结论

cyanheads 维护的 arXiv MCP Server 是面向 Claude、Cursor、VS Code 等 MCP 客户端的只读学术检索服务。截至 2026-07-21,npm 包 @cyanheads/arxiv-mcp-server 当前版本为 v1.2.15,采用 Apache-2.0 License,提供 4 个 tools 和 2 个 resources,可通过 stdio 本地运行,也可通过 Streamable HTTP 自托管。它适合搜索 arXiv、按 ID 批量取元数据、读取可用的 HTML 全文和查询分类,不是引文管理器、同行评审数据库或保证 PDF 全文解析的文献平台。

项目还提供公共端点 https://arxiv.caseyjhand.com/mcp 和可选 SQLite + FTS5 元数据镜像。公共端点适合快速试用,但仓库没有承诺 uptime、容量、数据保留、支持响应或 SLA,生产流程应自托管并监控。镜像可以减少搜索和元数据请求对实时 API 的依赖,却不会镜像论文全文;arXiv 数据政策不允许把该能力理解为任意批量抓取全文。

核心功能

  • arxiv_search:支持 ti:au:abs:cat:all: 字段与 ANDORANDNOT,可按分类、相关性、提交或更新时间筛选和排序,每次最多返回 50 条。
  • arxiv_get_metadata:一次最多按 10 个新版或旧版 arXiv ID 获取元数据,并分别报告未找到的条目。
  • arxiv_read_paper:优先读取 arXiv 原生 HTML,失败时回退 ar5iv;将 MathML 压缩为 LaTeX 形式,但返回的是原始 HTML,不是结构化论文解析。
  • arxiv_list_categories:提供约 155 个分类和 8 个顶级组的静态分类法,可按 group 过滤。
  • 2 个 resourcesarxiv://paper/{paperId} 返回论文元数据,arxiv://categories 返回分类法。
  • 双传输与鉴权:同一代码支持 stdio 和 Streamable HTTP;自托管 HTTP 可配置 none、JWT 或 OAuth。
  • 限速与重试:默认请求间隔 3000ms,遇到限流按 5、10、20、30 秒冷却并遵守 Retry-After
  • 可选本地镜像:OAI-PMH 初始化后写入 SQLite + FTS5,为搜索和元数据提供本地查询;全文仍走在线内容源。

适合人群

  • 需要在 MCP 对话中精准搜索 arXiv,并能使用字段与布尔语法的研究者。
  • 想把少量论文元数据或 HTML 正文交给 AI 做初步摘要、比较和问题定位的学生与研发人员。
  • 愿意自托管、固定 npm 版本、记录 arXiv ID/版本并执行来源复核的技术团队。
  • 有较多重复元数据查询、能够承担约数小时首次收割和 SQLite 运维的团队。
  • 不适合需要完整引用图谱、出版社定稿、审计级文献管理或公共托管 SLA 的场景。

使用场景

对于主题调研,可先用 arxiv_list_categories 找到分类,再用 arxiv_search 缩小到几十篇候选,随后按 ID 批量获取元数据,只读取少量高相关论文。对于固定论文,可通过 resource 或 arxiv_get_metadata 保存版本化 ID,以免论文更新后摘要和内容发生变化。镜像更适合重复搜索与元数据查询,不应为了单次任务承担冷启动收割成本。

arXiv 官方建议连续 API 调用之间至少等待约 3 秒,大结果集应缩小范围或使用不超过 2,000 条的切片,批量元数据则使用 OAI-PMH。该 server 默认 3 秒队列符合交互式调用习惯,但多用户共享一个出口 IP 时仍会串行排队。不要通过降低 ARXIV_REQUEST_DELAY_MS 绕过上游规则;应缓存重复查询、限制并发,并对 429 或临时错误执行退避。

论文 HTML、摘要与链接是不可信内容。其中可能出现提示注入、伪造指令、恶意 URL 或未经同行评审的错误结论。MCP 客户端不能因为论文文本要求就访问密钥、本地文件或其他工具。该 server 也不生成经过核验的参考文献格式;引用前要检查版本页、DOI、作者顺序、发布日期、期刊信息和撤稿状态。

价格与版本

软件本体免费,v1.2.15 已发布到 npm,包要求 Node.js >=24.0.0 或 Bun >=1.3.0,许可证为 Apache-2.0。可用 bunx @cyanheads/[email protected] 固定版本,或下载项目提供的 MCPB、使用 Cursor/VS Code 安装入口、从源码构建及运行 Docker。固定版本比直接使用 latest 更利于生产回归。

方式软件费用关键边界
npm/Bun stdio免费本地进程,适合个人客户端;运行环境与升级由用户维护
自托管 HTTP/Docker免费可配置鉴权和观测;服务器、存储、证书、备份与告警自付
作者公共端点免费试用无安装,但没有公开 SLA、容量和支持承诺
SQLite 元数据镜像免费功能初次顺序收割 README 估算约 4.4 小时;磁盘、刷新与完整性检查自理

Apache-2.0 只覆盖 server 代码。arXiv 元数据为 CC0,但论文全文由作者对每个版本选择许可,可能是 CC BY、其他 Creative Commons 或 arXiv 非独占发布许可。免费访问不代表可以任意再分发、训练或商业利用,使用正文前必须检查具体论文版本的 license。

国内访问与使用体验

needsVPN: false 只表示项目代码与基础入口通常可直接尝试,不保证 arXiv、ar5iv、npm 或公共 MCP 端点在任意地区、运营商和时段都有稳定速度。公共端点是作者提供的便利实例,不应从“当前能连接”推导出 SLA。生产系统应自托管,设置健康检查、请求超时、错误率和上游 429 告警,并保留直接打开 arXiv 页面的人工作业路径。

arxiv_read_paper 读取 HTML,不下载和解析 PDF。原生 HTML 不可用时会尝试 ar5iv;仍不可用就可能无法提供正文。即使 HTML 可读,公式、复杂表格、图片和附录也可能与 PDF 表现不同。处理医学、金融或安全论文时尤其需要打开原 PDF 和后续正式出版版本核对,不应把预印本或模型摘要当作专业结论。

优点

  • v1.2.15 有 npm 可验证发布,版本、运行时要求和 Apache-2.0 许可清晰。
  • 4 个工具与 2 个资源职责集中,查询参数和错误边界比“大而全”服务器更易审计。
  • stdio 与 Streamable HTTP 共用代码,可从个人客户端平滑迁移到自托管服务。
  • 默认 3 秒请求队列、退避与 Retry-After 支持尊重 arXiv API 规则。
  • 可选 SQLite + FTS5 镜像能降低重复搜索和元数据查询的在线依赖。
  • 原生 HTML 到 ar5iv 的回退比只返回 PDF URL 更便于 LLM 阅读。

不足

  • 公共端点没有公开 SLA、容量、隐私或支持承诺,不适合作为唯一生产基础设施。
  • 只提供 4 个工具,不含引用图谱、标准参考文献导出、同行评审状态判断或跨库去重。
  • arxiv_read_paper 只处理 HTML;PDF-only 论文、扫描内容、图表与复杂公式可能无法可靠读取。
  • 本地镜像只解决搜索和元数据,初始收割耗时且需要磁盘、刷新、备份和完整性检查。
  • 镜像 FTS5 BM25 与 arXiv 在线相关性排序不同,最近论文还可能存在刷新时间差。
  • Node 24 或 Bun 1.3 的运行时门槛高于一些旧环境,升级需做 MCP 客户端兼容测试。
  • 论文内容可能提示注入;代码许可、元数据许可和全文许可不能混为一谈。

替代品对比

工具更适合的场景主要取舍
ArXiv ScoutPDF 提取和 Semantic Scholar 引用探索0.1.0 观察期项目,打包与托管成熟度较低
ArXiv MCP Server(blazickjp)大社区、本地论文管理和 Python 工作流工具命名、存储和部署方式不同
Paper SearcharXiv 之外的多学术来源检索上游和配置更多,故障面更大
cyanheads OpenAlex MCP Server跨 works、authors、institutions 的学术图谱以元数据为主,不读取论文正文
cyanheads PubMed MCP Server生物医学检索、MeSH 和开放全文链学科范围更窄且受 NCBI 等上游约束
Consensus无需部署的证据型网页搜索商业托管产品,控制与复现路径不同

常见问题 FAQ

cyanheads arXiv MCP Server 当前版本是什么?

截至 2026-07-21,npm 可核验版本是 @cyanheads/[email protected]。生产配置建议固定该版本并在升级前检查 changelog 与工具 schema。

公共端点可以直接用于生产吗?

不建议直接依赖。仓库提供 https://arxiv.caseyjhand.com/mcp 方便试用,但没有公开 SLA、容量、支持响应或数据保留承诺。关键流程应自托管并监控。

它能读取所有 arXiv PDF 吗?

不能。arxiv_read_paper 读取 arXiv 原生 HTML并回退 ar5iv,不是 PDF 提取器。没有 HTML 的论文、扫描页和复杂版式可能只能回到原 PDF 人工阅读。

如何遵守 arXiv API 限速?

保留默认 3000ms 间隔,缓存重复结果,对 429 和临时错误退避。大结果集应缩小查询或用 OAI-PMH,而不是提高 MCP 并发。

本地镜像是否包含论文全文?

不包含。镜像存储 OAI-PMH 元数据并用 SQLite + FTS5 搜索,arxiv_read_paper 仍访问在线内容源。它优化元数据吞吐,不是全文仓库。

Apache-2.0 是否意味着论文也可自由商用?

不是。Apache-2.0 适用于服务器代码,元数据是 CC0,全文许可则逐论文、逐版本决定。再分发、训练和商业使用前必须检查论文自己的许可。

总结

cyanheads arXiv MCP Server v1.2.15 是一个边界清晰的 arXiv MCP:4 工具、2 资源、双传输、合规限速和可选元数据镜像,适合技术用户搭建可控的论文发现与 HTML 阅读流程。它不能替代引文管理、PDF 解析或同行评审,也不为公共端点提供 SLA。自托管时应固定版本、保留 3 秒请求间隔、防范不可信论文内容,并逐条核对引用和全文许可。

最后更新:2026年7月21日

同类工具推荐