M

MichaelLevinson

@MichaelLevinson/mcp_pdf_processor
0 Stars 361 次浏览 MichaelLevinson 更新于 2026-08-23
该服务暂未提供标准配置,请参考 README 手动接入

服务介绍

PDF 处理器 MCP 服务器

一个用于处理 PDF 文档的模型上下文协议(MCP)服务器,具有高级功能,包括 LaTeX 公式提取。该服务器使 Claude 能够获取、处理并从 PDF 文档中提取信息,包括 LaTeX 数学公式。

功能

  • 从 URL 获取 PDF
  • 从 PDF 中提取文本
  • 识别和提取 LaTeX 公式
  • 通过 MCP 与 Claude 集成

安装

标准安装

bash
pip install -e .

为 Claude Desktop/Claude Code 安装

要将此 MCP 服务器与 Claude Desktop 或 Claude Code 一起使用:

  1. 如果尚未安装 MCP CLI 工具,请先安装:
    bash
    pip install "mcp[cli]"

  2. 使用 MCP CLI 工具安装服务器:
    bash
    mcp install /path/to/pdf_tool_server.py --with-editable /path/to/mcp_pdf_processor

    例如,如果您已将此仓库克隆到 ~/mcp_pdf_processor
    bash
    mcp install ~/mcp_pdf_processor/pdf_tool_server.py --with-editable ~/mcp_pdf_processor

  3. 使用 MCP Inspector 进行开发:
    bash
    mcp dev /path/to/pdf_tool_server.py --with-editable /path/to/mcp_pdf_processor

  4. 在 Claude Desktop 中,您现在可以使用以下命令在对话中使用 PDF_TOOLS 服务器:

    /mcp PDF_TOOLS fetch_pdf url=https://example.com/document.pdf
    /mcp PDF_TOOLS process_pdf hash_id=<HASH_ID> extract_latex=true
    /mcp PDF_TOOLS read_processed_pdf filename=

使用

独立运行

bash
python pdf_tool_server.py

环境变量

  • OUTPUT_DIR: 存储处理后的 PDF 的目录(默认:llm_output
  • PYTHONPATH: 设置为包含 mcp_pdf_processor 包的目录

与 Claude 一起使用

当服务器注册后,您可以要求 Claude 执行以下操作:

  • "获取并分析 [URL] 上的 PDF"
  • "从 [URL] 上的 PDF 提取 LaTeX 公式"
  • "总结 [URL] 上 PDF 的内容"

依赖项

服务器需要以下主要依赖项:

  • Python 3.9 或更高版本
  • pymupdf: PDF 处理和文本提取
  • mcp: 模型上下文协议支持
  • pydantic: 数据验证和序列化
  • aiohttp: 异步 HTTP 客户端/服务器
  • torch: 用于 LaTeX 公式提取(可选)
  • pix2tex: 用于 LaTeX 公式识别(可选)

请参阅 pyproject.toml 以获取完整的依赖项列表及版本要求。

使用示例

这是一个使用 PDF 处理器与 Claude Desktop 的完整工作流示例:

1. 获取 PDF 但不读取它

/mcp PDF_TOOLS fetch_pdf url=https://arxiv.org/pdf/2505.05522

这将返回一个 hash_id,您将在下一步中使用它

2. 处理 PDF 并提取 LaTeX

/mcp PDF_TOOLS process_pdf hash_id=<HASH_ID> extract_latex=true

这将返回处理后的输出文件名

3. 读取处理后的内容

/mcp PDF_TOOLS read_processed_pdf filename=

现在 Claude 可以分析 PDF 内容,包括任何 LaTeX 公式

许可证

MIT

相关 MCP 服务