PaddleOCR MCP 服务器

PaddlePaddle/PaddleOCR
Hosted
6 Stars 3.4k 次浏览 更新于 2026-08-23

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "paddleocr-ocr": {
      "args": [
        "--from",
        "paddleocr-mcp",
        "paddleocr_mcp"
      ],
      "command": "uvx",
      "env": {
        "PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKEN": "\u003c星河社区访问令牌\u003e",
        "PADDLEOCR_MCP_PIPELINE": "\u003c产线名称\u003e",
        "PADDLEOCR_MCP_PPOCR_SOURCE": "aistudio",
        "PADDLEOCR_MCP_SERVER_URL": "\u003c星河社区访问令牌\u003e"
      }
    }
  }
}

该服务需要配置环境变量:PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKEN、PADDLEOCR_MCP_PIPELINE、PADDLEOCR_MCP_PPOCR_SOURCE、PADDLEOCR_MCP_SERVER_URL

可用工具 (1 个)

该服务在 MCP 协议中暴露的工具,AI 可按需调用

paddleocr_vl 4 个参数 需填 1 项

Extracts structured markdown from complex documents (images/PDFs) using a VLM-based approach. The extracted elements include tables, formulas, etc. Accepts file path, URL, or Base64. Args: input_data: The file to process (file path, URL, or Base64 string). output_mode: The desired output format. - "simple": (Default) Clean, readable markdown with embedded images. Best for most use cases. - "detailed": JSON data about document structure, plus markdown. Only use this when coordinates are specifically required. file_type: File type. This parameter is REQUIRED when `input_data` is a URL and should be omitted for other types. - "image": For image files - "pdf": For PDF documents - None: For unknown file types return_images: Whether to return the images extracted from the document.

必填参数:input_data

服务介绍

PaddleOCR MCP服务器

概述

PaddleOCR MCP服务器为AI应用提供工业级OCR和文档解析能力。基于PaddleOCR——一个经过5万+GitHub star验证,被MinerU、RAGFlow、OmniParser等头部项目深度集成的成熟解决方案,并基于MCP理念做了针对性的优化。

核心功能

文字识别(基于PP-OCRv5)

  • 多语言支持:支持中英日韩等37种语言,支持印刷体、手写体识别
  • 高精度识别:识别精度达到开源方案领先水平
  • 结构化输出:返回包含文字坐标和内容的JSON数据

文档解析(基于PP-StructureV3) & 大模型文档解析(基于PaddleOCR-VL)

  • 版面智能分析:识别文本块、标题、段落、图片、表格等版面元素
  • 结构化转换:将PDF和图像转换为保留原始结构的Markdown格式
  • 复杂文档处理:处理含有复杂表格、公式、手写文字的文档

MCP优化

  • 智能输出模式

    • simple模式包含识别到的文本/Markdown内容等关键信息
    • detailed模式包含边界框坐标等详细信息
  • PP-OCRv5:两种输出模式均包含置信度和统计信息,帮助agent评估结果质量

  • PP-StructureV3和PaddleOCR-VL:两种输出模式均支持图文混合输出,保留图片原始位置信息

部署模式

工作模式

  • 本地Python库:直接在本地运行PaddleOCR模型
  • PaddleOCR官网服务:调用PaddleOCR官网提供的云服务
  • 自托管服务:连接自托管的PaddleOCR服务

传输机制

  • stdio:适用于本地集成的标准输入输出模式
  • Streamable HTTP:支持远程调用的可流式HTTP传输

在ModelScope上部署远程服务

  1. PaddleOCR官网点击左上角的“API”,在希望使用的功能对应的代码调用示例中复制服务基础URL(API_URL去除/ocr等端点后缀)与访问令牌(TOKEN)。

  2. 在本页面右侧配置PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKENPADDLEOCR_MCP_SERVER_URL,分别设置为上一步骤获取到的访问令牌与服务基础URL。将PADDLEOCR_MCP_PIPELINE设置为产线名称(OCRPP-StructureV3PaddleOCR-VL):

    功能 PADDLEOCR_MCP_PIPELINE
    文字识别(PP-OCRv5) OCR
    文档解析(PP-StructureV3) PP-StructureV3
    大模型文档解析(PaddleOCR-VL) PaddleOCR-VL
  3. 点击“连接”,启动服务,之后可在Claude for Desktop、Cherry Studio等MCP host中使用。

典型应用场景

文档数字化

  • 提取手写笔记的内容,并存储到笔记软件中
  • 将图片/PDF文档转换为可用Word/Excel编辑的格式

开发工作流

  • 手写思路/伪代码转换为可运行脚本
  • 将文档图片快速转换为Markdown格式的项目文档

技术优势

  • 成熟稳定:经过大量生产环境验证的工业级OCR方案
  • 精度领先:OCR、文档解析等在公开评测中超越众多商业方案
  • 易于集成:部署步骤简单,几分钟完成集成
  • 成本可控:支持本地部署,避免数据外传和API调用费用

开始使用PaddleOCR MCP服务器,让您的AI应用具备工业级文档理解能力。

相关 MCP 服务