PaddleOCR MCP 服务器
MCP 服务配置
复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用
{
"mcpServers": {
"paddleocr-ocr": {
"args": [
"--from",
"paddleocr-mcp",
"paddleocr_mcp"
],
"command": "uvx",
"env": {
"PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKEN": "\u003c星河社区访问令牌\u003e",
"PADDLEOCR_MCP_PIPELINE": "\u003c产线名称\u003e",
"PADDLEOCR_MCP_PPOCR_SOURCE": "aistudio",
"PADDLEOCR_MCP_SERVER_URL": "\u003c星河社区访问令牌\u003e"
}
}
}
}
该服务需要配置环境变量:PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKEN、PADDLEOCR_MCP_PIPELINE、PADDLEOCR_MCP_PPOCR_SOURCE、PADDLEOCR_MCP_SERVER_URL
可用工具 (1 个)
该服务在 MCP 协议中暴露的工具,AI 可按需调用
paddleocr_vl 4 个参数 需填 1 项
Extracts structured markdown from complex documents (images/PDFs) using a VLM-based approach. The extracted elements include tables, formulas, etc. Accepts file path, URL, or Base64. Args: input_data: The file to process (file path, URL, or Base64 string). output_mode: The desired output format. - "simple": (Default) Clean, readable markdown with embedded images. Best for most use cases. - "detailed": JSON data about document structure, plus markdown. Only use this when coordinates are specifically required. file_type: File type. This parameter is REQUIRED when `input_data` is a URL and should be omitted for other types. - "image": For image files - "pdf": For PDF documents - None: For unknown file types return_images: Whether to return the images extracted from the document.
必填参数:input_data
服务介绍
PaddleOCR MCP服务器
概述
PaddleOCR MCP服务器为AI应用提供工业级OCR和文档解析能力。基于PaddleOCR——一个经过5万+GitHub star验证,被MinerU、RAGFlow、OmniParser等头部项目深度集成的成熟解决方案,并基于MCP理念做了针对性的优化。
- 官方文档:https://paddlepaddle.github.io/PaddleOCR/latest/version3.x/deployment/mcp_server.html
- PaddleOCR GitHub仓库:https://github.com/PaddlePaddle/PaddleOCR
- PaddleOCR产线功能在线体验:
-
ModelScope 魔搭社区
核心功能
文字识别(基于PP-OCRv5)
- 多语言支持:支持中英日韩等37种语言,支持印刷体、手写体识别
- 高精度识别:识别精度达到开源方案领先水平
- 结构化输出:返回包含文字坐标和内容的JSON数据
文档解析(基于PP-StructureV3) & 大模型文档解析(基于PaddleOCR-VL)
- 版面智能分析:识别文本块、标题、段落、图片、表格等版面元素
- 结构化转换:将PDF和图像转换为保留原始结构的Markdown格式
- 复杂文档处理:处理含有复杂表格、公式、手写文字的文档
MCP优化
-
智能输出模式:
simple模式包含识别到的文本/Markdown内容等关键信息detailed模式包含边界框坐标等详细信息
-
PP-OCRv5:两种输出模式均包含置信度和统计信息,帮助agent评估结果质量
-
PP-StructureV3和PaddleOCR-VL:两种输出模式均支持图文混合输出,保留图片原始位置信息
部署模式
工作模式
- 本地Python库:直接在本地运行PaddleOCR模型
- PaddleOCR官网服务:调用PaddleOCR官网提供的云服务
- 自托管服务:连接自托管的PaddleOCR服务
传输机制
- stdio:适用于本地集成的标准输入输出模式
- Streamable HTTP:支持远程调用的可流式HTTP传输
在ModelScope上部署远程服务
-
在PaddleOCR官网点击左上角的“API”,在希望使用的功能对应的代码调用示例中复制服务基础URL(
API_URL去除/ocr等端点后缀)与访问令牌(TOKEN)。 -
在本页面右侧配置
PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKEN和PADDLEOCR_MCP_SERVER_URL,分别设置为上一步骤获取到的访问令牌与服务基础URL。将PADDLEOCR_MCP_PIPELINE设置为产线名称(OCR、PP-StructureV3或PaddleOCR-VL):功能 PADDLEOCR_MCP_PIPELINE文字识别(PP-OCRv5) OCR文档解析(PP-StructureV3) PP-StructureV3大模型文档解析(PaddleOCR-VL) PaddleOCR-VL -
点击“连接”,启动服务,之后可在Claude for Desktop、Cherry Studio等MCP host中使用。
典型应用场景
文档数字化
- 提取手写笔记的内容,并存储到笔记软件中
- 将图片/PDF文档转换为可用Word/Excel编辑的格式
开发工作流
- 手写思路/伪代码转换为可运行脚本
- 将文档图片快速转换为Markdown格式的项目文档
技术优势
- 成熟稳定:经过大量生产环境验证的工业级OCR方案
- 精度领先:OCR、文档解析等在公开评测中超越众多商业方案
- 易于集成:部署步骤简单,几分钟完成集成
- 成本可控:支持本地部署,避免数据外传和API调用费用
开始使用PaddleOCR MCP服务器,让您的AI应用具备工业级文档理解能力。