mcp文档抓取器
使用 jina.ai 的转换服务将基于网页的文档转换为 markdown 格式,允许用户从任何 URL 抓取文档并将其保存为 markdown 文件。
服务介绍
Doc Scraper MCP 服务器
这是一个提供文档抓取功能的模型上下文协议(MCP)服务器。该服务器使用 jina.ai 的转换服务将基于网页的文档转换为 markdown 格式。
功能
- 从任何网页 URL 抓取文档
- 将 HTML 文档转换为 markdown 格式
- 将转换后的文档保存到指定的输出路径
- 与模型上下文协议(MCP)集成
安装
通过 Smithery 安装
要通过 Smithery 自动安装适用于 Claude Desktop 的 Doc Scraper:
npx -y @smithery/cli install @askjohngeorge/mcp-doc-scraper --client claude
- 克隆仓库:
git clone https://github.com/askjohngeorge/mcp-doc-scraper.git
cd mcp-doc-scraper
- 创建并激活虚拟环境:
python -m venv venv
source venv/bin/activate # On Windows, use: venv\Scripts\activate
- 安装依赖项:
pip install -e .
使用
可以使用 Python 运行服务器:
python -m mcp_doc_scraper
工具描述
服务器提供了一个工具:
- 名称:
scrape_docs - 描述:从 URL 抓取文档并保存为 markdown
- 输入参数:
url:要抓取的文档的 URLoutput_path:应保存 markdown 文件的路径
项目结构
doc_scraper/
├── __init__.py
├── __main__.py
└── server.py
依赖项
- aiohttp
- mcp
- pydantic
开发
要设置开发环境:
- 安装开发依赖项:
pip install -r requirements.txt
- 服务器使用模型上下文协议。请确保熟悉 MCP 文档。
许可证
MIT 许可证