m

mcp文档抓取器

@askjohngeorge/mcp-doc-scraper
0 Stars 409 次浏览 askjohngeorge 更新于 2026-08-23

使用 jina.ai 的转换服务将基于网页的文档转换为 markdown 格式,允许用户从任何 URL 抓取文档并将其保存为 markdown 文件。

该服务暂未提供标准配置,请参考 README 手动接入

服务介绍

Doc Scraper MCP 服务器

smithery 徽章

这是一个提供文档抓取功能的模型上下文协议(MCP)服务器。该服务器使用 jina.ai 的转换服务将基于网页的文档转换为 markdown 格式。

功能

  • 从任何网页 URL 抓取文档
  • 将 HTML 文档转换为 markdown 格式
  • 将转换后的文档保存到指定的输出路径
  • 与模型上下文协议(MCP)集成

安装

通过 Smithery 安装

要通过 Smithery 自动安装适用于 Claude Desktop 的 Doc Scraper:

npx -y @smithery/cli install @askjohngeorge/mcp-doc-scraper --client claude
  1. 克隆仓库:
git clone https://github.com/askjohngeorge/mcp-doc-scraper.git
cd mcp-doc-scraper
  1. 创建并激活虚拟环境:
python -m venv venv
source venv/bin/activate  # On Windows, use: venv\Scripts\activate
  1. 安装依赖项:
pip install -e .

使用

可以使用 Python 运行服务器:

python -m mcp_doc_scraper

工具描述

服务器提供了一个工具:

  • 名称scrape_docs
  • 描述:从 URL 抓取文档并保存为 markdown
  • 输入参数
    • url:要抓取的文档的 URL
    • output_path:应保存 markdown 文件的路径

项目结构

doc_scraper/
├── __init__.py
├── __main__.py
└── server.py

依赖项

  • aiohttp
  • mcp
  • pydantic

开发

要设置开发环境:

  1. 安装开发依赖项:
pip install -r requirements.txt
  1. 服务器使用模型上下文协议。请确保熟悉 MCP 文档

许可证

MIT 许可证

相关 MCP 服务