M

MCP-网页清理优化器

@jmh108/MCP-server-readability-python
0 Stars 422 次浏览 jmh108 更新于 2026-08-23

一个用Python实现的MCP服务器,它可以提取网页内容,去除广告和非必要元素,并将其转换为干净的、适用于LLM的Markdown格式。

该服务暂未提供标准配置,请参考 README 手动接入

服务介绍

MCP Server Readability Parser (Python / FastMCP)

致谢/参考

此项目基于 emzimmer 的原始 server-moz-readability 实现。(对于原始的 README 文档,请参阅 原始 README.md。)

这个 Python 实现将原始概念适应为使用 FastMCP 运行的基于 Python 的 MCP。

Mozilla Readability 解析器 MCP 服务器

这是一个 Model Context Protocol (MCP) 服务器的 Python 实现,用于从网页中提取并转换内容为干净且针对 LLM 优化的 Markdown。

目录

特性

  • 移除广告、导航、页脚和其他非必要内容
  • 将干净的 HTML 转换为格式良好的 Markdown
  • 优雅地处理错误
  • 针对 LLM 处理进行了优化
  • 轻量级且快速

为什么不只是简单获取?

与简单的获取请求不同,此服务器:

  • 使用 Readability 算法仅提取相关内容
  • 消除如广告、弹出窗口和导航菜单等噪音
  • 通过移除非必要的 HTML/CSS 减少 token 使用
  • 提供一致的 Markdown 格式以更好地进行 LLM 处理
  • 能够处理具有动态内容的复杂网页

安装

  1. 克隆仓库:
git clone https://github.com/jmh108/MCP-server-readability-python.git
cd MCP-server-readability-python
  1. 创建并激活虚拟环境:
python -m venv venv
source venv/bin/activate  # On Windows use: venv\Scripts\activate
  1. 安装依赖项:
pip install -r requirements.txt

快速开始

  1. 启动服务器:
fastmcp run server.py
  1. 示例请求:
curl -X POST http://localhost:8000/tools/extract_content \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/article"}'

工具参考

extract_content

抓取并将网页内容转换为干净的 Markdown。

参数:

{
  "url": {
    "type": "string",
    "description": "The website URL to parse",
    "required": true
  }
}

返回:

{
  "content": "Markdown content..."
}

MCP 服务器配置

要配置 MCP 服务器,请在您的 MCP 设置文件中添加以下内容:

{
  "mcpServers": {
    "readability": {
      "command": "fastmcp",
      "args": ["run", "server.py"],
      "env": {}
    }
  }
}

然后可以使用 MCP 协议启动服务器并通过 parse 工具访问。

依赖项

许可证

MIT 许可证 - 详情请见 LICENSE

相关 MCP 服务