m

moz可读性提取器

@emzimmer/server-moz-readability
0 Stars 376 次浏览 emzimmer 更新于 2026-08-23

提取并转换网页内容为干净的、适用于大型语言模型的 Markdown 格式。返回文章标题、主要内容、摘要、作者信息和网站名称。使用 Mozilla 的可读性算法去除广告、导航栏、页脚和非必要元素,同时保留核心内容结构。

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "readability": {
      "args": [
        "-y",
        "server-moz-readability"
      ],
      "command": "npx"
    }
  }
}

服务介绍

Mozilla Readability Parser MCP 服务器

一个 模型上下文协议 (MCP) 服务器,用于提取并转换网页内容为干净的、针对大语言模型优化的 Markdown 格式。返回文章标题、主要内容、摘要、作者署名和站点名称。使用 Mozilla 的 Readability 算法 去除广告、导航、页脚和其他非必要元素,同时保留核心内容结构。更多关于 MCP 的信息

功能

  • 移除广告、导航、页脚以及其他非必需内容
  • 将干净的 HTML 转换为格式良好的 Markdown(也使用 Turndown)
  • 返回文章元数据(标题、摘要、作者署名、站点名称)
  • 优雅地处理错误

为什么不只是简单抓取?

与简单的抓取请求相比,该服务器:

  • 使用 Mozilla 的 Readability 算法仅提取相关内容
  • 消除如广告、弹出窗口和导航菜单等干扰因素
  • 通过移除非必要的 HTML/CSS 减少令牌使用
  • 提供一致的 Markdown 格式以更好地支持大语言模型处理
  • 包含有关内容的有用元数据

安装

通过 Smithery 安装

要通过 Smithery 自动安装适用于 Claude Desktop 的 Mozilla Readability 解析器:

npx -y @smithery/cli install server-moz-readability --client claude

手动安装

npm install server-moz-readability

工具参考

parse

获取并转换网页内容为干净的 Markdown。

参数:

{
  "url": {
    "type": "string",
    "description": "The website URL to parse",
    "required": true
  }
}

返回值:

{
  "title": "Article title",
  "content": "Markdown content...",
  "metadata": {
    "excerpt": "Brief summary",
    "byline": "Author information",
    "siteName": "Source website name"
  }
}

与 Claude Desktop 一起使用

在你的 claude_desktop_config.json 中添加:

{
  "mcpServers": {
    "readability": {
      "command": "npx",
      "args": ["-y", "server-moz-readability"]
    }
  }
}

依赖项

  • @mozilla/readability - 内容提取
  • turndown - HTML 到 Markdown 的转换
  • jsdom - DOM 解析
  • axios - HTTP 请求

许可证

MIT

相关 MCP 服务