moz可读性提取器
提取并转换网页内容为干净的、适用于大型语言模型的 Markdown 格式。返回文章标题、主要内容、摘要、作者信息和网站名称。使用 Mozilla 的可读性算法去除广告、导航栏、页脚和非必要元素,同时保留核心内容结构。
MCP 服务配置
复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用
{
"mcpServers": {
"readability": {
"args": [
"-y",
"server-moz-readability"
],
"command": "npx"
}
}
}
服务介绍
Mozilla Readability Parser MCP 服务器
一个 模型上下文协议 (MCP) 服务器,用于提取并转换网页内容为干净的、针对大语言模型优化的 Markdown 格式。返回文章标题、主要内容、摘要、作者署名和站点名称。使用 Mozilla 的 Readability 算法 去除广告、导航、页脚和其他非必要元素,同时保留核心内容结构。更多关于 MCP 的信息。
功能
- 移除广告、导航、页脚以及其他非必需内容
- 将干净的 HTML 转换为格式良好的 Markdown(也使用 Turndown)
- 返回文章元数据(标题、摘要、作者署名、站点名称)
- 优雅地处理错误
为什么不只是简单抓取?
与简单的抓取请求相比,该服务器:
- 使用 Mozilla 的 Readability 算法仅提取相关内容
- 消除如广告、弹出窗口和导航菜单等干扰因素
- 通过移除非必要的 HTML/CSS 减少令牌使用
- 提供一致的 Markdown 格式以更好地支持大语言模型处理
- 包含有关内容的有用元数据
安装
通过 Smithery 安装
要通过 Smithery 自动安装适用于 Claude Desktop 的 Mozilla Readability 解析器:
npx -y @smithery/cli install server-moz-readability --client claude
手动安装
npm install server-moz-readability
工具参考
parse
获取并转换网页内容为干净的 Markdown。
参数:
{
"url": {
"type": "string",
"description": "The website URL to parse",
"required": true
}
}
返回值:
{
"title": "Article title",
"content": "Markdown content...",
"metadata": {
"excerpt": "Brief summary",
"byline": "Author information",
"siteName": "Source website name"
}
}
与 Claude Desktop 一起使用
在你的 claude_desktop_config.json 中添加:
{
"mcpServers": {
"readability": {
"command": "npx",
"args": ["-y", "server-moz-readability"]
}
}
}
依赖项
- @mozilla/readability - 内容提取
- turndown - HTML 到 Markdown 的转换
- jsdom - DOM 解析
- axios - HTTP 请求
许可证
MIT