m

mcp-server智能爬虫分析器

@pragmar/mcp_server_webcrawl
2 Stars 1.1k 次浏览 pragmar 更新于 2026-08-23

弥合网络爬虫与人工智能语言模型之间的差距。借助mcp-server-webcrawl,您的AI客户端可以在您的指导下或自主地过滤和分析网页内容,从您的网页内容中提取见解。 支持WARC、wget、InterroBot、Katana和SiteOne爬虫。

该服务暂未提供标准配置,请参考 README 手动接入

服务介绍

mcp-server-webcrawl

使用模型上下文协议(MCP)来弥合您的网络爬虫与AI语言模型之间的差距。
通过 mcp-server-webcrawl,您的AI客户端可以在您的指导下或自主地过滤和分析网页内容。该服务器包括一个支持布尔运算的全文搜索界面、按类型、HTTP状态等筛选资源的功能。

mcp-server-webcrawl 为LLM提供了一个完整的菜单以搜索您的网页内容,并且兼容多种网络爬虫:

mcp-server-webcrawl 是免费且开源的,需要Claude Desktop和Python (>=3.10)。它可以通过命令行安装,使用pip安装:

pip install mcp-server-webcrawl

特性

  • 支持Claude Desktop
  • 支持全文搜索
  • 按类型、状态等进行筛选
  • 兼容多种爬虫
  • 快速MCP配置
  • 即将支持ChatGPT

MCP 配置

从Claude Desktop菜单中,导航至文件 > 设置 > 开发者。点击编辑配置以找到配置文件,用您选择的编辑器打开并修改示例以反映您的datasrc路径。

您可以根据需要在mcpServers下设置更多的mcp-server-webcrawl连接。

{ 
  "mcpServers": {
    "webcrawl": {
      "command": "mcp-server-webcrawl",
       "args": [varies by crawler, see below]
    }
  }
}

对macOS用户的重要提示

在macOS上,您必须在command字段中使用mcp-server-webcrawl可执行文件的绝对路径,而不仅仅是命令名称。这与Windows配置不同。

例如:

"command": "/Users/yourusername/.local/bin/mcp-server-webcrawl",

要找到系统上mcp-server-webcrawl可执行文件的绝对路径:

  1. 打开终端
  2. 运行 which mcp-server-webcrawl
  3. 复制返回的完整路径并在配置文件中使用

wget (使用 --mirror)

datasrc参数应设置为镜像的父目录。

"args": ["--crawler", "wget", "--datasrc", "/path/to/wget/archives/"]

WARC

datasrc参数应设置为WARC文件的父目录。

"args": ["--crawler", "warc", "--datasrc", "/path/to/warc/archives/"]

InterroBot

datasrc参数应直接设置为数据库的路径。

"args": ["--crawler", "interrobot", "--datasrc", "/path/to/Documents/InterroBot/interrobot.v2.db"]

Katana

datasrc参数应设置为文本缓存文件的父目录。

"args": ["--crawler", "katana", "--datasrc", "/path/to/katana/archives/"]

SiteOne (使用归档)

datasrc参数应设置为归档的父目录,且必须启用归档功能。

"args": ["--crawler", "siteone", "--datasrc", "/path/to/SiteOne/archives/"]

相关 MCP 服务