mcp-server智能爬虫分析器
弥合网络爬虫与人工智能语言模型之间的差距。借助mcp-server-webcrawl,您的AI客户端可以在您的指导下或自主地过滤和分析网页内容,从您的网页内容中提取见解。 支持WARC、wget、InterroBot、Katana和SiteOne爬虫。
服务介绍
mcp-server-webcrawl
使用模型上下文协议(MCP)来弥合您的网络爬虫与AI语言模型之间的差距。
通过 mcp-server-webcrawl,您的AI客户端可以在您的指导下或自主地过滤和分析网页内容。该服务器包括一个支持布尔运算的全文搜索界面、按类型、HTTP状态等筛选资源的功能。
mcp-server-webcrawl 为LLM提供了一个完整的菜单以搜索您的网页内容,并且兼容多种网络爬虫:
mcp-server-webcrawl 是免费且开源的,需要Claude Desktop和Python (>=3.10)。它可以通过命令行安装,使用pip安装:
pip install mcp-server-webcrawl
特性
- 支持Claude Desktop
- 支持全文搜索
- 按类型、状态等进行筛选
- 兼容多种爬虫
- 快速MCP配置
- 即将支持ChatGPT
MCP 配置
从Claude Desktop菜单中,导航至文件 > 设置 > 开发者。点击编辑配置以找到配置文件,用您选择的编辑器打开并修改示例以反映您的datasrc路径。
您可以根据需要在mcpServers下设置更多的mcp-server-webcrawl连接。
{
"mcpServers": {
"webcrawl": {
"command": "mcp-server-webcrawl",
"args": [varies by crawler, see below]
}
}
}
对macOS用户的重要提示
在macOS上,您必须在command字段中使用mcp-server-webcrawl可执行文件的绝对路径,而不仅仅是命令名称。这与Windows配置不同。
例如:
"command": "/Users/yourusername/.local/bin/mcp-server-webcrawl",
要找到系统上mcp-server-webcrawl可执行文件的绝对路径:
- 打开终端
- 运行
which mcp-server-webcrawl - 复制返回的完整路径并在配置文件中使用
wget (使用 --mirror)
datasrc参数应设置为镜像的父目录。
"args": ["--crawler", "wget", "--datasrc", "/path/to/wget/archives/"]
WARC
datasrc参数应设置为WARC文件的父目录。
"args": ["--crawler", "warc", "--datasrc", "/path/to/warc/archives/"]
InterroBot
datasrc参数应直接设置为数据库的路径。
"args": ["--crawler", "interrobot", "--datasrc", "/path/to/Documents/InterroBot/interrobot.v2.db"]
Katana
datasrc参数应设置为文本缓存文件的父目录。
"args": ["--crawler", "katana", "--datasrc", "/path/to/katana/archives/"]
SiteOne (使用归档)
datasrc参数应设置为归档的父目录,且必须启用归档功能。
"args": ["--crawler", "siteone", "--datasrc", "/path/to/SiteOne/archives/"]