crawl4ai
将crawl4ai封装为mcp,并且使用trafilatura对爬取内容进行了后处理
MCP 服务配置
复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用
{
"mcpServers": {
"crawl4ai": {
"args": [
"run",
"crawl4ai/server.py"
],
"command": "fastmcp"
}
}
}
服务介绍
Crawl4AI MCP
这是用于crawl4ai的MCP工具。您可以使用此工具爬取网站并获取其有用的内容。
我们的工作:
- 使用crawler.arun抓取一个URL。
- 使用trafilatura简化结果HTML,如果内容长度大于2048,则将其截断为2048。
- 如果页面中有媒体信息,构建一个字典负载以携带媒体信息。每个媒体链接将匹配一个最大长度为100的描述。
安装
pip install -r requirements.txt
crawl4ai-setup
crawl4ai-doctor
MCP配置:
{
"mcpServers": {
"crawl4ai": {
"command": "/path/to/fastmcp",
"args": [
"run",
"/path/to/crawl4ai/server.py"
]
}
}
}
您可以将此配置添加到聊天机器人或代理配置文件中以使用crawl4ai-mcp。
功能
- crawl_website: 获取网站页面内容并对内容进行简化为纯HTML内容的爬虫工具。该工具可用于获取URL中的详细信息。
- 输入:
- website(str): 网站URL。
- 输出:
-
包含网站内容的字典。
{ "text": "html内容", "media": [ { "type": "image/video/audio", "description": "一张包含西湖内部的照片。", "link": "https://xxx" }, ... ] }
-
- 输入: