c

crawl4ai

@modelscope/crawl4ai
1 Stars 813 次浏览 modelscope 更新于 2026-08-23

将crawl4ai封装为mcp,并且使用trafilatura对爬取内容进行了后处理

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "crawl4ai": {
      "args": [
        "run",
        "crawl4ai/server.py"
      ],
      "command": "fastmcp"
    }
  }
}

服务介绍

Crawl4AI MCP

这是用于crawl4ai的MCP工具。您可以使用此工具爬取网站并获取其有用的内容。

我们的工作:

  1. 使用crawler.arun抓取一个URL。
  2. 使用trafilatura简化结果HTML,如果内容长度大于2048,则将其截断为2048。
  3. 如果页面中有媒体信息,构建一个字典负载以携带媒体信息。每个媒体链接将匹配一个最大长度为100的描述。

安装

pip install -r requirements.txt
crawl4ai-setup
crawl4ai-doctor

MCP配置:

{
  "mcpServers": {
    "crawl4ai": {
      "command": "/path/to/fastmcp",
      "args": [
        "run",
        "/path/to/crawl4ai/server.py"
      ]
    }
  }
}

您可以将此配置添加到聊天机器人或代理配置文件中以使用crawl4ai-mcp。

功能

  • crawl_website: 获取网站页面内容并对内容进行简化为纯HTML内容的爬虫工具。该工具可用于获取URL中的详细信息。
    • 输入:
      • website(str): 网站URL。
      • 输出:
        • 包含网站内容的字典。

              {
                "text": "html内容",
                "media": [
                    {
                        "type": "image/video/audio",
                        "description": "一张包含西湖内部的照片。",
                        "link": "https://xxx"
                    },
                    ...
                ]
              }   
          

相关 MCP 服务