Firecrawl智能内容搜索服务器
使用Firecrawl API提供网络爬虫和智能内容搜索功能的服务器,使人工智能代理能够从网站提取结构化数据并进行内容搜索。
MCP 服务配置
复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用
{
"mcpServers": {
"firecrawl": {
"command": "mcp-server-firecrawl",
"env": {
"FIRECRAWL_API_KEY": "your-api-key"
}
}
}
}
该服务需要配置环境变量:FIRECRAWL_API_KEY
服务介绍
Firecrawl MCP 服务器
一个用于网页抓取、内容搜索、站点爬取和数据提取的 Model Context Protocol (MCP) 服务器,使用 Firecrawl API。
功能
-
网页抓取:从任何网页中提取内容,并提供可自定义选项
- 移动设备模拟
- 广告和弹出窗口拦截
- 内容过滤
- 结构化数据提取
- 多种输出格式
-
内容搜索:智能搜索功能
- 多语言支持
- 基于位置的结果
- 可定制的结果限制
- 结构化的输出格式
-
站点爬取:高级的网页爬取功能
- 深度控制
- 路径过滤
- 速率限制
- 进度跟踪
- 站点地图集成
-
站点映射:生成站点结构图
- 子域名支持
- 搜索过滤
- 链接分析
- 可视化层次结构
-
数据提取:从多个 URL 中提取结构化数据
- 模式验证
- 批处理
- 网络搜索增强
- 自定义提取提示
安装
# Global installation
npm install -g @modelcontextprotocol/mcp-server-firecrawl
# Local project installation
npm install @modelcontextprotocol/mcp-server-firecrawl
快速开始
-
从 开发者门户 获取您的 Firecrawl API 密钥
-
设置您的 API 密钥:
Unix/Linux/macOS (bash/zsh):
export FIRECRAWL_API_KEY=your-api-keyWindows (命令提示符):
set FIRECRAWL_API_KEY=your-api-keyWindows (PowerShell):
$env:FIRECRAWL_API_KEY = "your-api-key"备选方案:使用 .env 文件(推荐用于开发):
# 安装 dotenv npm install dotenv # 创建 .env 文件 echo "FIRECRAWL_API_KEY=your-api-key" > .env然后在代码中:
import dotenv from 'dotenv'; dotenv.config(); -
运行服务器:
mcp-server-firecrawl
集成
Claude 桌面应用程序
添加到您的 MCP 设置中:
{
"firecrawl": {
"command": "mcp-server-firecrawl",
"env": {
"FIRECRAWL_API_KEY": "your-api-key"
}
}
}
Claude VSCode 扩展
添加到您的 MCP 配置中:
{
"mcpServers": {
"firecrawl": {
"command": "mcp-server-firecrawl",
"env": {
"FIRECRAWL_API_KEY": "your-api-key"
}
}
}
}
使用示例
网页抓取
// Basic scraping
{
name: "scrape_url",
arguments: {
url: "https://example.com",
formats: ["markdown"],
onlyMainContent: true
}
}
// Advanced extraction
{
name: "scrape_url",
arguments: {
url: "https://example.com/blog",
jsonOptions: {
prompt: "Extract article content",
schema: {
title: "string",
content: "string"
}
},
mobile: true,
blockAds: true
}
}
站点爬取
// Basic crawling
{
name: "crawl",
arguments: {
url: "https://example.com",
maxDepth: 2,
limit: 100
}
}
// Advanced crawling
{
name: "crawl",
arguments: {
url: "https://example.com",
maxDepth: 3,
includePaths: ["/blog", "/products"],
excludePaths: ["/admin"],
ignoreQueryParameters: true
}
}
站点映射
// Generate site map
{
name: "map",
arguments: {
url: "https://example.com",
includeSubdomains: true,
limit: 1000
}
}
数据提取
// Extract structured data
{
name: "extract",
arguments: {
urls: ["https://example.com/product1", "https://example.com/product2"],
prompt: "Extract product details",
schema: {
name: "string",
price: "number",
description: "string"
}
}
}
配置
请参阅 配置指南 以获取详细的设置选项。
API 文档
请参阅 API 文档 以获取详细的端点规格。
开发
# Install dependencies
npm install
# Build
npm run build
# Run tests
npm test
# Start in development mode
npm run dev
示例
查看 示例 目录以获取更多使用示例:
- 基本抓取: scrape.ts
- 爬取与映射: crawl-and-map.ts
错误处理
服务器实现了强大的错误处理机制:
- 采用指数退避算法进行速率限制
- 自动重试
- 详细的错误信息
- 调试日志
安全性
- API 密钥保护
- 请求验证
- 域名白名单
- 速率限制
- 安全的错误消息
贡献
请参阅CONTRIBUTING.md了解贡献指南。
许可证
MIT许可证 - 详情请见LICENSE。