LionScraper 雄狮采集器

dowant/lionscraper-mcp
0 Stars 11 次浏览 更新于 2026-08-23

LionScraper 是一个浏览器扩展,可以从网页上收集列表、文章、链接、图片等内容。此仓库提供了三种方式的配套桥梁:MCP、CLI 和 HTTP API。

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "lionscraper": {
      "args": [
        "-m",
        "lionscraper"
      ],
      "command": "python"
    }
  }
}

该服务需要配置环境变量:DAEMON、LANG、PORT、TIMEOUT、TOKEN

服务介绍

LionScraper MCP + CLI + HTTP API 桥接

简体中文

这是什么?

LionScraper 是一个浏览器扩展,可以从网页中收集列表、文章、链接、图片等。此仓库提供了三种方式的配套桥接,将您的工具与该扩展连接起来:

  • MCP (lionscraper-mcp):连接一个AI应用(例如 Cursor),使模型可以通过标准输入输出调用抓取工具。
  • CLI (lionscraper):从终端运行守护进程抓取ping 等命令,并使用与扩展相同的本地 HTTP/WebSocket 端口。
  • HTTP API:当守护进程运行时,可以通过回环 JSON HTTP(例如 /v1/...)从脚本或任何 HTTP 客户端调用相同的功能——无需 MCP 或 CLI 前端。

实际的抓取逻辑在扩展中运行;这些包负责连接和转发。

开始前的准备

  1. 浏览器:Chrome 或 Edge(遵循扩展支持的浏览器)。
  2. LionScraper 扩展:从商店安装并启用。
  3. 运行时(选择其中一个或两个实现):
    • Node.js 18+ 用于 npm 包 — Node.js
    • Python 3.10+ 用于 PyPI 包 — Python
  4. 对于 MCP:支持 MCP 的 AI 应用(例如 Cursor, Trae)。
  5. 对于 HTTP API:与 CLI 相同的浏览器、扩展和守护进程;请参阅包的 README 文件以获取路径和示例。

没有 Chrome/Edge 的 HTTP 回退:如果在标准路径下未检测到这两种浏览器且扩展未连接,MCP 仍然会启动;pinghttp_fetch 模式下成功,scrape* 使用最小的服务器端 HTTP GET(不执行 JS)。如果浏览器已安装但扩展未连接,您仍然会得到扩展连接流程。Node 自动生成路径修复了 Unix 安装中 lionscraper.js 未以 / 开头解析的问题(例如 Glama/Docker)。Python 包使用 aiohttp 进行到守护进程的出站 HTTP/WebSocket 通信。

两种实现

Node.js (npm) Python (pip)
注册表 io.github.dowant/lionscraper-node io.github.dowant/lionscraper-python
文档 (EN) packages/node/README.md packages/python/README.md
文档 (ZH) packages/node/README_cn.md packages/python/README_cn.md

安装其中一个或两个;它们是具有相同 CLI 命令名称的独立包。

安装 (npm)

发布为 npm 上的 lionscraper

bash
npm install -g lionscraper

如果没有全局安装,MCP 可以使用 npx;请参阅 在您的 AI 应用中添加 MCP 下的 npx JSON 示例。

安装 (pip)

发布为 PyPI 上的 lionscraper

bash
pip install -U lionscraper

建议使用虚拟环境,或者如果您不想安装到系统解释器中,可以使用 pip install -U --user lionscraper

命令(两个包)

命令 角色
lionscraper-mcp 用于 AI 应用的轻量级 MCP 服务器(标准输入输出)
lionscraper CLI: daemon, stop, scrape, ping, …(在同一端口上也提供 HTTP API 服务)

pip install -U lionscraper 之后,如果 lionscraper-mcp 不在您的 PATH 中,请使用 python -m lionscraper不带额外参数进行 MCP 标准输入输出(请参阅 packages/python/README.md)。

PORT(默认 13808)在所有模式下必须与扩展的桥接端口匹配。## CLI 快速入门

bash
lionscraper daemon
lionscraper ping
lionscraper scrape -u https://www.example.com

完整的标志、多个 URL、分页和HTTP API 详情:packages/node/README.md / packages/python/README.md

在您的 AI 应用中添加 MCP

示例假设 lionscraper-mcp 已在您的 PATH 中(来自 npm 或 pip)。在 MCP JSON 中,每个 env 值都是字符串

最小配置PORT 默认为 13808;必须与扩展桥接端口匹配):

json
{
"mcpServers": {
"lionscraper": {
"command": "lionscraper-mcp"
}
}
}

完整的 env 示例(不需要的键可以省略):

json
{
"mcpServers": {
"lionscraper": {
"command": "lionscraper-mcp",
"env": {
"PORT": "13808",
"TIMEOUT": "120000",
"LANG": "en-US",
"TOKEN": "",
"DAEMON": ""
}
}
}
}

npx(无需全局安装) — 需要 Node.js;首次运行可能需要下载包。npm 包名lionscraper;可执行文件是 lionscraper-mcp。使用 command npx 并在 args 中传递 lionscraper 然后是 lionscraper-mcp(在 -y 之后)。

最小配置 (npx):

json
{
"mcpServers": {
"lionscraper": {
"command": "npx",
"args": ["-y", "lionscraper", "lionscraper-mcp"]
}
}
}

完整的 env 示例 (npx):

json
{
"mcpServers": {
"lionscraper": {
"command": "npx",
"args": ["-y", "lionscraper", "lionscraper-mcp"],
"env": {
"PORT": "13808",
"TIMEOUT": "120000",
"LANG": "en-US",
"TOKEN": "",
"DAEMON": ""
}
}
}
}

要固定版本,请在 args 中使用 "lionscraper@1.0.1" 替换 "lionscraper"

  • PORT: HTTP + WebSocket 监听端口;默认 13808;必须与扩展 桥接端口 匹配。
  • TIMEOUT: 等待前一个实例释放端口的时间(毫秒);默认 1200000 强制快速接管。
  • LANG: 工具描述和 stderr 语言(en-USzh-CN 或 POSIX 格式)。
  • TOKEN: 与守护进程共享的 Bearer 令牌;空表示无认证。
  • DAEMON: 仅 0 禁用从轻量级 MCP 自动启动 lionscraper daemon

更改配置后重启 MCP 或主机应用。

Python: 通过 python -m 使用 MCP

json
{
"mcpServers": {
"lionscraper": {
"command": "python",
"args": ["-m", "lionscraper"]
}
}
}

使用您安装包时使用的相同 python(或某些系统上的 python3)。

在浏览器扩展中匹配端口

  1. 打开 LionScraper 设置/选项
  2. 桥接端口 设置为与 PORT 相同的值(例如 13808)。
  3. 如有需要,使用 重新连接,重新加载扩展程序,或重启浏览器。

日常使用

  1. 保持扩展程序 启用 并按需打开目标页面。
  2. 用自然语言提问(例如检查连接、抓取列表/文章/电子邮件/电话/链接/图片)。
  3. 如果看到“未连接”或超时,请重试连接检查并确认 PORT 匹配。

常见问题解答

扩展程序未连接或抓取失败?

  • 扩展程序是否已启用?
  • AI 应用中的 PORT 是否与扩展程序的 桥接端口 完全匹配?
  • 通常每台机器一个桥接就足够了;重复的 MCP 配置可能会冲突。

在客户端看到 MCP 工具意味着一切正常吗?

不一定。工具只能证明 AI → 桥接;扩展程序也必须在同一端口上注册。

MCP 注册表和目录

官方 MCP 注册表条目(两者都使用 server.json):

路径 注册表名称
packages/node/server.json io.github.dowant/lionscraper-node npm: lionscraper (package.json 中的 mcpName)

发布概要(安装官方CLI,参见快速入门):

  1. 在每个server.json中指定的版本下发布npm / PyPI
  2. 在**packages/node**目录下:运行mcp-publisher login github,然后运行mcp-publisher publish
  3. 在**packages/python**目录下:运行mcp-publisher publish(复用登录信息)。

第三方列表(例如Glama)有其自己的规则;Smithery默认针对公共HTTPS/流媒体设置,而不是本地stdio + npm/pip。

第三方目录 (Glama)

该项目在Glama上列出(例如LionScraper on Glama)。如果页面显示无法安装找不到许可证,常见的解决方法是:添加根目录下的**LICENSE文件(此仓库包含LICENSE),添加带有维护者GitHub用户名glama.json文件(对于组织拥有的仓库,glama.json—如果声明失败,请编辑maintainers),在Glama上声明该服务器,并可选地完成Glama的Docker / 发布流程,如果你需要他们的安装和安全/质量检查—官方安装方式仍然是npm install -g lionscraper** 和 pip install -U lionscraper。另请参阅评分/检查清单页面

许可证

MIT(与npm和PyPI包相同)。

相关 MCP 服务