LionScraper 雄狮采集器
LionScraper 是一个浏览器扩展,可以从网页上收集列表、文章、链接、图片等内容。此仓库提供了三种方式的配套桥梁:MCP、CLI 和 HTTP API。
MCP 服务配置
复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用
{
"mcpServers": {
"lionscraper": {
"args": [
"-m",
"lionscraper"
],
"command": "python"
}
}
}
该服务需要配置环境变量:DAEMON、LANG、PORT、TIMEOUT、TOKEN
服务介绍
LionScraper MCP + CLI + HTTP API 桥接
- 网站: lionscraper.com
- npm: 包
lionscraper - PyPI: 项目
lionscraper
这是什么?
LionScraper 是一个浏览器扩展,可以从网页中收集列表、文章、链接、图片等。此仓库提供了三种方式的配套桥接,将您的工具与该扩展连接起来:
- MCP (
lionscraper-mcp):连接一个AI应用(例如 Cursor),使模型可以通过标准输入输出调用抓取工具。 - CLI (
lionscraper):从终端运行守护进程、抓取、ping 等命令,并使用与扩展相同的本地 HTTP/WebSocket 端口。 - HTTP API:当守护进程运行时,可以通过回环 JSON HTTP(例如
/v1/...)从脚本或任何 HTTP 客户端调用相同的功能——无需 MCP 或 CLI 前端。
实际的抓取逻辑在扩展中运行;这些包负责连接和转发。
开始前的准备
- 浏览器:Chrome 或 Edge(遵循扩展支持的浏览器)。
- LionScraper 扩展:从商店安装并启用。
- Chrome: Chrome Web Store — LionScraper
- Microsoft Edge: Edge Add-ons — LionScraper
- 运行时(选择其中一个或两个实现):
- 对于 MCP:支持 MCP 的 AI 应用(例如 Cursor, Trae)。
- 对于 HTTP API:与 CLI 相同的浏览器、扩展和守护进程;请参阅包的 README 文件以获取路径和示例。
没有 Chrome/Edge 的 HTTP 回退:如果在标准路径下未检测到这两种浏览器且扩展未连接,MCP 仍然会启动;ping 在 http_fetch 模式下成功,scrape* 使用最小的服务器端 HTTP GET(不执行 JS)。如果浏览器已安装但扩展未连接,您仍然会得到扩展连接流程。Node 自动生成路径修复了 Unix 安装中 lionscraper.js 未以 / 开头解析的问题(例如 Glama/Docker)。Python 包使用 aiohttp 进行到守护进程的出站 HTTP/WebSocket 通信。
两种实现
| Node.js (npm) | Python (pip) | |
|---|---|---|
| 注册表 | io.github.dowant/lionscraper-node |
io.github.dowant/lionscraper-python |
| 文档 (EN) | packages/node/README.md | packages/python/README.md |
| 文档 (ZH) | packages/node/README_cn.md | packages/python/README_cn.md |
安装其中一个或两个;它们是具有相同 CLI 命令名称的独立包。
安装 (npm)
发布为 npm 上的 lionscraper。
bash
npm install -g lionscraper
如果没有全局安装,MCP 可以使用 npx;请参阅 在您的 AI 应用中添加 MCP 下的 npx JSON 示例。
安装 (pip)
发布为 PyPI 上的 lionscraper。
bash
pip install -U lionscraper
建议使用虚拟环境,或者如果您不想安装到系统解释器中,可以使用 pip install -U --user lionscraper。
命令(两个包)
| 命令 | 角色 |
|---|---|
lionscraper-mcp |
用于 AI 应用的轻量级 MCP 服务器(标准输入输出) |
lionscraper |
CLI: daemon, stop, scrape, ping, …(在同一端口上也提供 HTTP API 服务) |
在 pip install -U lionscraper 之后,如果 lionscraper-mcp 不在您的 PATH 中,请使用 python -m lionscraper 并不带额外参数进行 MCP 标准输入输出(请参阅 packages/python/README.md)。
PORT(默认 13808)在所有模式下必须与扩展的桥接端口匹配。## CLI 快速入门
bash
lionscraper daemon
lionscraper ping
lionscraper scrape -u https://www.example.com
完整的标志、多个 URL、分页和HTTP API 详情:packages/node/README.md / packages/python/README.md。
在您的 AI 应用中添加 MCP
示例假设 lionscraper-mcp 已在您的 PATH 中(来自 npm 或 pip)。在 MCP JSON 中,每个 env 值都是字符串。
最小配置(PORT 默认为 13808;必须与扩展桥接端口匹配):
json
{
"mcpServers": {
"lionscraper": {
"command": "lionscraper-mcp"
}
}
}
完整的 env 示例(不需要的键可以省略):
json
{
"mcpServers": {
"lionscraper": {
"command": "lionscraper-mcp",
"env": {
"PORT": "13808",
"TIMEOUT": "120000",
"LANG": "en-US",
"TOKEN": "",
"DAEMON": ""
}
}
}
}
npx(无需全局安装) — 需要 Node.js;首次运行可能需要下载包。npm 包名 是 lionscraper;可执行文件是 lionscraper-mcp。使用 command npx 并在 args 中传递 lionscraper 然后是 lionscraper-mcp(在 -y 之后)。
最小配置 (npx):
json
{
"mcpServers": {
"lionscraper": {
"command": "npx",
"args": ["-y", "lionscraper", "lionscraper-mcp"]
}
}
}
完整的 env 示例 (npx):
json
{
"mcpServers": {
"lionscraper": {
"command": "npx",
"args": ["-y", "lionscraper", "lionscraper-mcp"],
"env": {
"PORT": "13808",
"TIMEOUT": "120000",
"LANG": "en-US",
"TOKEN": "",
"DAEMON": ""
}
}
}
}
要固定版本,请在 args 中使用 "lionscraper@1.0.1" 替换 "lionscraper"。
PORT: HTTP + WebSocket 监听端口;默认 13808;必须与扩展 桥接端口 匹配。TIMEOUT: 等待前一个实例释放端口的时间(毫秒);默认 120000;0强制快速接管。LANG: 工具描述和 stderr 语言(en-US、zh-CN或 POSIX 格式)。TOKEN: 与守护进程共享的 Bearer 令牌;空表示无认证。DAEMON: 仅0禁用从轻量级 MCP 自动启动lionscraper daemon。
更改配置后重启 MCP 或主机应用。
Python: 通过 python -m 使用 MCP
json
{
"mcpServers": {
"lionscraper": {
"command": "python",
"args": ["-m", "lionscraper"]
}
}
}
使用您安装包时使用的相同 python(或某些系统上的 python3)。
在浏览器扩展中匹配端口
- 打开 LionScraper 设置/选项。
- 将 桥接端口 设置为与
PORT相同的值(例如13808)。 - 如有需要,使用 重新连接,重新加载扩展程序,或重启浏览器。
日常使用
- 保持扩展程序 启用 并按需打开目标页面。
- 用自然语言提问(例如检查连接、抓取列表/文章/电子邮件/电话/链接/图片)。
- 如果看到“未连接”或超时,请重试连接检查并确认 PORT 匹配。
常见问题解答
扩展程序未连接或抓取失败?
- 扩展程序是否已启用?
- AI 应用中的 PORT 是否与扩展程序的 桥接端口 完全匹配?
- 通常每台机器一个桥接就足够了;重复的 MCP 配置可能会冲突。
在客户端看到 MCP 工具意味着一切正常吗?
不一定。工具只能证明 AI → 桥接;扩展程序也必须在同一端口上注册。
MCP 注册表和目录
官方 MCP 注册表条目(两者都使用 server.json):
| 路径 | 注册表名称 | 包 |
|---|---|---|
| packages/node/server.json | io.github.dowant/lionscraper-node |
npm: lionscraper (package.json 中的 mcpName) |
发布概要(安装官方CLI,参见快速入门):
- 在每个
server.json中指定的版本下发布npm / PyPI。 - 在**
packages/node**目录下:运行mcp-publisher login github,然后运行mcp-publisher publish。 - 在**
packages/python**目录下:运行mcp-publisher publish(复用登录信息)。
第三方列表(例如Glama)有其自己的规则;Smithery默认针对公共HTTPS/流媒体设置,而不是本地stdio + npm/pip。
第三方目录 (Glama)
该项目在Glama上列出(例如LionScraper on Glama)。如果页面显示无法安装或找不到许可证,常见的解决方法是:添加根目录下的**LICENSE文件(此仓库包含LICENSE),添加带有维护者GitHub用户名的glama.json文件(对于组织拥有的仓库,glama.json—如果声明失败,请编辑maintainers),在Glama上声明该服务器,并可选地完成Glama的Docker / 发布流程,如果你需要他们的安装和安全/质量检查—官方安装方式仍然是npm install -g lionscraper** 和 pip install -U lionscraper。另请参阅评分/检查清单页面。
许可证
MIT(与npm和PyPI包相同)。