collect-reddoc-dataset
MCP 服务配置
复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用
{
"mcpServers": {
"@xhs/collect-reddoc-dataset": {
"args": [
"-y",
"@xhs/collect-reddoc-dataset"
],
"command": "npx"
}
}
}
服务介绍
基于 Model Context Protocol (MCP) 的小红书文档内容收集与数据集生成工具
这是一个专为收集和处理小红书技术文档(docs.xiaohongshu.com)而设计的 MCP 服务器。通过自动化爬取、智能解析和数据结构化,帮助快速构建高质量的技术文档数据集。
✨ 功能特性
🔧 核心工具
-
get_doc_content- 获取单个文档内容- 支持 Markdown 格式转换
- 自动处理页面渲染和内容提取
- 智能处理登录状态和权限控制
-
collect_doc_dataset- 批量收集文档数据集- 支持多层级文档结构遍历(默认2层深度)
- 自动发现和收集相关文档链接
- 支持 JSON 和 CSV 格式输出
-
save_processed_dataset- 保存AI处理后的数据集- 标准化数据格式输出
- 支持自定义输出路径
- 与AI模型无缝集成
-
login- 交互式登录工具- 自动化浏览器登录流程
- Cookie 持久化存储
- 支持访问受限内容
🎯 技术栈
- 运行时: Node.js + TypeScript
- 核心依赖:
@modelcontextprotocol/sdk- MCP 协议实现puppeteer- 无头浏览器自动化html-to-md- HTML 到 Markdown 转换zod- 数据验证和类型安全
🚀 快速开始
安装
npm install
npm run watch
📖 使用说明
1. 基础用法
# 直接运行(通过 npx)
npx @xhs/collect-reddoc-dataset
# 或者使用 MCP Inspector 调试
npm run inspector
2. 数据收集工作流程
-
登录获取权限(如需要)
await login({ login_url: "https://docs.xiaohongshu.com/login", wait_time: 120000 // 2分钟等待时间 }) -
收集原始文档数据
await collect_doc_dataset({ url: "https://docs.xiaohongshu.com/docs/some-category", max_depth: 2, output_format: "json", output_path: "./dataset.json" }) -
AI处理数据集
- 工具会自动将收集的数据提交给 AI 模型
- AI 按照
docs/data-example.csv的格式结构化处理数据
-
保存最终数据集
await save_processed_dataset({ content: "处理后的CSV内容", format: "csv", output_path: "./final-dataset.csv" })
3. 配置示例
Claude Desktop 配置
{
"mcpServers": {
"@xhs/collect-reddoc-dataset": {
"command": "npx",
"args": ["-y", "@xhs/collect-reddoc-dataset"]
}
}
}
VS Code MCP 扩展配置
参考 MCP 扩展文档进行相应配置。
📊 数据格式
生成的数据集包含以下字段:
package: 包名或模块名describe: 功能描述path: 文件路径content: 代码内容
具体格式请参考 docs/data-example.csv 示例文件。
🛠️ 开发调试
使用 MCP Inspector
npm run inspector
Inspector 会提供一个本地 URL,通过浏览器访问可以:
- 实时调试 MCP 工具调用
- 查看数据流和响应
- 测试各种参数组合
文件结构
├── build/ # 编译后的 JavaScript 文件
├── docs/ # 文档和示例
├── src/ # TypeScript 源码(如果存在)
├── package.json # 项目配置
└── README.md # 项目说明