m

mcp视频识别工具

@mario-andreschak/mcp_video_recognition
1 Stars 257 次浏览 mario-andreschak 更新于 2026-08-23

通过模型上下文协议,提供使用谷歌Gemini AI进行图像、音频和视频识别的工具。

该服务暂未提供标准配置,请参考 README 手动接入

服务介绍

MCP 视频识别服务器

这是一个使用 Google 的 Gemini AI 提供图像、音频和视频识别工具的 MCP(Model Context Protocol)服务器。

功能

  • 图像识别:使用 Google Gemini AI 分析并描述图像
  • 音频识别:使用 Google Gemini AI 分析并转录音频
  • 视频识别:使用 Google Gemini AI 分析并描述视频

前提条件

  • Node.js 18 或更高版本
  • Google Gemini API 密钥

安装

手动安装

  1. 克隆仓库:

    git clone https://github.com/yourusername/mcp-video-recognition.git
    cd mcp-video-recognition
    
  2. 安装依赖项:

    npm install
    
  3. 构建项目:

    npm run build
    

在 FLUJO 中安装

  1. 点击添加服务器
  2. 将 Github URL 复制粘贴到 FLUJO
  3. 点击解析、克隆、安装、构建并保存。

通过配置文件安装

要通过配置文件将此 MCP 服务器与 Cline 或其他 MCP 客户端集成:

  1. 打开您的 Cline 设置:

    • 在 VS Code 中,转到文件 -> 首选项 -> 设置
    • 搜索 "Cline MCP 设置"
    • 单击 "在 settings.json 中编辑"
  2. mcpServers 对象中添加服务器配置:

    {
      "mcpServers": {
        "video-recognition": {
          "command": "node",
          "args": [
            "/path/to/mcp-video-recognition/dist/index.js"
          ],
          "disabled": false,
          "autoApprove": []
        }
      }
    }
    
  3. /path/to/mcp-video-recognition/dist/index.js 替换为您项目目录中 index.js 文件的实际路径。在 Windows 上使用正斜杠 (/) 或双反斜杠 (\) 作为路径分隔符。

  4. 保存设置文件。Cline 应该会自动连接到服务器。

配置

服务器通过环境变量进行配置:

  • GOOGLE_API_KEY(必需):您的 Google Gemini API 密钥
  • TRANSPORT_TYPE:使用的传输类型(stdiosse,默认为 stdio
  • PORT:SSE 传输的端口号(默认为 3000)
  • LOG_LEVEL:日志级别(verbosedebuginfowarnerror,默认为 info

使用

启动服务器

使用 stdio 传输(默认)

GOOGLE_API_KEY=your_api_key npm start

使用 SSE 传输

GOOGLE_API_KEY=your_api_key TRANSPORT_TYPE=sse PORT=3000 npm start

使用工具

服务器提供了三个可以由 MCP 客户端调用的工具:

图像识别

{
  "name": "image_recognition",
  "arguments": {
    "filepath": "/path/to/image.jpg",
    "prompt": "Describe this image in detail",
    "modelname": "gemini-2.0-flash"
  }
}

音频识别

{
  "name": "audio_recognition",
  "arguments": {
    "filepath": "/path/to/audio.mp3",
    "prompt": "Transcribe this audio",
    "modelname": "gemini-2.0-flash"
  }
}

视频识别

{
  "name": "video_recognition",
  "arguments": {
    "filepath": "/path/to/video.mp4",
    "prompt": "Describe what happens in this video",
    "modelname": "gemini-2.0-flash"
  }
}

工具参数

所有工具接受以下参数:

  • filepath(必需):要分析的媒体文件的路径
  • prompt(可选):用于识别的自定义提示(默认为 "Describe this content")
  • modelname(可选):用于识别的 Gemini 模型(默认为 "gemini-2.0-flash")

开发

以开发模式运行

GOOGLE_API_KEY=your_api_key npm run dev

项目结构

  • src/index.ts: 入口点
  • src/server.ts: MCP 服务器实现
  • src/tools/: 工具实现
  • src/services/: 服务实现(Gemini API)
  • src/types/: 类型定义
  • src/utils/: 工具函数

许可证

MIT