智谱AI的mcp

xinzine/multi-modal-mcp
5 Stars 262 次浏览 更新于 2026-08-23

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "multi-modal": {
      "args": [
        "-y",
        "multi-modal-mcp@latest"
      ],
      "command": "npx",
      "env": {
        "KEY": "your-api-key"
      }
    }
  }
}

该服务需要配置环境变量:KEY

服务介绍

multi-modal-mcp

基于智谱 AI 的 MCP 服务器,提供文本生成、图片生成、视频生成和多模态理解等功能。

功能特性

  • 文本生成: 基于 GLM-4.5-Flash 模型,支持对话、写作、翻译、代码生成等多种文本生成任务
  • 多模态理解: 基于 GLM-4.6V-Flash 模型,支持图片、视频、文档等多种媒体类型的智能分析与理解
  • 图片生成: 基于 Cogview-3-Flash 模型,根据文本描述生成高质量图片
  • 视频生成: 基于 CogVideoX-Flash 模型,根据文本描述生成高质量视频

安装

npm install -g multi-modal-mcp

或使用 npx 直接运行:

npx multi-modal-mcp@latest

配置

在使用前,需要设置智谱 AI 的 API 密钥:

export KEY="your-api-key"

或在 MCP Inspector 中配置环境变量。

使用方法

直接运行

npx multi-modal-mcp@latest

使用 MCP Inspector 调试

npx @modelcontextprotocol/inspector npx multi-modal-mcp@latest

在 MCP 客户端中配置

在 Claude Desktop 或其他 MCP 客户端的配置文件中添加:

{
  "mcpServers": {
    "multi-modal": {
      "command": "npx",
      "args": ["-y", "multi-modal-mcp@latest"],
      "env": {
        "KEY": "your-api-key"
      }
    }
  }
}

工具列表

1. text_generation

基于 GLM-4.5-Flash 模型的文本生成工具,支持对话、写作、翻译、代码生成等多种文本生成任务。支持思考模式,可展示模型思考过程。通过温度参数控制生成文本的随机性和创造性。

参数:

  • messages: 消息文本,必传参数
  • thinking: 是否启用思考模式,可选值:enabled/disabled,默认 disabled
  • temperature: 温度参数,控制生成文本的随机性,范围 0-1,默认 1

2. multi_modal_understanding

基于 GLM-4.6V-Flash 模型的多模态理解工具,支持图片、视频、文档等多种媒体类型的智能分析与理解。可执行 OCR 文字识别、表格解析、内容分析、缺陷检测、图像转提示词、视频标签提取、关键帧提取、时间线生成、脚本生成、视频问答、文档问答、文档对比等多种任务。支持同时处理多种媒体类型。

参数:

  • content: 媒体内容列表,支持图片、视频、文档
  • question: 关于媒体内容的问题,必传参数
  • thinking: 是否启用思考模式,可选值:enabled/disabled,默认 disabled
  • temperature: 温度参数,控制生成文本的随机性,范围 0-1,默认 1

3. image_generation

基于 Cogview-3-Flash 模型的图片生成工具,根据文本描述生成高质量图片。支持多种尺寸选择,包括横屏、竖屏和方形等多种比例。可选择是否添加水印。适用于插画、设计素材、场景生成等多种应用场景。

参数:

  • prompt: 图片的文本描述,必传参数
  • size: 图片尺寸,可选值:1024x1024/768x1344/864x1152/1344x768/1152x864/1440x720/720x1440,默认 1024x1024
  • watermark_enabled: 是否添加水印,默认 false

4. video_generation

基于 CogVideoX-Flash 模型的视频生成工具,根据文本描述生成高质量视频。支持多种分辨率选择,包括 720p、1080p、2K、4K 等多种规格。支持质量优先和速度优先两种输出模式。可选择是否生成 AI 音效和添加水印。采用异步处理机制,自动轮询任务状态直至完成。

参数:

  • prompt: 视频的文本描述,最大输入长度为 512 个字符,必传参数
  • quality: 输出模式,可选值:quality/speed,默认 speed
  • withAudio: 是否生成 AI 音效,默认 false
  • watermarkEnabled: 是否添加水印,默认 false
  • size: 视频分辨率,支持多种规格,默认 1024x1024
  • fps: 视频帧率,可选值:30/60,默认 30

API 密钥获取

  1. 访问 智谱 AI 开放平台
  2. 注册并登录账号
  3. 在控制台创建 API 密钥

许可证

MIT License

作者

橘子

相关链接

相关 MCP 服务