视觉调用2.0

doctorpan/vision-mcp4.0
0 Stars 6 次浏览 寅午戊 更新于 2026-08-23

Vision MCP 服务器是一个工具,它允许不具备视觉能力的 LLM 通过此 MCP 调用视觉模型分析图片。支持多个提供商,并且可以以多种方式部署,包括本地和远程模式。

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "vision-mcp": {
      "url": "https://mcp.api-inference.modelscope.net/xxxxx/mcp"
    }
  }
}

该服务需要配置环境变量:DEFAULT_VISION_MODEL、VISION_API_KEY、VISION_PROVIDER

服务介绍

Vision MCP Server - 视觉能力代理

让不具备视觉能力的 LLM 通过此 MCP 调用视觉模型分析图片。

每个部署者自行选择视觉模型提供商和默认模型,只需在部署时配置环境变量即可。

功能

工具 说明
analyze_image 分析图片内容。传入图片 URL + 问题,视觉模型理解并回答
list_vision_models 查看当前提供商和推荐使用的模型列表

支持的视觉模型提供商

提供商 VISION_PROVIDER 特点
硅基流动 siliconflow 国内直接访问,免费额度,推荐中文用户
OpenAI openai GPT-4o 系列,需国际网络
阿里云通义千问 dashscope 国内访问,需阿里云 AK
自定义接口 custom 任何 OpenAI 兼容接口(Ollama / vLLM / 中转)

启动方式(双传输模式)

一套代码,两种启动方式:

模式 命令 适用场景
Stdio(默认) python server.py 本地 AI 客户端(Cherry Studio / Claude Desktop / Cursor 等)
SSE python server.py --transport sse --port 8000 魔搭 Hosted 部署 / 远程 HTTP 接入

优先级:命令行参数 > 环境变量 > 默认值。例如:

  • python server.py --transport sse --port 8080 — 强制 SSE 模式,端口 8080
  • 设置环境变量 VISION_MCP_TRANSPORT=ssepython server.py — 也是 SSE 模式
  • 直接 python server.py — 默认 stdio 模式(向后兼容)

如何选择模型

你有两种方式指定使用的视觉模型:

方式一:设置默认模型(环境变量 DEFAULT_VISION_MODEL

部署时配置环境变量,每次调用 analyze_image 时不传 model 参数就会使用这个默认模型:

{
  "env": {
    "VISION_PROVIDER": "siliconflow",
    "DEFAULT_VISION_MODEL": "Qwen/Qwen2-VL-72B-Instruct"
  }
}

方式二:调用时指定模型(analyze_imagemodel 参数)

每次调用时可以自由传入任何模型名,覆盖默认值:

analyze_image(
  image_url="https://example.jpg",
  prompt="这张图里有什么?",
  model="Qwen/Qwen3-VL-72B-Instruct"
)

各提供商推荐模型

提供商 推荐模型
siliconflow Qwen/Qwen2-VL-72B-Instruct(默认免费)、Qwen/Qwen3-VL-72B-Instructdeepseek-ai/deepseek-vl2
openai gpt-4o(默认)、gpt-4o-minigpt-4.1
dashscope qwen-vl-plus(默认)、qwen-vl-maxqwen2.5-vl-72b-instruct
custom 由你的自定义接口决定

一键运行(无需手动安装)

项目支持 npx / uvx / pip 三种方式一键运行,无需手动克隆仓库和安装依赖。

方式 命令 前提条件
npx npx vision-mcp 安装 Node.js 18+ + Python 3.10+
uvx uvx vision-mcp 安装 uv
pip pip install vision-mcp && vision-mcp 安装 Python 3.10+
# npx 运行(默认 stdio 模式)
npx vision-mcp

# npx 运行(SSE 模式,用于魔搭部署)
npx vision-mcp --transport sse --port 8000

# uvx 运行
uvx vision-mcp --transport sse --port 8000

注意:首次运行 npx 会自动从 npm 和 PyPI 下载依赖,之后会缓存。
API Key 等配置通过 .env 文件或系统环境变量传入。

快速开始(本地开发)

# 1. 安装依赖
pip install -r requirements.txt

# 2. 复制配置模板
copy .env.example .env

# 3. 编辑 .env,填入你的配置
#    VISION_API_KEY=sk-xxx
#    VISION_PROVIDER=siliconflow

# 4. 启动(默认 stdio 模式)
python server.py

# 或者本地测试 SSE 模式
python server.py --transport sse --port 8000

在 Reasonix 中配置(本地 stdio)

{
  "mcpServers": {
    "vision-mcp": {
      "command": "python",
      "args": ["C:\\path\\to\\vision-mcp\\server.py"],
      "env": {
        "VISION_API_KEY": "你的硅基流动 API Key",
        "VISION_PROVIDER": "siliconflow",
        "DEFAULT_VISION_MODEL": "Qwen/Qwen2-VL-72B-Instruct"
      }
    }
  }
}

在 Reasonix 中配置(通过 npx 一键运行)

无需克隆仓库、无需 pip install,Reasonix 自动通过 npx 从 npm 拉取运行:

{
  "mcpServers": {
    "vision-mcp": {
      "command": "npx",
      "args": ["vision-mcp"],
      "env": {
        "VISION_API_KEY": "你的硅基流动 API Key",
        "VISION_PROVIDER": "siliconflow",
        "DEFAULT_VISION_MODEL": "Qwen/Qwen2-VL-72B-Instruct"
      }
    }
  }
}

在 Reasonix 中配置(远程 SSE URL)

部署到魔搭后拿到 SSE URL:

{
  "mcpServers": {
    "vision-mcp": {
      "url": "https://mcp.api-inference.modelscope.net/xxxxx/mcp"
    }
  }
}

部署到魔搭 Hosted(SSE 模式)🚀

魔搭社区提供 Hosted MCP 服务,可以将你的 MCP 服务器部署在魔搭云端,生成 SSE URL 供远程调用。

部署步骤

第 1 步:将代码推送到 GitHub

cd C:\Users\jige\Desktop\个人网站开发\vision-mcp
git init
git add .
git commit -m "初始提交"
git remote add origin https://github.com/你的用户名/vision-mcp.git
git push -u origin main

第 2 步:在魔搭提交 MCP 服务

  1. 登录 https://modelscope.cn
  2. 进入 MCP 广场 → 点击 提交 MCP 服务
  3. 填写以下信息:
字段 内容
服务名称 vision-mcp
中文名称 视觉能力代理
描述 让 LLM 通过 MCP 调用视觉模型分析图片。支持硅基流动、OpenAI、阿里云通义千问等多个提供商。
源代码地址 https://github.com/你的用户名/vision-mcp
启动命令 npx vision-mcp --transport sse --port 8000(推荐)或 uvx --from git+https://github.com/DoctorPan/vision-mcp vision-mcp --transport sse --port 8000
传输方式 SSE
  1. 点击提交,等待审核

第 3 步:部署 Hosted 服务

审核通过后:

  1. 在 MCP 管理页面找到 vision-mcp,点击部署
  2. 选择 Hosted 部署类型
  3. 配置环境变量:
变量 必填
VISION_API_KEY 你的视觉模型 API Key
VISION_PROVIDER ❌ 可选 siliconflow(默认)
DEFAULT_VISION_MODEL ❌ 可选 Qwen/Qwen2-VL-72B-Instruct

部署成功后,魔搭会生成一个 SSE URL,格式为:

https://mcp.api-inference.modelscope.net/xxxxx/mcp

分享给其他人

你的 MCP 部署到魔搭后,其他人可以在魔搭 MCP 广场搜索到它。他们部署时只需填入自己的 VISION_API_KEYVISION_PROVIDER,你的 Key 不会泄露。

环境变量速查

环境变量 作用 示例值
VISION_API_KEY ⭐ 你的 API Key(必填) sk-xxx
VISION_PROVIDER 选择提供商 siliconflow / openai / dashscope / custom
VISION_BASE_URL 自定义 API 地址 https://your-api.com/v1
DEFAULT_VISION_MODEL 每次调用的默认模型 gpt-4o
VISION_MCP_TRANSPORT 传输模式 stdio(本地) / sse(远程)
VISION_MCP_HOST SSE 监听地址 0.0.0.0
VISION_MCP_PORT SSE 监听端口 8000

命令行参数

# 方式一:通过 npx(推荐,自动拉取)
npx vision-mcp --help

# 方式二:通过 uvx
uvx vision-mcp --help

# 方式三:直接运行
python server.py --help

# 输出:
usage: server.py [-h] [--transport {stdio,sse}] [--host HOST] [--port PORT]

Vision MCP Server - 视觉能力代理

options:
  -h, --help            show this help message and exit
  --transport {stdio,sse}
                        传输模式: stdio (默认) / sse (远程部署)
  --host HOST           SSE 监听地址 (默认 0.0.0.0)
  --port PORT           SSE 监听端口 (默认 8000)

许可证

MIT

相关 MCP 服务