DINO-X 目标检测 MCP

LewisFung/DINO-X-Image-Detection-MCP
Hosted
5 Stars 884 次浏览 更新于 2026-08-23

DINO-X MCP 通过 DINO-X 和 Grounding DINO 1.6 API,使大型语言模型能够执行细粒度的对象检测和图像理解。它允许对视觉内容进行精确的定位和高质量的结构化输出,支持诸如视觉问答和与其他 MCP 服务器集成等任务。

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "dinox-mcp": {
      "args": [
        "-y",
        "@deepdataspace/dinox-mcp"
      ],
      "command": "npx",
      "env": {
        "DINOX_API_KEY": "your-api-key-here"
      }
    }
  }
}

该服务需要配置环境变量:DINOX_API_KEY

可用工具 (4 个)

该服务在 MCP 协议中暴露的工具,AI 可按需调用

detect-objects-by-text 3 个参数 需填 3 项

Analyze an image based on a text prompt to identify and count specific objects, and return detailed descriptions of the objects and their 2D coordinates.

必填参数:imageFileUri、textPrompt、includeDescription

detect-all-objects 2 个参数 需填 2 项

Analyze an image to detect all identifiable objects, returning the category, count, coordinate positions and detailed descriptions for each object.

必填参数:imageFileUri、includeDescription

detect-human-pose-keypoints 2 个参数 需填 2 项

Detects 17 keypoints for each person in an image, supporting body posture and movement analysis.

必填参数:imageFileUri、includeDescription

visualize-detection-result 5 个参数 需填 2 项

Visualize detection results by drawing bounding boxes and labels on the original image. Images are saved to the directory specified by IMAGE_STORAGE_DIRECTORY environment variable.

必填参数:imageFileUri、detections

服务介绍

DINO-X MCP

English | 中文

DINO-X 官方 MCP 服务器, 基于全球领先的视觉检测模型 DINO-X 和 Grounding DINO 1.6 API,给大模型提供细粒度的目标检测与图像理解能力。

💡 为什么需要 DINO-X MCP?

尽管多模态模型可以理解和描述图像,但它们往往缺乏对视觉内容的精确定位和高质量的结构化输出。

而借助 DINO-X MCP 后, 你可以:

🧠 实现图像的细粒度理解: 支持全图识别、定向检测。

🎯 精准获取目标数量、位置、属性, 并以此为依据进行图像问答等任务。

🧩 支持与其他 MCP Server 组合,构建多步视觉工作流。

🛠️ 构建自然语言驱动的视觉智能体,用于真实场景的自动化任务。

🎬 应用案例

🎯 场景 📝 输入 ✨ 输出
检测定位 💬 提示词:帮我框选森林里的着火范围,并用Canvas 可视化🖼️ 输入图片:
物体计数 💬 提示词:请帮我分析这张仓库图片,检测其中的所有纸箱,统计总数量🖼️ 输入图片:
特征检测 💬 提示词:找到图中所有红色的车,并用Canvas 可视化展示🖼️ 输入图片:
属性推理 💬 提示词:找到图中最高的人,并描述他的着装,用 Canvas 可视化🖼️ 输入图片:
全图检测 💬 提示词:找到图中维生素C含量最高的水果🖼️ 输入图片: 答案:猕猴桃(93mg/100g)
姿态分析 💬 提示词:请分析这是什么瑜伽姿势,并用canvas 显示关键点🖼️ 输入图片:

🚀 快速开始

1. 环境准备

你可以选择以下任一方式安装 Node.js:

方式一:使用安装脚本 👍

bash

MacOS 或 Linux 系统

curl -o- https://raw.githubusercontent.com/nvm-sh/nvm/v0.39.7/install.sh | bash
source ~/.bashrc # 如果使用 zsh,则运行:source ~/.zshrc
nvm install --lts

Windows 系统

winget install OpenJS.NodeJS.LTS

或使用 PowerShell (管理员权限)

iwr -useb https://raw.githubusercontent.com/chocolatey/chocolatey/master/chocolateyInstall/InstallChocolatey.ps1 | iex
choco install nodejs-lts -y

方式二:手动下载安装

Node.js 官网 下载安装包将以下英文技术文档翻译为中文,保留代码块和链接、格式结构、专业术语准确性,并且不添加额外的代码块标识如bash、json等。

同时, 选择一个支持 MCP 协议的 AI 助手或客户端,包括但不限于:

2. 配置 MCP 服务器

方式一:使用 NPM 安装包 👍

在你的 MCP 客户端的配置文件中加入配置:

json
{
"mcpServers": {
"dinox-mcp": {
"command": "npx",
"args": ["-y", "@deepdataspace/dinox-mcp"],
"env": {
"DINOX_API_KEY": "you-api-key-here"
}
}
}
}

方式二:使用本地项目

首先,克隆本项目代码到本地并编译

bash

下载源码

git clone https://github.com/IDEA-Research/DINO-X-MCP.git
cd DINO-X-MCP

安装依赖

pnpm install

编译

pnpm run build

然后在 MCP 客户端中配置:

json
{
"mcpServers": {
"dinox-mcp": {
"command": "node",
"args": ["/path/to/DINO-X-MCP/build/index.js"],
"env": {
"DINOX_API_KEY": "you-api-key-here"
}
}
}
}

3. 获取 API 密钥

DINO-X 官网 注册账号,新用户有免费 API 额度。

获取 API Key 后,把上面配置中的 you-api-key-here 替换成真正的密钥。

4. 支持的工具

刷新 MCP 配置,就可以在大模型对话中使用以下功能:

功能 作用 输入 输出
全图万物检测 检测并定位图像中所有可识别的物体 图片链接 每个物体的名称 + 2D框 + 详细描述
指定目标检测 指定一个或多个目标,检测它们的位置和详细描述 图片链接 + 目标名字 所有指定目标的2D框 + 详细描述
人体姿态检测 检测图像中每个人的17个关键点,用于姿态动作分析 图片链接 关键点坐标 + 描述

📝 使用指引

支持哪些图片格式?

  • 推荐用 https:// 开头的图片链接
  • 或用 file:// 开头的完整路径
  • 常见格式:jpg、jpeg、png、webp

API 使用

可以查看 DINO-X API 文档

🛠️ 开发者指引

如果你要修改这个 MCP 服务,可以开启监听模式,代码改动会自动重新编译:

bash
pnpm run watch

遇到问题时,可以用官方调试工具排查:

bash
pnpm run inspector

协议

Apache License 2.0

相关 MCP 服务