G

Gemini图生器

@qhdrl12/mcp-server-gemini-image-generator
1 Stars 540 次浏览 qhdrl12 更新于 2026-08-23

允许AI助手通过MCP协议使用Google的Gemini模型从文本提示生成和转换高质量图像。

该服务暂未提供标准配置,请参考 README 手动接入

服务介绍

Gemini 图像生成器 MCP 服务器

通过 MCP 协议使用 Google 的 Gemini 模型从文本提示生成高质量图像。

概述

此 MCP 服务器允许任何 AI 助手使用 Google 的 Gemini AI 模型生成图像。该服务器处理提示工程、文本到图像的转换、文件名生成和本地图像存储,使通过任何 MCP 客户端创建和管理 AI 生成的图像变得容易。

特性

  • 使用 Gemini 2.0 Flash 进行文本到图像的生成
  • 基于文本提示的图像到图像的转换
  • 支持基于文件和 base64 编码的图像
  • 根据提示自动生成智能文件名
  • 自动翻译非英语提示
  • 可配置输出路径的本地图像存储
  • 严格排除生成图像中的文本
  • 高分辨率图像输出
  • 直接访问图像数据和文件路径

可用的 MCP 工具

服务器为 AI 助手提供以下 MCP 工具:

1. generate_image_from_text

根据文本提示描述创建新图像。

generate_image_from_text(prompt: str) -> Tuple[bytes, str]

参数:

  • prompt: 您要生成的图像的文本描述

返回:

  • 包含以下内容的元组:
    • 原始图像数据(字节)
    • 保存的图像文件路径(字符串)

这种双重返回格式允许 AI 助手直接处理图像数据或引用保存的文件路径。

示例:

  • "生成一幅山间日落的图像"
  • "在一个科幻城市中创建一只逼真的飞行猪"

示例输出

此图像是使用以下提示生成的:

"Hi, can you create a 3d rendered image of a pig with wings and a top hat flying over a happy futuristic scifi city with lots of greenery?"

飞行猪在科幻城市上空

一只有翅膀和圆顶礼帽的 3D 渲染猪在充满绿色植被的未来科幻城市上空飞翔

已知问题

当与此 MCP 服务器一起使用 Claude Desktop Host 时:

  1. 性能问题:使用 transform_image_from_encoded 可能会比其他方法处理时间长得多。这是由于通过 MCP 协议传输大型 base64 编码图像数据的开销。

  2. 路径解析问题:使用 Claude Desktop Host 时可能会遇到正确解析图像路径的问题。主机应用程序可能无法正确解释返回的文件路径,使得难以访问生成的图像。

为了获得最佳体验,请考虑使用其他 MCP 客户端或尽可能使用 transform_image_from_file 方法。

2. transform_image_from_encoded

使用 base64 编码的图像数据基于文本提示转换现有图像。

transform_image_from_encoded(encoded_image: str, prompt: str) -> Tuple[bytes, str]

参数:

  • encoded_image: 带有格式头的 base64 编码图像数据(必须是以下格式:"data:image/[format];base64,[data]")
  • prompt: 您希望如何转换图像的文本描述

返回:

  • 包含以下内容的元组:
    • 原始转换后的图像数据(字节)
    • 保存的转换后图像文件路径(字符串)

示例:

  • "在这个风景中添加雪"
  • "将背景改为海滩"

3. transform_image_from_file

根据文本提示转换现有的图像文件。

transform_image_from_file(image_file_path: str, prompt: str) -> Tuple[bytes, str]

参数:

  • image_file_path: 要转换的图像文件的路径
  • prompt: 您希望如何转换图像的文字描述

返回:

  • 包含以下内容的元组:
    • 原始转换后的图像数据(字节)
    • 保存的转换后图像文件的路径(字符串)

示例:

  • "在这张图片中的人旁边添加一只羊驼"
  • "将这个白天场景变成夜晚"

示例转换

使用上面创建的飞猪图像,我们应用了以下提示进行转换:

"Add a cute baby whale flying alongside the pig"

之前:
科幻城市上空的飞猪

之后:
飞猪和小鲸鱼

原始的飞猪图像旁边添加了一只可爱的小鲸鱼

设置

前提条件

  • Python 3.11+
  • Google AI API 密钥 (Gemini)
  • MCP 主机应用程序 (Claude Desktop App, Cursor 或其他兼容 MCP 的客户端)

获取 Gemini API 密钥

  1. 访问 Google AI Studio API 密钥页面
  2. 使用您的 Google 账户登录
  3. 点击“创建 API 密钥”
  4. 复制您的新 API 密钥以供配置使用
  5. 注意:API 密钥每月提供一定的免费使用额度。您可以在 Google AI Studio 中查看您的使用情况

安装

  1. 克隆仓库:
git clone https://github.com/your-username/gemini-image-generator.git
cd gemini-image-generator
  1. 创建虚拟环境并安装依赖项:
# Using regular venv
python -m venv .venv
source .venv/bin/activate
pip install -e .

# Or using uv
uv venv
source .venv/bin/activate
uv pip install -e .
  1. 复制示例环境文件并添加您的 API 密钥:
cp .env.example .env
  1. 编辑 .env 文件以包含您的 Google Gemini API 密钥和首选输出路径:
GEMINI_API_KEY="your-gemini-api-key-here"
OUTPUT_IMAGE_PATH="/path/to/save/images"

配置 Claude Desktop

在您的 claude_desktop_config.json 中添加以下内容:

  • macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
{
    "mcpServers": {
        "gemini-image-generator": {
            "command": "uv",
            "args": [
                "--directory",
                "/absolute/path/to/gemini-image-generator",
                "run",
                "server.py"
            ],
            "env": {
                "GEMINI_API_KEY": "GEMINI_API_KEY",
                "OUTPUT_IMAGE_PATH": "OUTPUT_IMAGE_PATH"
            }
        }
    }
}

使用

安装并配置完成后,您可以要求 Claude 使用以下提示生成或转换图像:

生成新图像

  • "生成一张山上的日落图像"
  • "创建一幅未来城市的插图"
  • "制作一张戴着太阳镜的猫的照片"

转换现有图像

  • "通过在这个场景中添加雪来转换这张图像"
  • "编辑这张照片,使其看起来像是在夜间拍摄的"
  • "在这张图片的背景中添加一只飞行的龙"

生成/转换后的图像将保存到您配置的输出路径,并在 Claude 中显示。通过更新的返回类型,AI 助手也可以直接处理图像数据而无需访问保存的文件。

测试

您可以通过运行 FastMCP 开发服务器来测试应用程序:

fastmcp dev server.py

此命令将启动一个本地开发服务器,并使 MCP Inspector 在 http://localhost:5173/ 上可用。
MCP Inspector 提供了一个便捷的网页界面,您可以在不使用 Claude 或其他 MCP 客户端的情况下直接测试图像生成工具。
您可以输入文本提示、执行工具并立即查看结果,这对于开发和调试非常有帮助。

许可证

MIT 许可证

相关 MCP 服务