Gemini图生器
允许AI助手通过MCP协议使用Google的Gemini模型从文本提示生成和转换高质量图像。
服务介绍
Gemini 图像生成器 MCP 服务器
通过 MCP 协议使用 Google 的 Gemini 模型从文本提示生成高质量图像。
概述
此 MCP 服务器允许任何 AI 助手使用 Google 的 Gemini AI 模型生成图像。该服务器处理提示工程、文本到图像的转换、文件名生成和本地图像存储,使通过任何 MCP 客户端创建和管理 AI 生成的图像变得容易。
特性
- 使用 Gemini 2.0 Flash 进行文本到图像的生成
- 基于文本提示的图像到图像的转换
- 支持基于文件和 base64 编码的图像
- 根据提示自动生成智能文件名
- 自动翻译非英语提示
- 可配置输出路径的本地图像存储
- 严格排除生成图像中的文本
- 高分辨率图像输出
- 直接访问图像数据和文件路径
可用的 MCP 工具
服务器为 AI 助手提供以下 MCP 工具:
1. generate_image_from_text
根据文本提示描述创建新图像。
generate_image_from_text(prompt: str) -> Tuple[bytes, str]
参数:
prompt: 您要生成的图像的文本描述
返回:
- 包含以下内容的元组:
- 原始图像数据(字节)
- 保存的图像文件路径(字符串)
这种双重返回格式允许 AI 助手直接处理图像数据或引用保存的文件路径。
示例:
- "生成一幅山间日落的图像"
- "在一个科幻城市中创建一只逼真的飞行猪"
示例输出
此图像是使用以下提示生成的:
"Hi, can you create a 3d rendered image of a pig with wings and a top hat flying over a happy futuristic scifi city with lots of greenery?"

一只有翅膀和圆顶礼帽的 3D 渲染猪在充满绿色植被的未来科幻城市上空飞翔
已知问题
当与此 MCP 服务器一起使用 Claude Desktop Host 时:
-
性能问题:使用
transform_image_from_encoded可能会比其他方法处理时间长得多。这是由于通过 MCP 协议传输大型 base64 编码图像数据的开销。 -
路径解析问题:使用 Claude Desktop Host 时可能会遇到正确解析图像路径的问题。主机应用程序可能无法正确解释返回的文件路径,使得难以访问生成的图像。
为了获得最佳体验,请考虑使用其他 MCP 客户端或尽可能使用 transform_image_from_file 方法。
2. transform_image_from_encoded
使用 base64 编码的图像数据基于文本提示转换现有图像。
transform_image_from_encoded(encoded_image: str, prompt: str) -> Tuple[bytes, str]
参数:
encoded_image: 带有格式头的 base64 编码图像数据(必须是以下格式:"data:image/[format];base64,[data]")prompt: 您希望如何转换图像的文本描述
返回:
- 包含以下内容的元组:
- 原始转换后的图像数据(字节)
- 保存的转换后图像文件路径(字符串)
示例:
- "在这个风景中添加雪"
- "将背景改为海滩"
3. transform_image_from_file
根据文本提示转换现有的图像文件。
transform_image_from_file(image_file_path: str, prompt: str) -> Tuple[bytes, str]
参数:
image_file_path: 要转换的图像文件的路径prompt: 您希望如何转换图像的文字描述
返回:
- 包含以下内容的元组:
- 原始转换后的图像数据(字节)
- 保存的转换后图像文件的路径(字符串)
示例:
- "在这张图片中的人旁边添加一只羊驼"
- "将这个白天场景变成夜晚"
示例转换
使用上面创建的飞猪图像,我们应用了以下提示进行转换:
"Add a cute baby whale flying alongside the pig"
之前:

之后:

原始的飞猪图像旁边添加了一只可爱的小鲸鱼
设置
前提条件
- Python 3.11+
- Google AI API 密钥 (Gemini)
- MCP 主机应用程序 (Claude Desktop App, Cursor 或其他兼容 MCP 的客户端)
获取 Gemini API 密钥
- 访问 Google AI Studio API 密钥页面
- 使用您的 Google 账户登录
- 点击“创建 API 密钥”
- 复制您的新 API 密钥以供配置使用
- 注意:API 密钥每月提供一定的免费使用额度。您可以在 Google AI Studio 中查看您的使用情况
安装
- 克隆仓库:
git clone https://github.com/your-username/gemini-image-generator.git
cd gemini-image-generator
- 创建虚拟环境并安装依赖项:
# Using regular venv
python -m venv .venv
source .venv/bin/activate
pip install -e .
# Or using uv
uv venv
source .venv/bin/activate
uv pip install -e .
- 复制示例环境文件并添加您的 API 密钥:
cp .env.example .env
- 编辑
.env文件以包含您的 Google Gemini API 密钥和首选输出路径:
GEMINI_API_KEY="your-gemini-api-key-here"
OUTPUT_IMAGE_PATH="/path/to/save/images"
配置 Claude Desktop
在您的 claude_desktop_config.json 中添加以下内容:
- macOS:
~/Library/Application Support/Claude/claude_desktop_config.json
{
"mcpServers": {
"gemini-image-generator": {
"command": "uv",
"args": [
"--directory",
"/absolute/path/to/gemini-image-generator",
"run",
"server.py"
],
"env": {
"GEMINI_API_KEY": "GEMINI_API_KEY",
"OUTPUT_IMAGE_PATH": "OUTPUT_IMAGE_PATH"
}
}
}
}
使用
安装并配置完成后,您可以要求 Claude 使用以下提示生成或转换图像:
生成新图像
- "生成一张山上的日落图像"
- "创建一幅未来城市的插图"
- "制作一张戴着太阳镜的猫的照片"
转换现有图像
- "通过在这个场景中添加雪来转换这张图像"
- "编辑这张照片,使其看起来像是在夜间拍摄的"
- "在这张图片的背景中添加一只飞行的龙"
生成/转换后的图像将保存到您配置的输出路径,并在 Claude 中显示。通过更新的返回类型,AI 助手也可以直接处理图像数据而无需访问保存的文件。
测试
您可以通过运行 FastMCP 开发服务器来测试应用程序:
fastmcp dev server.py
此命令将启动一个本地开发服务器,并使 MCP Inspector 在 http://localhost:5173/ 上可用。
MCP Inspector 提供了一个便捷的网页界面,您可以在不使用 Claude 或其他 MCP 客户端的情况下直接测试图像生成工具。
您可以输入文本提示、执行工具并立即查看结果,这对于开发和调试非常有帮助。
许可证
MIT 许可证