XSCT 模型选型 MCP
可用工具 (8 个)
该服务在 MCP 协议中暴露的工具,AI 可按需调用
get_leaderboard 3 个参数
获取 SLCT Arena 模型排行榜 查询各模型在评测中的综合排名和得分。 评分维度说明: - overall(综合能力): 日常30% + 专业40% + 极限30% 加权平均 - daily(日常场景): 基础难度得分,适合普通用户日常使用 - professional(专业场景): 中等难度得分,适合专业工作需求 - extreme(极限场景): 困难难度得分,考验模型能力上限 Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成能力 - "xsct-vu": 图像理解能力 - "xsct-l": 文本理解能力(默认) - "xsct-w": 网页生成能力 sort_by: 排序维度,可选值: - "overall": 综合能力(默认) - "daily": 日常场景(基础难度) - "professional": 专业场景(中等难度) - "extreme": 极限场景(困难难度) limit: 返回条数,默认 10,最多 30 Returns: 排行榜数据,包含排名、模型名称、各维度得分、详情页链接
该工具无需必填参数,直接调用即可
get_model_scores 2 个参数 需填 1 项
获取模型在各维度的详细评分 了解某个模型在不同测试维度的表现,分析其强项和弱项。 Args: model_name: 模型名称,支持模糊匹配(如 "gemini"、"gpt-4o") test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 不填则返回所有类型 Returns: 模型在各维度的评分详情,包含基础/中等/困难难度得分、强项和弱项分析
必填参数:model_name
compare_models 3 个参数 需填 2 项
对比两个模型在同一测试类型下的表现 并排展示两个模型在各维度的得分差异,帮助用户选择合适的模型。 Args: model_name_a: 第一个模型名称,支持模糊匹配 model_name_b: 第二个模型名称,支持模糊匹配 test_type: 对比的测试类型,必填。可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解(默认) - "xsct-w": 网页理解 Returns: 两个模型的维度对比表,包含各维度得分差异和胜负分析
必填参数:model_name_a、model_name_b
search_testcases 4 个参数
搜索测试用例 按关键词、类型、维度搜索测试用例,了解有哪些评测场景。 支持中文关键词智能匹配(如搜索"润色"会匹配到 L-Polish 维度)。 Args: query: 搜索关键词,匹配用例标题、描述和维度(如 "润色"、"数学"、"代码"、"光影") test_type: 类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 dimension: 维度筛选(如 "L-Polish"、"L-Math"、"P-Lighting") limit: 返回条数,默认 10,最多 30 Returns: 匹配的测试用例列表,包含用例ID、标题、描述、类型、详情页链接
该工具无需必填参数,直接调用即可
get_model_case_result 3 个参数 需填 2 项
获取模型在某测试用例的完整评测结果 返回模型生成的完整内容、多 Judge 评分详情、各维度得分等信息。 这是查看单个评测结果最详细的工具。 ## 返回内容 1. **模型生成结果**: 完整的生成内容(文本)或图片查看链接(图像) 2. **综合评分**: 最终得分(多 Judge 加权平均) 3. **各 Judge 评分**: 每个评分模型的独立打分(如 Claude、Gemini、GPT) 4. **维度得分**: 各评测维度的细项分数 5. **评分理由**: AI 给出的详细评分依据 6. **性能数据**: 生成耗时、Token 消耗、费用等 ## 评分公式 - 多 Judge 模式:最终得分 = 各 Judge 得分的加权平均(去除最高最低后取平均,或直接平均) - 单 Judge 模式:最终得分 = 该 Judge 的评分 Args: model_name: 模型名称,支持模糊匹配 test_id: 测试用例 ID(从 search_testcases 结果获取) difficulty: 难度筛选,可选值: - "basic": 基础难度 - "medium": 中等难度 - "hard": 困难难度 不填则返回所有难度 Returns: 完整评测结果,包含生成内容、多 Judge 评分、维度得分、评分理由等
必填参数:model_name、test_id
get_dimensions 1 个参数
获取所有评测维度列表 查看平台支持的评测维度,了解每个维度包含多少测试用例。 这些维度可用于 search_testcases 的 dimension 参数进行精确筛选。 Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页生成 不填则返回所有类型的维度 Returns: 各测试类型下的维度列表,包含维度名称、用例数量、示例用例
该工具无需必填参数,直接调用即可
calculate_cost 9 个参数 需填 1 项
计算模型使用成本(支持多模型横向对比) 根据各类用量计算使用模型的费用,支持 7 个计费维度和多模型对比。 这是一个强大的成本测算工具,可帮助用户选择最具性价比的模型。 ## 计费维度说明 1. **输入 Tokens (input_tokens)** - 每次请求发送给模型的文字内容(Prompt)消耗的 token 数 - 包含系统提示词 (system prompt) 和用户消息 (user message) - 典型值:简单对话 500-2K,复杂任务 5K-20K,长文档 50K-200K 2. **输出 Tokens (output_tokens)** - 模型生成的回复内容消耗的 token 数 - 通常比输入少,但单价更高(约 2-4 倍) - 典型值:简短回答 100-500,详细回答 1K-5K,长文生成 5K-50K 3. **缓存读 Tokens (cache_read_tokens)** - 复用已缓存的提示词内容(如固定系统提示),价格约为正常输入的 1/10 - 适用于:相同 system prompt 的多轮对话、批量处理任务 - 主要支持:Claude 系列、部分国产模型 - 典型场景:10K 系统提示 × 1000 次调用 = 10M 缓存读 4. **缓存写 Tokens (cache_write_tokens)** - 首次将提示词写入缓存的额外费用,通常比正常输入略贵 - 写一次、后续多次读取,长期使用可节省大量成本 - 一般只需设置一次(首次调用) 5. **推理 Tokens (reasoning_tokens)** - 思考型模型(o1、o3、DeepSeek-R1 等)在正式回答前的内部推理过程 - 不展示给用户但会计费,价格通常与输出相近 - 典型值:简单问题 1K-5K,复杂推理 10K-100K 6. **图像数量 (image_count)** - 图像生成模型按张计费(如 DALL·E、豆包 Seedream) - 价格因分辨率和模型而异,从 ¥0.02/张 到 ¥0.5/张 不等 - 注意:部分图像模型(如 Gemini)按 token 计费而非按张 7. **搜索次数 (search_count)** - 部分模型支持联网搜索功能,每次搜索额外计费 - 如 Perplexity、带搜索插件的 GPT 等 ## 调用次数 (call_count) 业务每天/每月发起的 API 请求次数。所有用量 × 调用次数 = 实际总费用。 例如:单次用量 10K input + 2K output,每天调用 1000 次,则月费用 = 单次费用 × 1000 × 30 Args: model_names: 模型名称,支持多个模型用逗号分隔进行对比(如 "gpt-4o, claude-sonnet, gemini"),模型名称与榜单一致。 input_tokens: 单次输入 token 数(默认 0) output_tokens: 单次输出 token 数(默认 0) cache_read_tokens: 单次缓存读取 token 数(默认 0,仅部分模型支持) cache_write_tokens: 单次缓存写入 token 数(默认 0,仅部分模型支持) reasoning_tokens: 单次推理 token 数(默认 0,仅思考型模型) image_count: 单次生成图片数(默认 0,图像生成模型使用) search_count: 单次搜索次数(默认 0,仅支持联网搜索的模型) call_count: 调用次数,默认 1(可设置为日/月调用量进行批量估算) Returns: 费用计算结果,多模型时会显示对比表格和性价比分析
必填参数:model_names
get_testcase_curl 3 个参数 需填 1 项
获取测试用例的 curl 命令 返回可以直接用于测试大模型的 curl 命令,包含完整的 prompt。 你可以复制这个命令,替换 API Key 后直接运行测试。 Args: test_id: 测试用例 ID(从 search_testcases 获取) difficulty: 难度级别,可选值: - "basic": 基础难度(默认) - "medium": 中等难度 - "hard": 困难难度 provider: API 提供商,可选值: - "openrouter": OpenRouter(默认,支持多种模型) - "openai": OpenAI 官方 - "dashscope": 阿里云通义 Returns: 完整的 curl 命令,可直接用于测试模型
必填参数:test_id
服务介绍
XSCT MCP
用 AI 帮你选 AI,一句话完成大模型选型决策
配置好 XSCT MCP 后,直接向 AI 助手提问即可。AI 会根据你的问题自动调用工具,完成查数据、算成本、做对比,最后给出可执行的建议。
快速开始(推荐直连)
把下面这段配置加进你的 MCP 客户端(Cursor / Claude Desktop / Cherry Studio / CLINE 等通用):
{
"mcpServers": {
"xsct-bench": {
"type": "streamable_http",
"url": "https://xsct.ai/mcp"
}
}
}
如果你的客户端只认 url 字段,去掉 type 一行也能连上。
直连地址无需鉴权、无需注册、长期有效。
⚠️ 关于「工具无法使用」
页面右侧「服务配置」里的 ModelScope 托管地址(
mcp.api-inference.modelscope.net/...)是平台按 24 小时 签发的临时地址,过期后请求会返回{"error":{"message":"Url is expired"}}。之前反馈工具突然调不通的同学,原因都在这里。请改用上面的
https://xsct.ai/mcp直连地址,配好一次就不会再失效。
怎么用
用自然语言问一句话,例如:
- 「润色场景有哪些模型比较好?」
- 「代码生成场景,用哪个模型性价比最高?」
- 「Qwen3-Max 和 Claude 在创意写作上有什么差异?」
- 「图像生成哪个模型中文最好?」
AI 会自动判断该调用哪些工具,你不需要关心具体实现。
工具列表
| 工具 | 说明 |
|---|---|
get_leaderboard |
查排行榜 |
get_model_scores |
查某个模型的各维度评分 |
compare_models |
对比两个模型 |
search_testcases |
搜索测试用例 |
get_model_case_result |
查模型在某用例上的表现 |
get_dimensions |
查所有评测维度 |
calculate_cost |
计算模型成本 |
get_testcase_curl |
生成可复现的 CURL 命令 |
这 8 个工具覆盖:查榜单、看评分、搜场景、比模型、算成本。无需记忆,AI 会根据你的问题自动调用。
能力边界
XSCT Arena 收录的是已完成评测的模型和用例,覆盖文本生成与图像生成两大类。工具返回的全部是平台实测数据。
如果你问的场景平台还没有对应评测(例如图生视频),工具会返回空结果,AI 应当直接告诉你「暂无该项评测数据」。这里不会用推测或训练记忆来凑答案。
使用示例
场景一:简单选型
提问:「润色场景有哪些模型比较好?」
AI 会自动:
- 调用
search_testcases搜索润色相关用例 - 调用
get_leaderboard获取排行榜 - 给出场景分类和初步建议
场景二:企业级成本分析
提问:「输入 5000 token,输出 2000 token,每天 300 次调用,80% 触发 KV Cache,哪些模型比较好?」
AI 会自动:
- 拆解计算逻辑(Cache 命中率、token 成本)
- 调用
calculate_cost批量计算多个模型 - 生成完整的成本分析报告
- 给出分层推荐(首选 / 备选 / 不推荐)
场景三:深度对比
提问:「对比一下 MIMO V2 Flash 和 Qwen3-Max 在润色用例上的表现」
AI 会自动调用 compare_models,选取代表性用例进行深度对比。
场景四:生成可执行代码
提问:「帮我生成这个用例的 CURL 命令」
AI 会调用 get_testcase_curl,生成可直接运行的 CURL 命令,改一下 KEY 即可在终端测试。
平台
- 官网:xsct.ai
- MCP 地址:
https://xsct.ai/mcp(Streamable HTTP,无需鉴权) - 系统提示词参考:
# 角色:XSCT-Bench 智能选型顾问
你是一位基于 XSCT Arena 真实评测数据的 AI 模型选型专家。你通过 MCP 工具实时获取最新数据,为用户提供数据驱动的精准推荐。
## 核心理念
永远不要凭感觉推荐。你的每一个建议都必须调用工具获取实时数据,让数据说话。
## 工具使用策略
**启动时自我发现**
每次对话开始,如果用户询问能力范围,先调用 getDimensions() 了解当前支持的所有评测维度和测试类型。这能帮助你了解平台最新的评测能力边界。
**按需探索数据**
不要假设任何模型排名或分数。当用户问「哪个模型最好」,调用 getLeaderboard 获取实时排行。当用户问某模型能力,调用 getModelScores 获取详情。数据会持续更新,始终以工具返回为准。
**场景匹配策略**
当用户描述使用场景时,先调用 searchTestcases 用关键词搜索相关用例。搜索结果会告诉你该场景对应什么维度和测试类型,以此指导后续的排行榜查询。
## 服务流程
**通用选型流程**
用户说「推荐一个模型」时:先询问任务类型、使用频率、预算要求;根据任务调用 getLeaderboard 获取排行;对候选模型调用 calculateCost 估算成本;综合性能和成本给出推荐。
**模型对比流程**
用户说「A和B哪个好」时:确认对比的任务类型;调用 compareModels 获取维度对比;必要时调用 getModelScores 深挖各自优劣;给出分场景选择建议。
**场景验证流程**
用户想看真实效果时:调用 searchTestcases 找相关用例;调用 getModelCaseResult 展示实际表现;提供 getTestcaseCurl 生成的命令让用户自测。
**成本优化流程**
用户有预算限制时:了解使用量预估;批量调用 calculateCost;筛选预算内选项;按性能排序推荐。
## 输出原则
**推荐时**:说明数据来源(「根据最新排行榜…」),给出核心指标,附带成本估算,提供验证方式。
**对比时**:展示关键维度差异,分析各自适用场景,给出选择建议。
**验证时**:展示实际生成效果,提供评分和理由,附上可运行的测试命令。
## 性价比计算
性价比指数 = (综合评分 - 基准分) × 场景权重 / log10(月成本 + 1)
基准分和权重根据 getLeaderboard 返回的分数分布动态确定,不要使用固定值。
## 诚实原则
如果工具返回数据为空或报错,坦诚告知用户当前无法获取该信息。禁止编造数据,禁止用过时的记忆回答。如果某个场景没有对应评测,说明局限性,不做硬推荐。
关于
XSCT Bench 是大模型评测平台,将评测数据汇聚并提供 MCP 协议,让 AI 助手能直接查询。大模型选型本质是「信息检索 + 数据分析 + 决策推理」,每一步都是大模型擅长的事。
作者:洛小山
你只管问,剩下的,交给 AI。