X

XSCT 模型选型 MCP

itshen/xsct-bench
Hosted
42 Stars 2.4w 次浏览 洛小山 更新于 2026-08-23
该服务暂未提供标准配置,请参考 README 手动接入

可用工具 (8 个)

该服务在 MCP 协议中暴露的工具,AI 可按需调用

get_leaderboard 3 个参数

获取 SLCT Arena 模型排行榜 查询各模型在评测中的综合排名和得分。 评分维度说明: - overall(综合能力): 日常30% + 专业40% + 极限30% 加权平均 - daily(日常场景): 基础难度得分,适合普通用户日常使用 - professional(专业场景): 中等难度得分,适合专业工作需求 - extreme(极限场景): 困难难度得分,考验模型能力上限 Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成能力 - "xsct-vu": 图像理解能力 - "xsct-l": 文本理解能力(默认) - "xsct-w": 网页生成能力 sort_by: 排序维度,可选值: - "overall": 综合能力(默认) - "daily": 日常场景(基础难度) - "professional": 专业场景(中等难度) - "extreme": 极限场景(困难难度) limit: 返回条数,默认 10,最多 30 Returns: 排行榜数据,包含排名、模型名称、各维度得分、详情页链接

该工具无需必填参数,直接调用即可

get_model_scores 2 个参数 需填 1 项

获取模型在各维度的详细评分 了解某个模型在不同测试维度的表现,分析其强项和弱项。 Args: model_name: 模型名称,支持模糊匹配(如 "gemini"、"gpt-4o") test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 不填则返回所有类型 Returns: 模型在各维度的评分详情,包含基础/中等/困难难度得分、强项和弱项分析

必填参数:model_name

compare_models 3 个参数 需填 2 项

对比两个模型在同一测试类型下的表现 并排展示两个模型在各维度的得分差异,帮助用户选择合适的模型。 Args: model_name_a: 第一个模型名称,支持模糊匹配 model_name_b: 第二个模型名称,支持模糊匹配 test_type: 对比的测试类型,必填。可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解(默认) - "xsct-w": 网页理解 Returns: 两个模型的维度对比表,包含各维度得分差异和胜负分析

必填参数:model_name_a、model_name_b

search_testcases 4 个参数

搜索测试用例 按关键词、类型、维度搜索测试用例,了解有哪些评测场景。 支持中文关键词智能匹配(如搜索"润色"会匹配到 L-Polish 维度)。 Args: query: 搜索关键词,匹配用例标题、描述和维度(如 "润色"、"数学"、"代码"、"光影") test_type: 类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 dimension: 维度筛选(如 "L-Polish"、"L-Math"、"P-Lighting") limit: 返回条数,默认 10,最多 30 Returns: 匹配的测试用例列表,包含用例ID、标题、描述、类型、详情页链接

该工具无需必填参数,直接调用即可

get_model_case_result 3 个参数 需填 2 项

获取模型在某测试用例的完整评测结果 返回模型生成的完整内容、多 Judge 评分详情、各维度得分等信息。 这是查看单个评测结果最详细的工具。 ## 返回内容 1. **模型生成结果**: 完整的生成内容(文本)或图片查看链接(图像) 2. **综合评分**: 最终得分(多 Judge 加权平均) 3. **各 Judge 评分**: 每个评分模型的独立打分(如 Claude、Gemini、GPT) 4. **维度得分**: 各评测维度的细项分数 5. **评分理由**: AI 给出的详细评分依据 6. **性能数据**: 生成耗时、Token 消耗、费用等 ## 评分公式 - 多 Judge 模式:最终得分 = 各 Judge 得分的加权平均(去除最高最低后取平均,或直接平均) - 单 Judge 模式:最终得分 = 该 Judge 的评分 Args: model_name: 模型名称,支持模糊匹配 test_id: 测试用例 ID(从 search_testcases 结果获取) difficulty: 难度筛选,可选值: - "basic": 基础难度 - "medium": 中等难度 - "hard": 困难难度 不填则返回所有难度 Returns: 完整评测结果,包含生成内容、多 Judge 评分、维度得分、评分理由等

必填参数:model_name、test_id

get_dimensions 1 个参数

获取所有评测维度列表 查看平台支持的评测维度,了解每个维度包含多少测试用例。 这些维度可用于 search_testcases 的 dimension 参数进行精确筛选。 Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页生成 不填则返回所有类型的维度 Returns: 各测试类型下的维度列表,包含维度名称、用例数量、示例用例

该工具无需必填参数,直接调用即可

calculate_cost 9 个参数 需填 1 项

计算模型使用成本(支持多模型横向对比) 根据各类用量计算使用模型的费用,支持 7 个计费维度和多模型对比。 这是一个强大的成本测算工具,可帮助用户选择最具性价比的模型。 ## 计费维度说明 1. **输入 Tokens (input_tokens)** - 每次请求发送给模型的文字内容(Prompt)消耗的 token 数 - 包含系统提示词 (system prompt) 和用户消息 (user message) - 典型值:简单对话 500-2K,复杂任务 5K-20K,长文档 50K-200K 2. **输出 Tokens (output_tokens)** - 模型生成的回复内容消耗的 token 数 - 通常比输入少,但单价更高(约 2-4 倍) - 典型值:简短回答 100-500,详细回答 1K-5K,长文生成 5K-50K 3. **缓存读 Tokens (cache_read_tokens)** - 复用已缓存的提示词内容(如固定系统提示),价格约为正常输入的 1/10 - 适用于:相同 system prompt 的多轮对话、批量处理任务 - 主要支持:Claude 系列、部分国产模型 - 典型场景:10K 系统提示 × 1000 次调用 = 10M 缓存读 4. **缓存写 Tokens (cache_write_tokens)** - 首次将提示词写入缓存的额外费用,通常比正常输入略贵 - 写一次、后续多次读取,长期使用可节省大量成本 - 一般只需设置一次(首次调用) 5. **推理 Tokens (reasoning_tokens)** - 思考型模型(o1、o3、DeepSeek-R1 等)在正式回答前的内部推理过程 - 不展示给用户但会计费,价格通常与输出相近 - 典型值:简单问题 1K-5K,复杂推理 10K-100K 6. **图像数量 (image_count)** - 图像生成模型按张计费(如 DALL·E、豆包 Seedream) - 价格因分辨率和模型而异,从 ¥0.02/张 到 ¥0.5/张 不等 - 注意:部分图像模型(如 Gemini)按 token 计费而非按张 7. **搜索次数 (search_count)** - 部分模型支持联网搜索功能,每次搜索额外计费 - 如 Perplexity、带搜索插件的 GPT 等 ## 调用次数 (call_count) 业务每天/每月发起的 API 请求次数。所有用量 × 调用次数 = 实际总费用。 例如:单次用量 10K input + 2K output,每天调用 1000 次,则月费用 = 单次费用 × 1000 × 30 Args: model_names: 模型名称,支持多个模型用逗号分隔进行对比(如 "gpt-4o, claude-sonnet, gemini"),模型名称与榜单一致。 input_tokens: 单次输入 token 数(默认 0) output_tokens: 单次输出 token 数(默认 0) cache_read_tokens: 单次缓存读取 token 数(默认 0,仅部分模型支持) cache_write_tokens: 单次缓存写入 token 数(默认 0,仅部分模型支持) reasoning_tokens: 单次推理 token 数(默认 0,仅思考型模型) image_count: 单次生成图片数(默认 0,图像生成模型使用) search_count: 单次搜索次数(默认 0,仅支持联网搜索的模型) call_count: 调用次数,默认 1(可设置为日/月调用量进行批量估算) Returns: 费用计算结果,多模型时会显示对比表格和性价比分析

必填参数:model_names

get_testcase_curl 3 个参数 需填 1 项

获取测试用例的 curl 命令 返回可以直接用于测试大模型的 curl 命令,包含完整的 prompt。 你可以复制这个命令,替换 API Key 后直接运行测试。 Args: test_id: 测试用例 ID(从 search_testcases 获取) difficulty: 难度级别,可选值: - "basic": 基础难度(默认) - "medium": 中等难度 - "hard": 困难难度 provider: API 提供商,可选值: - "openrouter": OpenRouter(默认,支持多种模型) - "openai": OpenAI 官方 - "dashscope": 阿里云通义 Returns: 完整的 curl 命令,可直接用于测试模型

必填参数:test_id

服务介绍

XSCT MCP

用 AI 帮你选 AI,一句话完成大模型选型决策

配置好 XSCT MCP 后,直接向 AI 助手提问即可。AI 会根据你的问题自动调用工具,完成查数据、算成本、做对比,最后给出可执行的建议。


快速开始(推荐直连)

把下面这段配置加进你的 MCP 客户端(Cursor / Claude Desktop / Cherry Studio / CLINE 等通用):

{
  "mcpServers": {
    "xsct-bench": {
      "type": "streamable_http",
      "url": "https://xsct.ai/mcp"
    }
  }
}

如果你的客户端只认 url 字段,去掉 type 一行也能连上。

直连地址无需鉴权、无需注册、长期有效。

⚠️ 关于「工具无法使用」

页面右侧「服务配置」里的 ModelScope 托管地址(mcp.api-inference.modelscope.net/...)是平台按 24 小时 签发的临时地址,过期后请求会返回 {"error":{"message":"Url is expired"}}

之前反馈工具突然调不通的同学,原因都在这里。请改用上面的 https://xsct.ai/mcp 直连地址,配好一次就不会再失效。


怎么用

用自然语言问一句话,例如:

  • 「润色场景有哪些模型比较好?」
  • 「代码生成场景,用哪个模型性价比最高?」
  • 「Qwen3-Max 和 Claude 在创意写作上有什么差异?」
  • 「图像生成哪个模型中文最好?」

AI 会自动判断该调用哪些工具,你不需要关心具体实现。


工具列表

工具 说明
get_leaderboard 查排行榜
get_model_scores 查某个模型的各维度评分
compare_models 对比两个模型
search_testcases 搜索测试用例
get_model_case_result 查模型在某用例上的表现
get_dimensions 查所有评测维度
calculate_cost 计算模型成本
get_testcase_curl 生成可复现的 CURL 命令

这 8 个工具覆盖:查榜单、看评分、搜场景、比模型、算成本。无需记忆,AI 会根据你的问题自动调用。


能力边界

XSCT Arena 收录的是已完成评测的模型和用例,覆盖文本生成与图像生成两大类。工具返回的全部是平台实测数据。

如果你问的场景平台还没有对应评测(例如图生视频),工具会返回空结果,AI 应当直接告诉你「暂无该项评测数据」。这里不会用推测或训练记忆来凑答案。


使用示例

场景一:简单选型

提问:「润色场景有哪些模型比较好?」

AI 会自动:

  1. 调用 search_testcases 搜索润色相关用例
  2. 调用 get_leaderboard 获取排行榜
  3. 给出场景分类和初步建议

场景二:企业级成本分析

提问:「输入 5000 token,输出 2000 token,每天 300 次调用,80% 触发 KV Cache,哪些模型比较好?」

AI 会自动:

  1. 拆解计算逻辑(Cache 命中率、token 成本)
  2. 调用 calculate_cost 批量计算多个模型
  3. 生成完整的成本分析报告
  4. 给出分层推荐(首选 / 备选 / 不推荐)

场景三:深度对比

提问:「对比一下 MIMO V2 Flash 和 Qwen3-Max 在润色用例上的表现」

AI 会自动调用 compare_models,选取代表性用例进行深度对比。

场景四:生成可执行代码

提问:「帮我生成这个用例的 CURL 命令」

AI 会调用 get_testcase_curl,生成可直接运行的 CURL 命令,改一下 KEY 即可在终端测试。


平台

  • 官网xsct.ai
  • MCP 地址https://xsct.ai/mcp(Streamable HTTP,无需鉴权)
  • 系统提示词参考
# 角色:XSCT-Bench 智能选型顾问

你是一位基于 XSCT Arena 真实评测数据的 AI 模型选型专家。你通过 MCP 工具实时获取最新数据,为用户提供数据驱动的精准推荐。

## 核心理念

永远不要凭感觉推荐。你的每一个建议都必须调用工具获取实时数据,让数据说话。

## 工具使用策略

**启动时自我发现**

每次对话开始,如果用户询问能力范围,先调用 getDimensions() 了解当前支持的所有评测维度和测试类型。这能帮助你了解平台最新的评测能力边界。

**按需探索数据**

不要假设任何模型排名或分数。当用户问「哪个模型最好」,调用 getLeaderboard 获取实时排行。当用户问某模型能力,调用 getModelScores 获取详情。数据会持续更新,始终以工具返回为准。

**场景匹配策略**

当用户描述使用场景时,先调用 searchTestcases 用关键词搜索相关用例。搜索结果会告诉你该场景对应什么维度和测试类型,以此指导后续的排行榜查询。

## 服务流程

**通用选型流程**

用户说「推荐一个模型」时:先询问任务类型、使用频率、预算要求;根据任务调用 getLeaderboard 获取排行;对候选模型调用 calculateCost 估算成本;综合性能和成本给出推荐。

**模型对比流程**

用户说「A和B哪个好」时:确认对比的任务类型;调用 compareModels 获取维度对比;必要时调用 getModelScores 深挖各自优劣;给出分场景选择建议。

**场景验证流程**

用户想看真实效果时:调用 searchTestcases 找相关用例;调用 getModelCaseResult 展示实际表现;提供 getTestcaseCurl 生成的命令让用户自测。

**成本优化流程**

用户有预算限制时:了解使用量预估;批量调用 calculateCost;筛选预算内选项;按性能排序推荐。

## 输出原则

**推荐时**:说明数据来源(「根据最新排行榜…」),给出核心指标,附带成本估算,提供验证方式。

**对比时**:展示关键维度差异,分析各自适用场景,给出选择建议。

**验证时**:展示实际生成效果,提供评分和理由,附上可运行的测试命令。

## 性价比计算

性价比指数 = (综合评分 - 基准分) × 场景权重 / log10(月成本 + 1)

基准分和权重根据 getLeaderboard 返回的分数分布动态确定,不要使用固定值。

## 诚实原则

如果工具返回数据为空或报错,坦诚告知用户当前无法获取该信息。禁止编造数据,禁止用过时的记忆回答。如果某个场景没有对应评测,说明局限性,不做硬推荐。

关于

XSCT Bench 是大模型评测平台,将评测数据汇聚并提供 MCP 协议,让 AI 助手能直接查询。大模型选型本质是「信息检索 + 数据分析 + 决策推理」,每一步都是大模型擅长的事。

作者:洛小山


你只管问,剩下的,交给 AI。

相关 MCP 服务