urltest

artex4458/urltest
0 Stars 78 次浏览 更新于 2026-08-23

MCP 服务配置

复制以下 JSON 到 OPClaw 或其他 MCP 客户端的配置文件中即可使用

{
  "mcpServers": {
    "urltest": {
      "args": [
        "mcp-server-fetch"
      ],
      "command": "uvx",
      "env": {}
    }
  }
}

SSE 传输配置

{
  "mcpServers": {
    "urltest": {
      "url": "https://example.com/mcp"
    }
  }
}

Streamable HTTP 传输配置

{
  "mcpServers": {
    "urltest": {
      "url": "https://example.com/mcp"
    }
  }
}

可用工具 (8 个)

该服务在 MCP 协议中暴露的工具,AI 可按需调用

get_leaderboard 3 个参数

获取 XSCT Arena 模型排行榜 查询各模型在评测中的综合排名和得分。 评分维度说明: - overall(综合能力): 日常30% + 专业40% + 极限30% 加权平均 - daily(日常场景): 基础难度得分,适合普通用户日常使用 - professional(专业场景): 中等难度得分,适合专业工作需求 - extreme(极限场景): 困难难度得分,考验模型能力上限 Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成能力 - "xsct-vu": 图像理解能力 - "xsct-l": 文本理解能力(默认) - "xsct-w": 网页生成能力 - "xsct-a": Agentic 任务执行能力 sort_by: 排序维度,可选值: - "overall": 综合能力(默认) - "daily": 日常场景(基础难度) - "professional": 专业场景(中等难度) - "extreme": 极限场景(困难难度) limit: 返回条数,默认 10,最多 30 Returns: 排行榜数据,包含排名、模型名称、各维度得分、详情页链接

该工具无需必填参数,直接调用即可

get_model_scores 2 个参数 需填 1 项

获取模型在各维度的详细评分 了解某个模型在不同测试维度的表现,分析其强项和弱项。 Args: model_name: 模型名称,支持模糊匹配(如 "gemini"、"gpt-4o") test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 - "xsct-a": Agentic 任务执行 不填则返回所有类型 Returns: 模型在各维度的评分详情,包含基础/中等/困难难度得分、强项和弱项分析

必填参数:model_name

compare_models 3 个参数 需填 2 项

对比两个模型在同一测试类型下的表现 并排展示两个模型在各维度的得分差异,帮助用户选择合适的模型。 Args: model_name_a: 第一个模型名称,支持模糊匹配 model_name_b: 第二个模型名称,支持模糊匹配 test_type: 对比的测试类型,必填。可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解(默认) - "xsct-w": 网页理解 - "xsct-a": Agentic 任务执行 Returns: 两个模型的维度对比表,包含各维度得分差异和胜负分析

必填参数:model_name_a、model_name_b

search_testcases 4 个参数

搜索测试用例 按关键词、类型、维度搜索测试用例,了解有哪些评测场景。 支持中文关键词智能匹配(如搜索"润色"会匹配到 L-Polish 维度)。 Args: query: 搜索关键词,匹配用例标题、描述和维度(如 "润色"、"数学"、"代码"、"光影") test_type: 类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 - "xsct-a": Agentic 任务执行 dimension: 维度筛选(如 "L-Polish"、"L-Math"、"P-Lighting") limit: 返回条数,默认 10,最多 30 Returns: 匹配的测试用例列表,包含用例ID、标题、描述、类型、详情页链接

该工具无需必填参数,直接调用即可

get_model_case_result 3 个参数 需填 2 项

获取模型在某测试用例的完整评测结果 返回模型生成的完整内容、多 Judge 评分详情、各维度得分等信息。 这是查看单个评测结果最详细的工具。 ## 返回内容 1. **模型生成结果**: 完整的生成内容(文本)或图片查看链接(图像) 2. **综合评分**: 最终得分(多 Judge 加权平均) 3. **各 Judge 评分**: 每个评分模型的独立打分(如 Claude、Gemini、GPT) 4. **维度得分**: 各评测维度的细项分数 5. **评分理由**: AI 给出的详细评分依据 6. **性能数据**: 生成耗时、Token 消耗、费用等 ## 评分公式 - 多 Judge 模式:最终得分 = 各 Judge 得分的加权平均(去除最高最低后取平均,或直接平均) - 单 Judge 模式:最终得分 = 该 Judge 的评分 Args: model_name: 模型名称,支持模糊匹配 test_id: 测试用例 ID(从 search_testcases 结果获取) difficulty: 难度筛选,可选值: - "basic": 基础难度 - "medium": 中等难度 - "hard": 困难难度 不填则返回所有难度 Returns: 完整评测结果,包含生成内容、多 Judge 评分、维度得分、评分理由等

必填参数:model_name、test_id

get_dimensions 1 个参数

获取所有评测维度列表 查看平台支持的评测维度,了解每个维度包含多少测试用例。 这些维度可用于 search_testcases 的 dimension 参数进行精确筛选。 Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页生成 - "xsct-a": Agentic 任务执行 不填则返回所有类型的维度 Returns: 各测试类型下的维度列表,包含维度名称、用例数量、示例用例

该工具无需必填参数,直接调用即可

calculate_cost 9 个参数 需填 1 项

计算模型使用成本(支持多模型横向对比) 根据各类用量计算使用模型的费用,支持 7 个计费维度和多模型对比。 这是一个强大的成本测算工具,可帮助用户选择最具性价比的模型。 ## 计费维度说明 1. **输入 Tokens (input_tokens)** - 每次请求发送给模型的文字内容(Prompt)消耗的 token 数 - 包含系统提示词 (system prompt) 和用户消息 (user message) - 典型值:简单对话 500-2K,复杂任务 5K-20K,长文档 50K-200K 2. **输出 Tokens (output_tokens)** - 模型生成的回复内容消耗的 token 数 - 通常比输入少,但单价更高(约 2-4 倍) - 典型值:简短回答 100-500,详细回答 1K-5K,长文生成 5K-50K 3. **缓存读 Tokens (cache_read_tokens)** - 复用已缓存的提示词内容(如固定系统提示),价格约为正常输入的 1/10 - 适用于:相同 system prompt 的多轮对话、批量处理任务 - 主要支持:Claude 系列、部分国产模型 - 典型场景:10K 系统提示 × 1000 次调用 = 10M 缓存读 4. **缓存写 Tokens (cache_write_tokens)** - 首次将提示词写入缓存的额外费用,通常比正常输入略贵 - 写一次、后续多次读取,长期使用可节省大量成本 - 一般只需设置一次(首次调用) 5. **推理 Tokens (reasoning_tokens)** - 思考型模型(o1、o3、DeepSeek-R1 等)在正式回答前的内部推理过程 - 不展示给用户但会计费,价格通常与输出相近 - 典型值:简单问题 1K-5K,复杂推理 10K-100K 6. **图像数量 (image_count)** - 图像生成模型按张计费(如 DALL·E、豆包 Seedream) - 价格因分辨率和模型而异,从 ¥0.02/张 到 ¥0.5/张 不等 - 注意:部分图像模型(如 Gemini)按 token 计费而非按张 7. **搜索次数 (search_count)** - 部分模型支持联网搜索功能,每次搜索额外计费 - 如 Perplexity、带搜索插件的 GPT 等 ## 调用次数 (call_count) 业务每天/每月发起的 API 请求次数。所有用量 × 调用次数 = 实际总费用。 例如:单次用量 10K input + 2K output,每天调用 1000 次,则月费用 = 单次费用 × 1000 × 30 Args: model_names: 模型名称,支持多个模型用逗号分隔进行对比(如 "gpt-4o, claude-sonnet, gemini"),模型名称与榜单一致。 input_tokens: 单次输入 token 数(默认 0) output_tokens: 单次输出 token 数(默认 0) cache_read_tokens: 单次缓存读取 token 数(默认 0,仅部分模型支持) cache_write_tokens: 单次缓存写入 token 数(默认 0,仅部分模型支持) reasoning_tokens: 单次推理 token 数(默认 0,仅思考型模型) image_count: 单次生成图片数(默认 0,图像生成模型使用) search_count: 单次搜索次数(默认 0,仅支持联网搜索的模型) call_count: 调用次数,默认 1(可设置为日/月调用量进行批量估算) Returns: 费用计算结果,多模型时会显示对比表格和性价比分析

必填参数:model_names

get_testcase_curl 3 个参数 需填 1 项

获取测试用例的 curl 命令 返回可以直接用于测试大模型的 curl 命令,包含完整的 prompt。 你可以复制这个命令,替换 API Key 后直接运行测试。 Args: test_id: 测试用例 ID(从 search_testcases 获取) difficulty: 难度级别,可选值: - "basic": 基础难度(默认) - "medium": 中等难度 - "hard": 困难难度 provider: API 提供商,可选值: - "openrouter": OpenRouter(默认,支持多种模型) - "openai": OpenAI 官方 - "dashscope": 阿里云通义 Returns: 完整的 curl 命令,可直接用于测试模型

必填参数:test_id