公开结果 / 可追溯比较

公开评测

比较同一数据集、指标和原发布者协议下已核实的配置记录。不同 effort 分别显示,不表示相同算力或成本。本站未自行运行评测,不提供跨来源综合分。

收录 37 个结果 · 整理快照 2026-10-06

历史系列 · 数据集 2026-06-25 · 7类等权整理总分(逐配置)

比较设置:published-runner-config-single-model-per-evaluation。不同系列不混排。比较条件与局限

显示 25 / 27 个评测配置价格单位:USD / 百万 token
名次模型 / 版本得分(%)操作
1
Claude Fable 5.1
anthropicclaude-fable-5-1

完整模型标识:claude-fable-5-1

厂商:anthropic · 本轮精选

价格渠道:anthropic

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

claude-fable-5-1-max-effort

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:anthropic · endpoint:claude-fable-5-1

适配器:anthropic · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "max_tokens": 128000,
  "timeout": 1800,
  "thinking": {
    "type": "adaptive"
  },
  "extra_body": {
    "output_config": {
      "effort": "max"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

Claude版本身份依据厂商pinned-ID说明;运行条件仍独立按runner核实

固定官方运行配置 ↗
原始结果 ↗
83.41 %
测试时间未提供
2
GPT-6 Astra
openaigpt-6-astra

完整模型标识:gpt-6-astra

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-6-astra-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-6-astra

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": 128000,
  "timeout": 1800,
  "reasoning": {
    "effort": "max",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
82.16 %
测试时间未提供
3
GPT-6.1 Sol
openaigpt-6.1-sol

完整模型标识:gpt-6.1-sol

厂商:openai · 本轮精选

价格渠道:openai

2条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-6.1-sol-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-6.1-sol

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": 128000,
  "timeout": 1800,
  "reasoning": {
    "effort": "max",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
81.62 %
测试时间未提供
4
Muse Spark 1.3
metamuse-spark-1.3

完整模型标识:muse-spark-1.3

厂商:meta · 本轮精选

价格渠道:meta

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

muse-spark-1.3-xhigh

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:meta · endpoint:muse-spark-1.3

适配器:openai_responses · API 基址:https://api.meta.ai/v1

{
  "temperature": null,
  "max_output_tokens": 262144,
  "timeout": 1800,
  "reasoning": {
    "effort": "xhigh",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
81.59 %
测试时间未提供
5
GPT-6.1 Sol
openaigpt-6.1-sol

完整模型标识:gpt-6.1-sol

厂商:openai · 本轮精选

价格渠道:openai

2条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-6.1-sol-xhigh

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-6.1-sol

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": 128000,
  "timeout": 1800,
  "reasoning": {
    "effort": "xhigh",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
81.11 %
测试时间未提供
6
GPT-5.6 Sol
openaigpt-5.6-sol

完整模型标识:gpt-5.6-sol

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-5.6-sol-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-5.6-sol

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": null,
  "timeout": 1800,
  "reasoning": {
    "effort": "max",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
81.05 %
测试时间未提供
7
GPT-5.5
openaigpt-5.5

完整模型标识:gpt-5.5

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-5.5-xhigh

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-5.5

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": null,
  "reasoning": {
    "effort": "xhigh",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
80.19 %
测试时间未提供
8
GPT-6 Sol
openaigpt-6-sol

完整模型标识:gpt-6-sol

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-6-sol-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-6-sol

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": 128000,
  "timeout": 1800,
  "reasoning": {
    "effort": "max",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
79.25 %
测试时间未提供
9
Kimi K3
moonshotaikimi-k3

完整模型标识:kimi-k3

厂商:moonshotai · 本轮精选

价格渠道:moonshotai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

kimi-k3

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:moonshotai · endpoint:kimi-k3

适配器:https://api.moonshot.ai/v1 · API 基址:https://api.moonshot.ai/v1

{
  "temperature": 1,
  "max_tokens": 131072,
  "stream": true,
  "reasoning_effort": "max"
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
79.19 %
测试时间未提供
10
Gemini 3.7 Flash
googlegemini-3.7-flash

完整模型标识:gemini-3.7-flash

厂商:google · 本轮精选

价格渠道:google

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gemini-3.7-flash-high

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:google · endpoint:gemini-3.7-flash

适配器:google · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "top_p": 0.95,
  "max_output_tokens": 65536,
  "thinking_config": {
    "thinking_level": "high"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
78.83 %
测试时间未提供
11
Qwen3.8 Max
alibabaqwen3.8-max

完整模型标识:qwen3.8-max

厂商:alibaba · 本轮精选

价格渠道:alibaba

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

qwen3.8-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:alibaba · endpoint:qwen3.8-max

适配器:https://dashscope-intl.aliyuncs.com/compatible-mode/v1 · API 基址:https://dashscope-intl.aliyuncs.com/compatible-mode/v1

{
  "temperature": 0.6,
  "top_p": 0.95,
  "max_tokens": 65536,
  "stream": true,
  "extra_body": {
    "enable_thinking": true
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
78.46 %
测试时间未提供
12
GPT-5.4
openaigpt-5.4

完整模型标识:gpt-5.4

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-5.4-xhigh

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-5.4

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": null,
  "reasoning": {
    "effort": "xhigh",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
77.97 %
测试时间未提供
13
GPT-5.6 Terra
openaigpt-5.6-terra

完整模型标识:gpt-5.6-terra

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-5.6-terra-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-5.6-terra

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": null,
  "reasoning": {
    "effort": "max",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
77.94 %
测试时间未提供
14
Gemini 3.1 Pro Preview
googlegemini-3.1-pro-preview

完整模型标识:gemini-3.1-pro-preview

厂商:google · 本轮精选

价格渠道:google

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gemini-3.1-pro-preview-high

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:google · endpoint:gemini-3.1-pro-preview

适配器:google · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "top_p": 0.95,
  "max_output_tokens": 65536,
  "thinking_config": {
    "thinking_level": "high"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
76.95 %
测试时间未提供
15
Claude Opus 4.7
anthropicclaude-opus-4-7

完整模型标识:claude-opus-4-7

厂商:anthropic · 本轮精选

价格渠道:anthropic

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

claude-opus-4-7-xhigh-effort

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:anthropic · endpoint:claude-opus-4-7

适配器:anthropic · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "max_tokens": 128000,
  "thinking": {
    "type": "adaptive"
  },
  "extra_body": {
    "output_config": {
      "effort": "xhigh"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

Claude版本身份依据厂商pinned-ID说明;运行条件仍独立按runner核实

固定官方运行配置 ↗
原始结果 ↗
76.53 %
测试时间未提供
16
GLM-5.3
zhipuaiglm-5.3

完整模型标识:glm-5.3

厂商:zhipuai · 本轮精选

价格渠道:zhipuai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

glm-5.3

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:zhipuai · endpoint:glm-5.3

适配器:https://api.z.ai/api/paas/v4 · API 基址:https://api.z.ai/api/paas/v4

{
  "temperature": 1,
  "top_p": 0.95,
  "max_tokens": 131072,
  "stream": true,
  "reasoning_effort": "max",
  "extra_body": {
    "thinking": {
      "type": "enabled"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
76.14 %
测试时间未提供
17
Claude Sonnet 5
anthropicclaude-sonnet-5

完整模型标识:claude-sonnet-5

厂商:anthropic · 本轮精选

价格渠道:anthropic

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

claude-sonnet-5-xhigh-effort

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:anthropic · endpoint:claude-sonnet-5

适配器:anthropic · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "max_tokens": 128000,
  "thinking": {
    "type": "adaptive"
  },
  "extra_body": {
    "output_config": {
      "effort": "xhigh"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

Claude版本身份依据厂商pinned-ID说明;运行条件仍独立按runner核实

固定官方运行配置 ↗
原始结果 ↗
76.04 %
测试时间未提供
18
Gemini 3.8 Flash
googlegemini-3.8-flash

完整模型标识:gemini-3.8-flash

厂商:google · 本轮精选

价格渠道:google

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gemini-3.8-flash-high

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:google · endpoint:gemini-3.8-flash

适配器:google · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "top_p": 0.95,
  "max_output_tokens": 65536,
  "thinking_config": {
    "thinking_level": "high"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
75.83 %
测试时间未提供
19
Claude Opus 4.6
anthropicclaude-opus-4-6

完整模型标识:claude-opus-4-6

厂商:anthropic · 本轮精选

价格渠道:anthropic

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

claude-opus-4-6-thinking-auto-high-effort

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:anthropic · endpoint:claude-opus-4-6

适配器:anthropic · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "max_tokens": 64000,
  "betas": [
    "auto-thinking-2026-01-12",
    "effort-2025-11-24"
  ],
  "thinking": {
    "type": "auto"
  },
  "extra_body": {
    "output_config": {
      "effort": "high"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

Claude版本身份依据厂商pinned-ID说明;运行条件仍独立按runner核实

固定官方运行配置 ↗
原始结果 ↗
74.52 %
测试时间未提供
20
GPT-5.6 Luna
openaigpt-5.6-luna

完整模型标识:gpt-5.6-luna

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-5.6-luna-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-5.6-luna

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_output_tokens": null,
  "reasoning": {
    "effort": "max",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
73.56 %
测试时间未提供
21
Claude Sonnet 4.6
anthropicclaude-sonnet-4-6

完整模型标识:claude-sonnet-4-6

厂商:anthropic · 本轮精选

价格渠道:anthropic

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

claude-sonnet-4-6-thinking-auto-medium-effort

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:anthropic · endpoint:claude-sonnet-4-6

适配器:anthropic · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "max_tokens": 128000,
  "betas": [
    "auto-thinking-2026-01-12",
    "effort-2025-11-24"
  ],
  "thinking": {
    "type": "auto"
  },
  "extra_body": {
    "output_config": {
      "effort": "medium"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

Claude版本身份依据厂商pinned-ID说明;运行条件仍独立按runner核实

固定官方运行配置 ↗
原始结果 ↗
72.99 %
测试时间未提供
22
Claude Opus 4.5
anthropicclaude-opus-4-5-20251101

完整模型标识:claude-opus-4-5-20251101

厂商:anthropic · 本轮精选

价格渠道:anthropic

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

claude-opus-4-5-20251101-thinking-64k-high-effort

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:anthropic · endpoint:claude-opus-4-5-20251101

适配器:anthropic · API 基址:公开配置未单独提供

{
  "temperature": 1,
  "max_tokens": 64000,
  "betas": [
    "effort-2025-11-24"
  ],
  "thinking": {
    "type": "enabled",
    "budget_tokens": 63000
  },
  "extra_body": {
    "output_config": {
      "effort": "high"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

Claude版本身份依据厂商pinned-ID说明;运行条件仍独立按runner核实

固定官方运行配置 ↗
原始结果 ↗
72.58 %
测试时间未提供
23
GPT-6 Luna
openaigpt-6-luna

完整模型标识:gpt-6-luna

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-6-luna-max

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-6-luna

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": 128000,
  "timeout": 1800,
  "reasoning": {
    "effort": "max",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
72.03 %
测试时间未提供
24
GLM-5.3-Flash
zhipuaiglm-5.3-flash

完整模型标识:glm-5.3-flash

厂商:zhipuai · 本轮精选

价格渠道:zhipuai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

glm-5.3-flash

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:zhipuai · endpoint:glm-5.3-flash

适配器:https://api.z.ai/api/paas/v4 · API 基址:https://api.z.ai/api/paas/v4

{
  "temperature": 1,
  "top_p": 0.95,
  "max_tokens": 131072,
  "stream": true,
  "reasoning_effort": "max",
  "extra_body": {
    "thinking": {
      "type": "enabled"
    }
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
71.59 %
测试时间未提供
25
GPT-5.4 nano
openaigpt-5.4-nano

完整模型标识:gpt-5.4-nano

厂商:openai · 本轮精选

价格渠道:openai

1条当前系列记录,执行设置需逐条核对

模型规格来源 ↗ · 端点价格来源 ↗

gpt-5.4-nano-xhigh

本站按原站公开聚合方法整理计算:7类均值等权,round2;非自测,非原始官方总分cell

源修订发布时间:2026-09-29T19:00:42+00:00 · 采集时间:2026-10-06T02:47:55.225562+00:00

源修订:caa4253c8a3aa93b5c7ec234e681d4f120a20240 · 数据许可:CC-BY-SA-4.0

运行渠道:openai · endpoint:gpt-5.4-nano

适配器:openai_responses · API 基址:公开配置未单独提供

{
  "temperature": null,
  "max_completion_tokens": null,
  "reasoning": {
    "effort": "xhigh",
    "summary": "auto"
  }
}

公开榜单行ID与固定官方runner配置严格对应;逐次请求日志和测试日期未公开,不表示相同effort/算力/成本

固定官方运行配置 ↗
原始结果 ↗
69.58 %
测试时间未提供
已显示 25 / 27 条
已选 0 / 4

当前渠道标价 0,限额以渠道说明为准。未知报价不等于免费。模型名称相同不代表版本相同。