方法 / 保留不确定性

数据说明

关于本站

BenchScore 是独立数据整理站,不是模型厂商或评测机构。 本站展示的第三方结果不代表原评测机构对本站的认可。 我们希望你既看见数据,也看见它能回答和不能回答的问题。

模型与价格

参数与渠道报价来自 Models.dev 的 MIT 开源数据库。价格统一为 USD / 百万 token,保留上游模型 ID;不能把模型目录创建时间当作发布日期。

  • 未知值用“暂无数据”或“暂无报价”表示,不补成 0。
  • 标价 0 只表示当前渠道报价为零,额度和使用限制以渠道为准。
  • 仅计算文本输入与输出;缓存、图片、音频、工具、长上下文阶梯费率另计。
  • 人民币换算因子由用户设置,默认 7.0,是估算因子,不是实时汇率。

公开评测的比较边界

2026-06-25 系列逐配置展示,23 个任务按官方 7 类聚合:先各类均值,再 7 类等权均值并保留两位小数。本站按原站公开聚合方法整理计算,不是自测或原始官方总分 cell。只有固定官方 runner 中同一行 ID、同一 endpoint 与具体设置已核实的记录才纳入严格单模型系列。

不同 effort、thinking、输出上限和渠道设置分别披露,不是等算力、等成本或统一 effort 的公平比较。公开配置证据不等于逐次请求日志;测试时间仍未知。网站默认 best 配置不表示全部行都是不同模型,本站不合并配置或补齐缺失条件。

Grok 4.7 的两题混合 agentic 结果按研究披露排除;Fable 5 的 fallback 配置不纳入单模型榜。Fable 5.1 在固定配置中明确没有 fallback,可按独立核实的配置收录。未提供同 ID 配置的 Opus/Sonnet 新行不因 Claude pinned 身份就推定运行条件已知。

历史系列保留 LiveBench 2024-06-24 数据集的 Connections 子任务,覆盖 10条精确版本记录。原发布者报告采用单轮、temperature 0 以及各模型对应的 FastChat 模板。数据基于其原始协议,不表示固定算力或同等花费的比较。

Connections 衡量词语分组任务的得分,保留 CSV 的 0–100 百分制,绝不作为整体能力总分。没有从不完整的题目结果重算官方成绩。

系列由来源、benchmark、metric、数据集版本、比较设置、单位、排序方向共同确定。不同系列不混排,条件未知的记录不进入排名。

按展示精度(两位小数)判断同分,采用 1、2、2、4 的竞赛名次;null 不排名,合法 0 分会排名。同分按稳定模型 ID 排序。小数差异不代表统计显著性。

原始论文及评测设置 ↗

时间与版本

模型发布日期、源资料更新日期、源修订发布时间、采集时间、报价生效日期、数据集版本和测试时间分别记录。未提供的报价生效日期保持未知,不能以采集时间或模型发布日期替代。历史数据集日期不能代替模型测试日期;本批 CSV 没有提供测试时间,因此明确标为未知。

只通过明确的原始 ID 映射版本,不靠模型名称猜测。2024 历史成绩不会赋给今天的同名别名。评测超过 90 天标为历史;测试日期未知时不称“最新”。报价超过 72 小时提示待更新。

更新与异常保护

目录刷新先形成候选快照,通过结构、引用、许可字段和数量校验后才替换有效文件。上游限流、超时、坏 JSON、数量减少超过 20% 会阻止替换。

旧数据只有在来源授权仍有效时才可保留。每天自动检查已核实配置的成绩与原生渠道报价;有实质变化且生产验收通过后发布。新模型、配置与评测协议变化先进入待核实列表,不自动纳入。

本地流程事件与隐私

浏览器仅发出本地 benchscore:event 事件,包含固定事件名称、有效候选数和本站快照标识;不上传或记录业务文本、API密钥、私人提示词、完整URL或用户身份。当前没有外部分析接收服务,实际流量和转化率尚未统计。

合格对比的分母是至少两个有效候选的当前比较会话;完成须主动查看关键差异并检查证据或费用。分享生成、复制成功与接收链接分别记录;复制不代表他人已使用。模型列表链接只恢复候选,费用输入仍为当前页面假设。

使用许可

Models.dev 元数据保留 MIT 声明。LiveBench 官网声明 CC BY-SA 4.0;本网站选取和整理的评测数据及合并公开快照遵循同一 ShareAlike 许可,保留来源、署名和修改说明。原机构不为本站背书。

查看完整来源登记 →