函数调用:核查模型、模式和真实限制
现有 LiveBench 编程或综合分不能代替函数调用成功率。BFCL V4 补充原生FC、多轮调用、记忆与搜索子任务;它也不能证明你的严格JSON Schema、业务函数或工具集表现。
Claude Opus 4.5 · claude-opus-4-5-20251101-FC
覆盖仅1/44个精选版本。固定官方runner registry对应精确ID claude-opus-4-5-20251101;FC是评测模式,不是新版模型。不能移动成绩到其他Opus版本。Prompt模式独立保留在源表,本页不合并它。
- Overall Acc
- 77.47%
- Non-Live AST Acc
- 88.58%
- Live Acc
- 79.79%
- Multi Turn Acc
- 68.38%
- Web Search Acc
- 84.5%
- Memory Acc
- 73.76%
实际API URL、完整运行参数和评测时间均未知。目录日期及许可提交日期不作为测试时间;采集时间 2026-10-06T16:52:56.921228+00:00 仅表示本站读取。这里是独立补充证据,不进入原主榜、共享可比交集或自动任务推荐。
若你要比较两个模型的函数调用,请先获得两者同任务、同模式、同版本配置证据;其余版本没有本页可用结果,不等于不支持函数调用。
固定原始结果与分类 · 精确模型registry映射 · 随附Apache-2.0许可证BFCL / Berkeley Function Calling Leaderboard contributors; BFCL-Result by HuanzhiMao. BenchScore selected one row and normalized percentage fields; not an endorsement. 来源修订 cadd76a8dc62984e7bf15ecaf358f070bae745cc。固定资料暂不随日更自动更新;新的数据和运行条件先进入审查。
其他任务 · 全部来源范围