函数调用:核查模型、模式和真实限制

现有 LiveBench 编程或综合分不能代替函数调用成功率。BFCL V4 补充原生FC、多轮调用、记忆与搜索子任务;它也不能证明你的严格JSON Schema、业务函数或工具集表现。

Claude Opus 4.5 · claude-opus-4-5-20251101-FC

覆盖仅1/44个精选版本。固定官方runner registry对应精确ID claude-opus-4-5-20251101;FC是评测模式,不是新版模型。不能移动成绩到其他Opus版本。Prompt模式独立保留在源表,本页不合并它。

Overall Acc
77.47%
Non-Live AST Acc
88.58%
Live Acc
79.79%
Multi Turn Acc
68.38%
Web Search Acc
84.5%
Memory Acc
73.76%

实际API URL、完整运行参数和评测时间均未知。目录日期及许可提交日期不作为测试时间;采集时间 2026-10-06T16:52:56.921228+00:00 仅表示本站读取。这里是独立补充证据,不进入原主榜、共享可比交集或自动任务推荐。

若你要比较两个模型的函数调用,请先获得两者同任务、同模式、同版本配置证据;其余版本没有本页可用结果,不等于不支持函数调用。

固定原始结果与分类 · 精确模型registry映射 · 随附Apache-2.0许可证

BFCL / Berkeley Function Calling Leaderboard contributors; BFCL-Result by HuanzhiMao. BenchScore selected one row and normalized percentage fields; not an endorsement. 来源修订 cadd76a8dc62984e7bf15ecaf358f070bae745cc。固定资料暂不随日更自动更新;新的数据和运行条件先进入审查。

用该模型形成任务与成本验证方案 · 精确模型详情

其他任务 · 全部来源范围