ToolBench / Berkeley Function Calling
别名:ToolBench函数调用评测Function Calling工具使用BFCL
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 14 分钟 |
| 更新时间 | 📅 2026-07-16 |
| 条目编号 | ENC-BENCH-12-toolbench |
ToolBench 与 Berkeley Function Calling Leaderboard(BFCL)是评测模型「函数/工具调用」能力的基准,考察模型从大量候选工具中正确选择并生成合法参数的能力,是工具型 Agent 的底座试金石。
关键要点 ✦
- ToolBench/BFCL 评测模型的工具/函数调用能力
- 考察从大量候选中正确选型 + 生成合法参数
- 覆盖单/多工具、并行调用、多轮等多种情形
- 是工具型 Agent 底座选型的核心参考
- BFCL 持续更新,反映模型调用能力的演进
评测内容
核心任务:给定大量候选工具(可能数十到上百个)及其 Schema,模型需判断「调哪个、传什么参数」,并输出可被程序解析的合法调用。覆盖:单工具调用、多工具并行、多轮对话调用、以及「不该调用时拒绝调用」等情形。
为什么关键
工具型 Agent 的可靠性完全取决于底座的函数调用能力:选型错就做错事,参数非法就执行失败。ToolBench/BFCL 把这一能力量化,成为 Agent 框架选型底座时的重要参考——一个 BFCL 弱的模型,配再好的框架也难救。
演进
BFCL 持续扩充评测维度(如新增中文、新增复杂并行),并随模型进步调整难度,是观察行业「工具调用能力水位」的权威窗口。
🎯 应用场景
Agent 底座选型
用 BFCL 比较模型工具调用准确率。
框架适配验证
验证框架是否正确透传工具 Schema。
能力回归
模型升级后重测调用能力是否退步。
✅ 最佳实践
- 选型时同时看选型准确率与参数合法性
- 关注「不该调用时拒绝」的保守能力
- 用真实工具 Schema 规模(非玩具)做压力测
- 模型升级后重跑防调用能力回归
🔮 未来展望
工具调用评测将从「单轮选型」走向「长程工具规划」评测,并与真实 API 执行结果挂钩(不仅看调用格式,更看是否真正完成任务),进一步贴近生产。
📖 相关条目
🛠️ 相关产品
🏷️ 标签ToolBenchBFCL函数调用工具评测基准Function Calling