📊 评测基准

ToolBench / Berkeley Function Calling

别名:ToolBench函数调用评测Function Calling工具使用BFCL
分类📊 评测基准
阅读时间⏱️ 14 分钟
更新时间📅 2026-07-16
条目编号ENC-BENCH-12-toolbench
ToolBench 与 Berkeley Function Calling Leaderboard(BFCL)是评测模型「函数/工具调用」能力的基准,考察模型从大量候选工具中正确选择并生成合法参数的能力,是工具型 Agent 的底座试金石。

关键要点 ✦

评测内容

核心任务:给定大量候选工具(可能数十到上百个)及其 Schema,模型需判断「调哪个、传什么参数」,并输出可被程序解析的合法调用。覆盖:单工具调用、多工具并行、多轮对话调用、以及「不该调用时拒绝调用」等情形。

为什么关键

工具型 Agent 的可靠性完全取决于底座的函数调用能力:选型错就做错事,参数非法就执行失败。ToolBench/BFCL 把这一能力量化,成为 Agent 框架选型底座时的重要参考——一个 BFCL 弱的模型,配再好的框架也难救。

演进

BFCL 持续扩充评测维度(如新增中文、新增复杂并行),并随模型进步调整难度,是观察行业「工具调用能力水位」的权威窗口。

🎯 应用场景

Agent 底座选型
用 BFCL 比较模型工具调用准确率。
框架适配验证
验证框架是否正确透传工具 Schema。
能力回归
模型升级后重测调用能力是否退步。

✅ 最佳实践

  • 选型时同时看选型准确率与参数合法性
  • 关注「不该调用时拒绝」的保守能力
  • 用真实工具 Schema 规模(非玩具)做压力测
  • 模型升级后重跑防调用能力回归

🔮 未来展望

工具调用评测将从「单轮选型」走向「长程工具规划」评测,并与真实 API 执行结果挂钩(不仅看调用格式,更看是否真正完成任务),进一步贴近生产。

📖 相关条目

🛠️ 相关产品

🏷️ 标签ToolBenchBFCL函数调用工具评测基准Function Calling