BenchMark·Hub
Benchmark测评分类可信级别开放热度
GAIA
GAIA· Meta + HF + AutoGPT
智能体工具调用
S高可信46.2
GDPval
· OpenAI
智能体工具调用
S高可信37.6
deepsearchqa
· google
智能体工具调用
B待确认28.4
NexusRaven_API_evaluation
· Nexusflow
智能体工具调用
B待确认27.3
τ²-bench
tau-bench· Sierra
智能体工具调用
S高可信24.3
data-product-benchmark
· ibm-research
智能体工具调用
B待确认19.1
Chat2Workflow-Evaluation
· zjunlp
智能体工具调用
B待确认16.3
ConvApparel
· google
智能体工具调用
B待确认14.4
indic-queries-2026
· mast-benchmark
智能体工具调用
B待确认14.2
multilingual-queries-2026
· mast-benchmark
智能体工具调用
B待确认13.4
τ²-bench
tau-bench· Sierra
智能体工具调用
S高可信11.8
mcpmark
· eval-sys
智能体工具调用
B待确认10.2
sweet_rl
· facebookresearch
智能体工具调用
B待确认9.3
BFCL (Berkeley Function Calling)
BFCL· UC Berkeley
智能体工具调用
S高可信8.9
autolab
· autolabhq
智能体工具调用
B待确认8.5
HaluMem
· MemTensor
智能体工具调用
B待确认8.4
GateMem
· rzhub
智能体工具调用
B待确认8.4
ScienceBoard
· OS-Copilot
智能体工具调用
B待确认8.2
AgentKernelArena
· AMD-AGI
智能体工具调用
B待确认7.9
DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK
· samliumay
智能体工具调用
B待确认5.7
BFCL (Berkeley Function Calling)
· UC Berkeley
智能体工具调用
S高可信0.0
AgentBench
· THUDM
智能体工具调用
B待确认0.0
TwinRouterBench
· CommonstackAI
智能体工具调用
B待确认0.0
AutomationBench
· zapier
智能体工具调用
B待确认0.0
merchantbench
· KhanCold
智能体工具调用
B待确认0.0
1 / 2
上一页下一页