BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
30
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
GAIA
GAIA
· Meta + HF + AutoGPT
智能体
工具调用
S
高可信
46.2
13,202
—
1,138
GDPval
· OpenAI
智能体
工具调用
S
高可信
37.6
159,806
—
—
deepsearchqa
· google
智能体
工具调用
B
待确认
28.4
28,194
—
—
NexusRaven_API_evaluation
· Nexusflow
智能体
工具调用
B
待确认
27.3
497
—
404
τ²-bench
tau-bench
· Sierra
智能体
工具调用
S
高可信
24.3
—
1,892
416
data-product-benchmark
· ibm-research
智能体
工具调用
B
待确认
19.1
3,802
—
1
Chat2Workflow-Evaluation
· zjunlp
智能体
工具调用
B
待确认
16.3
772
—
1
ConvApparel
· google
智能体
工具调用
B
待确认
14.4
139
—
1
indic-queries-2026
· mast-benchmark
智能体
工具调用
B
待确认
14.2
247
—
—
multilingual-queries-2026
· mast-benchmark
智能体
工具调用
B
待确认
13.4
168
—
—
τ²-bench
tau-bench
· Sierra
智能体
工具调用
S
高可信
11.8
—
—
416
mcpmark
· eval-sys
智能体
工具调用
B
待确认
10.2
—
459
—
sweet_rl
· facebookresearch
智能体
工具调用
B
待确认
9.3
—
271
—
BFCL (Berkeley Function Calling)
BFCL
· UC Berkeley
智能体
工具调用
S
高可信
8.9
—
—
—
autolab
· autolabhq
智能体
工具调用
B
待确认
8.5
—
164
—
HaluMem
· MemTensor
智能体
工具调用
B
待确认
8.4
—
156
—
GateMem
· rzhub
智能体
工具调用
B
待确认
8.4
—
154
—
ScienceBoard
· OS-Copilot
智能体
工具调用
B
待确认
8.2
—
137
—
AgentKernelArena
· AMD-AGI
智能体
工具调用
B
待确认
7.9
—
112
—
DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK
· samliumay
智能体
工具调用
B
待确认
5.7
17
—
—
BFCL (Berkeley Function Calling)
· UC Berkeley
智能体
工具调用
S
高可信
0.0
—
—
—
AgentBench
· THUDM
智能体
工具调用
B
待确认
0.0
—
—
—
TwinRouterBench
· CommonstackAI
智能体
工具调用
B
待确认
0.0
—
—
—
AutomationBench
· zapier
智能体
工具调用
B
待确认
0.0
—
—
—
merchantbench
· KhanCold
智能体
工具调用
B
待确认
0.0
—
—
—
第 1 / 2 页
上一页
下一页