BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
snips_built_in_intents
· sonos-nlu-benchmark
语言/语义
NLU
B
待确认
30.2
1,067
—
931
M-BEIR
· TIGER-Lab
多模态
检索/Embedding
B
待确认
30.0
3,158
—
197
code_x_glue_tc_nl_code_search_adv
· google
代码
代码生成
B
待确认
29.9
619
—
1,585
code_x_glue_cc_cloze_testing_all
· google
代码
代码生成
B
待确认
29.7
285
—
4,239
BeaverTails-Evaluation
· PKU-Alignment
安全对齐
对齐安全
B
待确认
29.7
708
—
1,030
TheoremQA
· TIGER-Lab
数学
通用数学
B
待确认
29.6
2,389
—
253
winogrande
Winogrande
· allenai
推理
通用推理
B
待确认
29.4
225,670
—
—
GAIA-2
GAIA
· Meta + HF
智能体
环境控制
S
高可信
29.3
12,056
—
25
prosocial-dialog
· allenai
安全对齐
对齐安全
B
待确认
28.8
865
—
162
MMEB-eval
· TIGER-Lab
多模态
视觉语言
B
待确认
28.8
1,967
—
231
simpleqa-verified
SimpleQA
· google
知识问答
事实性
B
待确认
28.8
5,646
—
39
LiveBench
· Abacus.AI
知识问答
通用问答
S
高可信
28.7
—
1,295
210
Video-MME-v2
· MME-Benchmarks
多模态
视频
B
待确认
28.6
7,287
—
29
code_x_glue_cc_cloze_testing_maxmin
· google
代码
代码生成
B
待确认
28.5
221
—
4,239
quoref
· allenai
推理
通用推理
B
待确认
28.5
2,621
—
190
deepsearchqa
· google
智能体
工具调用
B
待确认
28.4
28,194
—
—
MMEB-V2
· TIGER-Lab
多模态
检索/Embedding
B
待确认
28.2
3,332
—
99
scitldr
· allenai
写作对话
摘要
B
待确认
28.0
650
—
287
frontierscience
· openai
垂直领域
科学
B
待确认
27.9
70,173
—
—
code_x_glue_tt_text_to_text
· google
代码
代码生成
B
待确认
27.8
484
—
1,585
HELMET
· princeton-nlp
长上下文
长文档
B
待确认
27.6
2,617
—
119
NexusRaven_API_evaluation
· Nexusflow
智能体
工具调用
B
待确认
27.3
497
—
404
code_x_glue_tc_text_to_code
· google
代码
代码生成
B
待确认
27.3
755
—
191
multi_lexsum
· allenai
垂直领域
法律
B
待确认
27.1
1,994
—
69
VideoFeedback
· TIGER-Lab
多模态
视频
B
待确认
27.0
576
—
201
第 4 / 18 页
上一页
下一页