BenchMark·Hub
Benchmark测评分类可信级别开放热度
snips_built_in_intents
· sonos-nlu-benchmark
语言/语义NLU
B待确认30.2
M-BEIR
· TIGER-Lab
多模态检索/Embedding
B待确认30.0
code_x_glue_tc_nl_code_search_adv
· google
代码代码生成
B待确认29.9
code_x_glue_cc_cloze_testing_all
· google
代码代码生成
B待确认29.7
BeaverTails-Evaluation
· PKU-Alignment
安全对齐对齐安全
B待确认29.7
TheoremQA
· TIGER-Lab
数学通用数学
B待确认29.6
winogrande
Winogrande· allenai
推理通用推理
B待确认29.4
GAIA-2
GAIA· Meta + HF
智能体环境控制
S高可信29.3
prosocial-dialog
· allenai
安全对齐对齐安全
B待确认28.8
MMEB-eval
· TIGER-Lab
多模态视觉语言
B待确认28.8
simpleqa-verified
SimpleQA· google
知识问答事实性
B待确认28.8
LiveBench
· Abacus.AI
知识问答通用问答
S高可信28.7
Video-MME-v2
· MME-Benchmarks
多模态视频
B待确认28.6
code_x_glue_cc_cloze_testing_maxmin
· google
代码代码生成
B待确认28.5
quoref
· allenai
推理通用推理
B待确认28.5
deepsearchqa
· google
智能体工具调用
B待确认28.4
MMEB-V2
· TIGER-Lab
多模态检索/Embedding
B待确认28.2
scitldr
· allenai
写作对话摘要
B待确认28.0
frontierscience
· openai
垂直领域科学
B待确认27.9
code_x_glue_tt_text_to_text
· google
代码代码生成
B待确认27.8
HELMET
· princeton-nlp
长上下文长文档
B待确认27.6
NexusRaven_API_evaluation
· Nexusflow
智能体工具调用
B待确认27.3
code_x_glue_tc_text_to_code
· google
代码代码生成
B待确认27.3
multi_lexsum
· allenai
垂直领域法律
B待确认27.1
VideoFeedback
· TIGER-Lab
多模态视频
B待确认27.0
4 / 18