BenchMark·Hub
Benchmark测评分类可信级别开放热度
Humanity's Last Exam
HLE· CAIS + Scale AI
知识问答考试问答
S高可信40.3
MathVista
· UCLA
多模态视觉语言
S高可信40.0
hendrycks-MATH-benchmark
MATH· nlile
数学竞赛数学
B待确认40.0
DocVQA
DocVQA· 多家
多模态文档/OCR
S高可信39.9
qasper
· allenai
知识问答通用问答
B待确认39.6
aqua_rat
· deepmind
数学通用数学
B待确认39.4
xtreme
· google
语言/语义多语低资源
B待确认38.8
MedQA
MedQA· 多家
垂直领域医疗
S高可信38.2
CMMLU
· MBZUAI
中文中文通用
S高可信38.1
LongBench v2
LongBench· THUDM
长上下文长文档
S高可信37.7
GDPval
· OpenAI
智能体工具调用
S高可信37.6
MMMU-Pro
MMMU· 多家
多模态视觉语言
S高可信36.7
speech_commands
· google
多模态音频
B待确认36.6
code_x_glue_ct_code_to_text
· google
代码代码生成
B待确认36.5
xquad
· google
知识问答通用问答
B待确认36.4
narrativeqa
· deepmind
长上下文长文档
B待确认36.4
wildjailbreak
· allenai
安全对齐越狱攻防
B待确认36.4
WMDP
· 学术联盟
安全对齐对齐安全
S高可信36.2
math_dataset
MATH· deepmind
数学通用数学
B待确认36.1
qasc
· allenai
知识问答考试问答
B待确认36.1
LegalBench
· Stanford 等
垂直领域法律
S高可信36.0
mrcr
· openai
长上下文针检索
B待确认35.9
frames-benchmark
· google
长上下文检索上下文
B待确认35.5
civil_comments
· google
安全对齐偏见公平
B待确认35.5
BLINK
· BLINK-Benchmark
多模态视觉语言
B待确认35.3
2 / 18