| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
Humanity's Last Exam HLE· CAIS + Scale AI | 知识问答考试问答 | S高可信 | 40.3 | |
MathVista · UCLA | 多模态视觉语言 | S高可信 | 40.0 | |
hendrycks-MATH-benchmark MATH· nlile | 数学竞赛数学 | B待确认 | 40.0 | |
DocVQA DocVQA· 多家 | 多模态文档/OCR | S高可信 | 39.9 | |
qasper · allenai | 知识问答通用问答 | B待确认 | 39.6 | |
aqua_rat · deepmind | 数学通用数学 | B待确认 | 39.4 | |
xtreme · google | 语言/语义多语低资源 | B待确认 | 38.8 | |
MedQA MedQA· 多家 | 垂直领域医疗 | S高可信 | 38.2 | |
CMMLU · MBZUAI | 中文中文通用 | S高可信 | 38.1 | |
LongBench v2 LongBench· THUDM | 长上下文长文档 | S高可信 | 37.7 | |
GDPval · OpenAI | 智能体工具调用 | S高可信 | 37.6 | |
MMMU-Pro MMMU· 多家 | 多模态视觉语言 | S高可信 | 36.7 | |
speech_commands · google | 多模态音频 | B待确认 | 36.6 | |
code_x_glue_ct_code_to_text · google | 代码代码生成 | B待确认 | 36.5 | |
xquad · google | 知识问答通用问答 | B待确认 | 36.4 | |
narrativeqa · deepmind | 长上下文长文档 | B待确认 | 36.4 | |
wildjailbreak · allenai | 安全对齐越狱攻防 | B待确认 | 36.4 | |
WMDP · 学术联盟 | 安全对齐对齐安全 | S高可信 | 36.2 | |
math_dataset MATH· deepmind | 数学通用数学 | B待确认 | 36.1 | |
qasc · allenai | 知识问答考试问答 | B待确认 | 36.1 | |
LegalBench · Stanford 等 | 垂直领域法律 | S高可信 | 36.0 | |
mrcr · openai | 长上下文针检索 | B待确认 | 35.9 | |
frames-benchmark · google | 长上下文检索上下文 | B待确认 | 35.5 | |
civil_comments · google | 安全对齐偏见公平 | B待确认 | 35.5 | |
BLINK · BLINK-Benchmark | 多模态视觉语言 | B待确认 | 35.3 |