| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
MMLU-Pro MMLU· TIGER-Lab | 知识问答通用问答 | S高可信 | 66.0 | |
ai2_arc ARC· allenai | 知识问答考试问答 | B待确认 | 54.7 | |
MMLU MMLU· UC Berkeley | 知识问答通用问答 | S高可信 | 51.5 | |
GPQA Diamond GPQA· NYU 等 | 知识问答考试问答 | S高可信 | 46.0 | |
TruthfulQA TruthfulQA· 多家 | 知识问答事实性 | S高可信 | 45.6 | |
sciq · allenai | 知识问答考试问答 | B待确认 | 45.2 | |
MMMLU · openai | 知识问答通用问答 | B待确认 | 44.3 | |
boolq BoolQ· google | 知识问答通用问答 | B待确认 | 42.5 | |
Humanity's Last Exam HLE· CAIS + Scale AI | 知识问答考试问答 | S高可信 | 40.3 | |
qasper · allenai | 知识问答通用问答 | B待确认 | 39.6 | |
xquad · google | 知识问答通用问答 | B待确认 | 36.4 | |
qasc · allenai | 知识问答考试问答 | B待确认 | 36.1 | |
quac · allenai | 知识问答通用问答 | B待确认 | 33.1 | |
WildBench · allenai | 知识问答通用问答 | B待确认 | 32.5 | |
simpleqa-verified SimpleQA· google | 知识问答事实性 | B待确认 | 28.8 | |
LiveBench · Abacus.AI | 知识问答通用问答 | S高可信 | 28.7 | |
narrativeqa_manual · deepmind | 知识问答通用问答 | B待确认 | 25.8 | |
IndicGenBench_xquad_in · google | 知识问答通用问答 | B待确认 | 23.5 | |
IndicGenBench_xorqa_in · google | 知识问答通用问答 | B待确认 | 22.8 | |
gooaq · allenai | 知识问答通用问答 | B待确认 | 22.1 | |
granola-entity-questions · google | 知识问答事实性 | B待确认 | 20.6 | |
WikiProfile · google | 知识问答事实性 | B待确认 | 20.5 | |
FACTS-grounding-public · google | 知识问答事实性 | B待确认 | 18.7 | |
hle-rolling HLE· cais | 知识问答通用问答 | B待确认 | 15.9 | |
ArXivSQA · AI-dataset-evaluation-team | 知识问答考试问答 | B待确认 | 12.6 |
第 1 / 2 页
上一页下一页