| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
MMLU-Pro MMLU· TIGER-Lab | 知识问答通用问答 | S高可信 | 66.0 | |
MMLU MMLU· UC Berkeley | 知识问答通用问答 | S高可信 | 51.5 | |
MMMLU · openai | 知识问答通用问答 | B待确认 | 44.3 | |
boolq BoolQ· google | 知识问答通用问答 | B待确认 | 42.5 | |
qasper · allenai | 知识问答通用问答 | B待确认 | 39.6 | |
xquad · google | 知识问答通用问答 | B待确认 | 36.4 | |
quac · allenai | 知识问答通用问答 | B待确认 | 33.1 | |
WildBench · allenai | 知识问答通用问答 | B待确认 | 32.5 | |
LiveBench · Abacus.AI | 知识问答通用问答 | S高可信 | 28.7 | |
narrativeqa_manual · deepmind | 知识问答通用问答 | B待确认 | 25.8 | |
IndicGenBench_xquad_in · google | 知识问答通用问答 | B待确认 | 23.5 | |
IndicGenBench_xorqa_in · google | 知识问答通用问答 | B待确认 | 22.8 | |
gooaq · allenai | 知识问答通用问答 | B待确认 | 22.1 | |
hle-rolling HLE· cais | 知识问答通用问答 | B待确认 | 15.9 | |
Quad_benchmark_cqa_latest · LLM-Beetle | 知识问答通用问答 | B待确认 | 4.1 | |
yet-another-applied-llm-benchmark · carlini | 知识问答通用问答 | B待确认 | 0.0 |