BenchMark·Hub
Benchmark测评分类可信级别开放热度
MMLU-Pro
MMLU· TIGER-Lab
知识问答通用问答
S高可信66.0
HumanEval
HumanEval· OpenAI
代码代码生成
S高可信61.5
GSM8K
GSM8K· OpenAI
数学通用数学
S高可信60.4
SWE-bench Verified
SWE-bench· Princeton + OpenAI
代码仓库级代码
S高可信58.9
MBPP
MBPP· Google
代码代码生成
S高可信56.1
IFEval
IFEval· google
写作对话指令遵循
B待确认56.1
ai2_arc
ARC· allenai
知识问答考试问答
B待确认54.7
MMMU
MMMU· 多家
多模态视觉语言
S高可信54.4
MMLU
MMLU· UC Berkeley
知识问答通用问答
S高可信51.5
Video-MME
· 多家
多模态视频
S高可信51.4
SWE-bench Lite
SWE-bench· princeton-nlp
代码代码生成
B待确认49.9
fleurs
· google
多模态音频
B待确认48.6
GAIA
GAIA· Meta + HF + AutoGPT
智能体工具调用
S高可信46.2
GPQA Diamond
GPQA· NYU 等
知识问答考试问答
S高可信46.0
TruthfulQA
TruthfulQA· 多家
知识问答事实性
S高可信45.6
code_contests
· deepmind
代码代码生成
B待确认45.6
sciq
· allenai
知识问答考试问答
B待确认45.2
SWE-bench
SWE-bench· princeton-nlp
代码代码生成
B待确认44.5
MMMLU
· openai
知识问答通用问答
B待确认44.3
LiveCodeBench
LiveCodeBench· UC Berkeley 等
代码代码生成
S高可信43.0
boolq
BoolQ· google
知识问答通用问答
B待确认42.5
C-Eval
· 上交/清华
中文中文通用
S高可信42.5
real-toxicity-prompts
· allenai
安全对齐越狱攻防
B待确认41.5
olmOCR-bench
· allenai
多模态文档/OCR
B待确认41.0
BigCodeBench
BigCodeBench· BigCode
代码代码生成
S高可信40.3
1 / 18
上一页下一页