| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
MMLU-Pro MMLU· TIGER-Lab | 知识问答通用问答 | S高可信 | 66.0 | |
HumanEval HumanEval· OpenAI | 代码代码生成 | S高可信 | 61.5 | |
GSM8K GSM8K· OpenAI | 数学通用数学 | S高可信 | 60.4 | |
SWE-bench Verified SWE-bench· Princeton + OpenAI | 代码仓库级代码 | S高可信 | 58.9 | |
MBPP MBPP· Google | 代码代码生成 | S高可信 | 56.1 | |
IFEval IFEval· google | 写作对话指令遵循 | B待确认 | 56.1 | |
ai2_arc ARC· allenai | 知识问答考试问答 | B待确认 | 54.7 | |
MMMU MMMU· 多家 | 多模态视觉语言 | S高可信 | 54.4 | |
MMLU MMLU· UC Berkeley | 知识问答通用问答 | S高可信 | 51.5 | |
Video-MME · 多家 | 多模态视频 | S高可信 | 51.4 | |
SWE-bench Lite SWE-bench· princeton-nlp | 代码代码生成 | B待确认 | 49.9 | |
fleurs · google | 多模态音频 | B待确认 | 48.6 | |
GAIA GAIA· Meta + HF + AutoGPT | 智能体工具调用 | S高可信 | 46.2 | |
GPQA Diamond GPQA· NYU 等 | 知识问答考试问答 | S高可信 | 46.0 | |
TruthfulQA TruthfulQA· 多家 | 知识问答事实性 | S高可信 | 45.6 | |
code_contests · deepmind | 代码代码生成 | B待确认 | 45.6 | |
sciq · allenai | 知识问答考试问答 | B待确认 | 45.2 | |
SWE-bench SWE-bench· princeton-nlp | 代码代码生成 | B待确认 | 44.5 | |
MMMLU · openai | 知识问答通用问答 | B待确认 | 44.3 | |
LiveCodeBench LiveCodeBench· UC Berkeley 等 | 代码代码生成 | S高可信 | 43.0 | |
boolq BoolQ· google | 知识问答通用问答 | B待确认 | 42.5 | |
C-Eval · 上交/清华 | 中文中文通用 | S高可信 | 42.5 | |
real-toxicity-prompts · allenai | 安全对齐越狱攻防 | B待确认 | 41.5 | |
olmOCR-bench · allenai | 多模态文档/OCR | B待确认 | 41.0 | |
BigCodeBench BigCodeBench· BigCode | 代码代码生成 | S高可信 | 40.3 |
第 1 / 18 页
上一页下一页