| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
MusicCaps · google | 多模态音频 | B待确认 | 35.2 | |
pg19 · deepmind | 长上下文长文档 | B待确认 | 35.1 | |
bigbench · google | 推理通用推理 | B待确认 | 34.4 | |
cosmos_qa · allenai | 推理通用推理 | B待确认 | 34.0 | |
swag · allenai | 推理通用推理 | B待确认 | 33.9 | |
humanevalpack · bigcode | 代码代码生成 | B待确认 | 33.8 | |
MathVerse · AI4Math | 数学通用数学 | B待确认 | 33.7 | |
GenAI-Bench · TIGER-Lab | 多模态视觉语言 | B待确认 | 33.5 | |
ropes · allenai | 推理通用推理 | B待确认 | 33.4 | |
quac · allenai | 知识问答通用问答 | B待确认 | 33.1 | |
AgentHarm · UK AISI | 安全对齐越狱攻防 | S高可信 | 32.9 | |
WildBench · allenai | 知识问答通用问答 | B待确认 | 32.5 | |
lm1b · billion-word-benchmark | 语言/语义语言建模 | B待确认 | 32.1 | |
openai-moderation-api-evaluation · mmathys | 安全对齐对齐安全 | B待确认 | 32.1 | |
CharXiv · princeton-nlp | 多模态图表表格 | B待确认 | 32.0 | |
art · allenai | 推理通用推理 | B待确认 | 31.8 | |
soda · allenai | 写作对话对话写作 | B待确认 | 31.2 | |
ClawBench · TIGER-Lab | 智能体网页导航 | B待确认 | 31.1 | |
aya_evaluation_suite · CohereLabs | 写作对话对话写作 | B待确认 | 31.0 | |
AlGhafa-Arabic-LLM-Benchmark-Native · OALL | 语言/语义多语低资源 | B待确认 | 31.0 | |
code_x_glue_cc_code_to_code_trans · google | 代码代码生成 | B待确认 | 31.0 | |
coconot · allenai | 安全对齐对齐安全 | B待确认 | 30.7 | |
Food_Portion_Benchmark · richtext | 多模态视觉语言 | B待确认 | 30.6 | |
RoboDojo · RoboDojo-Benchmark | 智能体机器人 | B待确认 | 30.5 | |
code_x_glue_cc_code_refinement · google | 代码代码生成 | B待确认 | 30.2 |