BenchMark·Hub
Benchmark测评分类可信级别开放热度
code_evaluation_prompts
· HuggingFaceH4
代码代码生成
B待确认11.5
ATLAS
· VILA-Lab
推理提示词/查询
B待确认11.5
scrapinghub-article-extraction-benchmark
· allenai
垂直领域通用行业
B待确认11.4
PIXIU
· The-FinAI
垂直领域金融
B待确认11.3
ruCommonVQA
· MERA-evaluation
多模态视觉语言
B待确认11.3
ruNaturalScienceVQA
· MERA-evaluation
多模态视觉语言
B待确认11.3
wmt-mqm-human-evaluation
· RicardoRei
语言/语义翻译
B待确认11.2
exploitgym
· sunblaze-ucb
安全对齐越狱攻防
B待确认11.2
mittens
· google
安全对齐偏见公平
B待确认10.9
ragu_benchmarks
· RaguTeam
长上下文检索上下文
B待确认10.9
Vision-DeepResearch
· Osilly
多模态视觉语言
B待确认10.8
OpenLane-V2
· OpenDriveLab
多模态视觉语言
B待确认10.8
mup
· allenai
写作对话摘要
B待确认10.8
codefuse-devops-eval
· codefuse-ai
垂直领域通用行业
B待确认10.8
NTEU_Multilingual_Evaluation_Dataset
· BSC-LT
语言/语义翻译
B待确认10.7
FrontierMath
· Epoch AI
数学竞赛数学
S高可信10.6
LoraxBench
· google
语言/语义多语低资源
B待确认10.6
equity_evaluation_corpus
· peixian
安全对齐偏见公平
B待确认10.5
meta-agents-research-environments
· facebookresearch
智能体环境控制
B待确认10.5
TTS-Voice-Design-Benchmark
· BreezeBlue
多模态音频
B待确认10.3
LLMs-Planning
· karthikv792
推理通用推理
B待确认10.3
phyre
· facebookresearch
推理通用推理
B待确认10.2
mcpmark
· eval-sys
智能体工具调用
B待确认10.2
Visual-CoT
· deepcs233
多模态视觉语言
B待确认10.2
formal-grammar-llm-benchmark
· hoisoserious
推理通用推理
B待确认10.1
12 / 18