BenchMark·Hub
Benchmark测评分类可信级别开放热度
German-RAG-LLM-HARD-BENCHMARK
· avemio
长上下文检索上下文
B待确认21.4
RLPR-Evaluation
· openbmb
推理通用推理
B待确认21.4
svq
· google
多模态音频
B待确认21.4
LLM_Benchmark
· Bokhbat
语言/语义多语低资源
B待确认21.4
zest
· allenai
推理通用推理
B待确认21.3
MASK
· cais
安全对齐对齐安全
B待确认21.3
code_generation
· livecodebench
代码代码生成
B待确认21.0
plant-genomic-benchmark
· InstaDeepAI
垂直领域生物
B待确认21.0
pdfQA-Benchmark
· pdfqa
长上下文长文档
B待确认21.0
granola-entity-questions
· google
知识问答事实性
B待确认20.6
German-RAG-LLM-EASY-BENCHMARK
· avemio
长上下文检索上下文
B待确认20.6
BrowseCompLongContext
· openai
长上下文检索上下文
B待确认20.5
WikiProfile
· google
知识问答事实性
B待确认20.5
seahorse_summarization_evaluation
· tasksource
写作对话摘要
B待确认20.2
graphwalks
· openai
推理通用推理
B待确认20.2
prompt-injections-benchmark
· rogue-security
安全对齐越狱攻防
B待确认20.2
EditReward-Bench
· TIGER-Lab
多模态视觉语言
B待确认20.2
NLU-Evaluation-Data-en-de
· deutsche-telekom
语言/语义NLU
B待确认19.9
genomics-long-range-benchmark
· InstaDeepAI
垂直领域生物
B待确认19.6
bigcodebench-hard
BigCodeBench· bigcode
代码代码生成
B待确认19.5
RSRCC
· google
多模态视觉语言
B待确认19.5
healthbench-professional
· openai
垂直领域医疗
B待确认19.4
cvdp-benchmark-dataset
· nvidia
代码代码生成
B待确认19.3
data-product-benchmark
· ibm-research
智能体工具调用
B待确认19.1
TheoremExplainBench
· TIGER-Lab
数学通用数学
B待确认19.0
7 / 18