BenchMark·Hub
Benchmark测评分类可信级别开放热度
Instruction-Following-Evaluation-for-Large-Language-Models
· harpreetsahota
语言/语义指令遵循
B待确认23.9
Gender_Bias_Evaluation_Set
· flax-sentence-embeddings
安全对齐偏见公平
B待确认23.8
MEGA-Bench
· TIGER-Lab
多模态视觉语言
B待确认23.8
svg-benchmark
· Rapidata
多模态文生图
B待确认23.6
IndicGenBench_xquad_in
· google
知识问答通用问答
B待确认23.5
ValuePrism
· allenai
安全对齐对齐安全
B待确认23.2
MultiBanana-Benchmark
· kohsei
多模态文生图
B待确认23.0
IneqMath
· AI4Math
数学竞赛数学
B待确认23.0
MMDocIR_Evaluation_Dataset
· MMDocIR
长上下文长文档
B待确认22.9
IndicGenBench_crosssum_in
· google
语言/语义摘要
B待确认22.8
IndicGenBench_xorqa_in
· google
知识问答通用问答
B待确认22.8
llm-system-prompts-benchmark
· Naomibas
写作对话指令遵循
B待确认22.4
StructEval
· TIGER-Lab
推理结构化输出
B待确认22.4
HealthBench
· OpenAI
垂直领域医疗
S高可信22.4
novalad-evaluation
· codewithaman
垂直领域通用行业
B待确认22.2
climate-evaluation
· eci-io
垂直领域科学
B待确认22.2
reveal
· google
推理通用推理
B待确认22.1
gooaq
· allenai
知识问答通用问答
B待确认22.1
lila
· allenai
数学通用数学
B待确认22.1
VideoScore-Bench
· TIGER-Lab
多模态视频
B待确认22.0
PDE_Inverse_Problem_Benchmarking
· DabbyOWL
垂直领域科学
B待确认21.7
VideoEval-Pro
· TIGER-Lab
多模态视频
B待确认21.7
Entity-Imagen
· TIGER-Lab
多模态文生图
B待确认21.7
xyzibd
· bop-benchmark
多模态视觉语言
B待确认21.6
csabstruct
· allenai
语言/语义分类
B待确认21.6
6 / 18