BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
Instruction-Following-Evaluation-for-Large-Language-Models
· harpreetsahota
语言/语义
指令遵循
B
待确认
23.9
53
—
1,060
Gender_Bias_Evaluation_Set
· flax-sentence-embeddings
安全对齐
偏见公平
B
待确认
23.8
154
—
476
MEGA-Bench
· TIGER-Lab
多模态
视觉语言
B
待确认
23.8
666
—
41
svg-benchmark
· Rapidata
多模态
文生图
B
待确认
23.6
1,417
—
—
IndicGenBench_xquad_in
· google
知识问答
通用问答
B
待确认
23.5
601
—
77
ValuePrism
· allenai
安全对齐
对齐安全
B
待确认
23.2
161
—
132
MultiBanana-Benchmark
· kohsei
多模态
文生图
B
待确认
23.0
7,050
—
6
IneqMath
· AI4Math
数学
竞赛数学
B
待确认
23.0
992
—
25
MMDocIR_Evaluation_Dataset
· MMDocIR
长上下文
长文档
B
待确认
22.9
476
—
52
IndicGenBench_crosssum_in
· google
语言/语义
摘要
B
待确认
22.8
368
—
77
IndicGenBench_xorqa_in
· google
知识问答
通用问答
B
待确认
22.8
552
—
77
llm-system-prompts-benchmark
· Naomibas
写作对话
指令遵循
B
待确认
22.4
267
—
56
StructEval
· TIGER-Lab
推理
结构化输出
B
待确认
22.4
795
—
35
HealthBench
· OpenAI
垂直领域
医疗
S
高可信
22.4
4,177
—
—
novalad-evaluation
· codewithaman
垂直领域
通用行业
B
待确认
22.2
233
—
371
climate-evaluation
· eci-io
垂直领域
科学
B
待确认
22.2
459
—
79
reveal
· google
推理
通用推理
B
待确认
22.1
103
—
86
gooaq
· allenai
知识问答
通用问答
B
待确认
22.1
291
—
73
lila
· allenai
数学
通用数学
B
待确认
22.1
9,485
—
—
VideoScore-Bench
· TIGER-Lab
多模态
视频
B
待确认
22.0
164
—
201
PDE_Inverse_Problem_Benchmarking
· DabbyOWL
垂直领域
科学
B
待确认
21.7
9,752
—
2
VideoEval-Pro
· TIGER-Lab
多模态
视频
B
待确认
21.7
1,276
—
19
Entity-Imagen
· TIGER-Lab
多模态
文生图
B
待确认
21.7
125
—
265
xyzibd
· bop-benchmark
多模态
视觉语言
B
待确认
21.6
23,928
—
—
csabstruct
· allenai
语言/语义
分类
B
待确认
21.6
155
—
151
第 6 / 18 页
上一页
下一页