BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
German-RAG-LLM-HARD-BENCHMARK
· avemio
长上下文
检索上下文
B
待确认
21.4
127
—
448
RLPR-Evaluation
· openbmb
推理
通用推理
B
待确认
21.4
282
—
86
svq
· google
多模态
音频
B
待确认
21.4
4,816
—
—
LLM_Benchmark
· Bokhbat
语言/语义
多语低资源
B
待确认
21.4
69
1,570
—
zest
· allenai
推理
通用推理
B
待确认
21.3
350
—
99
MASK
· cais
安全对齐
对齐安全
B
待确认
21.3
8,910
—
—
code_generation
· livecodebench
代码
代码生成
B
待确认
21.0
5,812
—
—
plant-genomic-benchmark
· InstaDeepAI
垂直领域
生物
B
待确认
21.0
9,365
—
—
pdfQA-Benchmark
· pdfqa
长上下文
长文档
B
待确认
21.0
8,697
—
1
granola-entity-questions
· google
知识问答
事实性
B
待确认
20.6
309
—
25
German-RAG-LLM-EASY-BENCHMARK
· avemio
长上下文
检索上下文
B
待确认
20.6
81
—
448
BrowseCompLongContext
· openai
长上下文
检索上下文
B
待确认
20.5
3,214
—
—
WikiProfile
· google
知识问答
事实性
B
待确认
20.5
176
—
8
seahorse_summarization_evaluation
· tasksource
写作对话
摘要
B
待确认
20.2
200
—
57
graphwalks
· openai
推理
通用推理
B
待确认
20.2
1,658
—
—
prompt-injections-benchmark
· rogue-security
安全对齐
越狱攻防
B
待确认
20.2
831
—
—
EditReward-Bench
· TIGER-Lab
多模态
视觉语言
B
待确认
20.2
218
—
51
NLU-Evaluation-Data-en-de
· deutsche-telekom
语言/语义
NLU
B
待确认
19.9
44
—
307
genomics-long-range-benchmark
· InstaDeepAI
垂直领域
生物
B
待确认
19.6
4,191
—
—
bigcodebench-hard
BigCodeBench
· bigcode
代码
代码生成
B
待确认
19.5
9,452
—
—
RSRCC
· google
多模态
视觉语言
B
待确认
19.5
2,341
—
0
healthbench-professional
· openai
垂直领域
医疗
B
待确认
19.4
1,720
—
—
cvdp-benchmark-dataset
· nvidia
代码
代码生成
B
待确认
19.3
2,262
—
—
data-product-benchmark
· ibm-research
智能体
工具调用
B
待确认
19.1
3,802
—
1
TheoremExplainBench
· TIGER-Lab
数学
通用数学
B
待确认
19.0
86
—
23
第 7 / 18 页
上一页
下一页