BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
mslr2022
· allenai
垂直领域
医疗
B
待确认
14.8
342
—
—
WebArena
WebArena
· CMU
智能体
网页导航
S
高可信
14.7
—
—
1,882
whichllm
· Andyyyy64
性能/成本
硬件平台
B
待确认
14.6
—
6,501
—
AIGC-Detection-Benchmark
· TheKernel01
多模态
视觉语言
B
待确认
14.6
1,737
—
—
code_x_glue_cc_clone_detection_poj104
· google
代码
代码生成
B
待确认
14.6
425
—
—
AIME25
· TIGER-Lab
数学
竞赛数学
B
待确认
14.5
839
—
—
VisPlotBench
· TIGER-Lab
代码
代码生成
B
待确认
14.4
275
—
2
ConvApparel
· google
智能体
工具调用
B
待确认
14.4
139
—
1
HarmBench
· CAIS
安全对齐
越狱攻防
S
高可信
14.3
—
—
1,467
indic-queries-2026
· mast-benchmark
智能体
工具调用
B
待确认
14.2
247
—
—
autocodearena-v0
· bigcode
代码
代码生成
B
待确认
14.1
115
—
5
Crab-role-playing-evaluation-benchmark
· HeAAAAA
写作对话
对话写作
B
待确认
14.1
1,329
—
—
bigcodereward
· bigcode
代码
代码生成
B
待确认
14.0
108
—
5
movie_rationales
· eraser-benchmark
语言/语义
分类
B
待确认
13.9
415
—
—
RULER
· NVIDIA
长上下文
针检索
S
高可信
13.9
—
—
1,211
turkish_political_position_benchmark
· samliumay
语言/语义
分类
B
待确认
13.8
161
—
—
chinese-writing-benchmark
· zake7749
写作对话
对话写作
B
待确认
13.8
205
—
—
turkish_cyber_security_controls_benchmark
· samliumay
垂直领域
通用行业
B
待确认
13.7
127
—
—
multilingual-queries-2026
· mast-benchmark
智能体
工具调用
B
待确认
13.4
168
—
—
wmt-da-human-evaluation-long-context
· ymoslem
长上下文
长文档
B
待确认
13.4
270
—
—
NuosuBburma-OCR-Evaluation-Set
· nanxidajun
多模态
文档/OCR
B
待确认
13.4
616
—
—
chain-of-thought-hub
· FranxYao
推理
通用推理
B
待确认
13.2
—
2,775
—
SenseNova-Vision-Benchmark
· sensenova
多模态
视觉语言
B
待确认
13.0
105
—
0
TTS-Voice-Direction-Benchmark
· BreezeBlue
多模态
音频
B
待确认
13.0
132
—
—
TACT
· google
推理
通用推理
B
待确认
12.9
16
—
9
第 10 / 18 页
上一页
下一页