BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
red-team-appsec-benchmark
· Qwovadis
安全对齐
越狱攻防
B
待确认
12.7
115
—
—
ArXivSQA
· AI-dataset-evaluation-team
知识问答
考试问答
B
待确认
12.6
641
—
—
legal-llm-benchmark
· marvintong
垂直领域
法律
B
待确认
12.6
418
—
—
coverbench
· google
推理
通用推理
B
待确认
12.6
15
—
7
BrowseComp
BrowseComp
· OpenAI
智能体
网页导航
S
高可信
12.4
—
—
558
cybersec-retrieval-benchmark
· alirezaaminzadeh
垂直领域
通用行业
B
待确认
12.2
90
—
—
InferenceX
· SemiAnalysisAI
性能/成本
推理速度
B
待确认
12.2
—
1,571
—
WEIRD
· MERA-evaluation
多模态
视觉语言
B
待确认
12.2
337
—
—
humaine-evaluation-dataset
· ProlificAI
安全对齐
对齐安全
B
待确认
12.2
156
—
—
Video-ChatGPT
· mbzuai-oryx
多模态
视频
B
待确认
12.2
—
1,506
—
llm-colosseum
· OpenGenerativeAI
其他
游戏推理
B
待确认
12.2
—
1,484
—
music-off-policy-evaluation-benchmark
· amazon
垂直领域
音乐
B
待确认
12.1
489
—
—
ruCLEVR
· MERA-evaluation
多模态
视觉语言
B
待确认
12.1
318
—
—
TARA_Turkish_LLM_Benchmark
· emre
推理
通用推理
B
待确认
12.0
58
—
—
harvey-labs
· harveyai
垂直领域
法律
B
待确认
11.9
—
1,266
—
denoising-impact-evaluation-dataset
· ekacare
多模态
音频
B
待确认
11.9
436
—
—
sensory-awareness-benchmark
· scarysnake
推理
通用推理
B
待确认
11.9
58
—
—
hippocorpus
· allenai
写作对话
对话写作
B
待确认
11.8
158
—
—
τ²-bench
tau-bench
· Sierra
智能体
工具调用
S
高可信
11.8
—
—
416
japanese-image-classification-evaluation-dataset
· recruit-jp
多模态
视觉语言
B
待确认
11.7
105
—
—
LLMBar
· princeton-nlp
推理
指令遵循
B
待确认
11.7
146
—
—
form-field-v1-benchmark
· nutrientdocs
多模态
文档/OCR
B
待确认
11.6
65
—
—
arena-hard-auto
· lmarena
写作对话
对话写作
B
待确认
11.6
—
1,061
—
StrongREJECT
· 多家
安全对齐
越狱攻防
S
高可信
11.6
—
—
374
Mind2Web
· OSU-NLP-Group
智能体
网页导航
B
待确认
11.5
—
1,021
—
第 11 / 18 页
上一页
下一页