BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
code_evaluation_prompts
· HuggingFaceH4
代码
代码生成
B
待确认
11.5
63
—
—
ATLAS
· VILA-Lab
推理
提示词/查询
B
待确认
11.5
—
992
—
scrapinghub-article-extraction-benchmark
· allenai
垂直领域
通用行业
B
待确认
11.4
338
—
—
PIXIU
· The-FinAI
垂直领域
金融
B
待确认
11.3
—
884
—
ruCommonVQA
· MERA-evaluation
多模态
视觉语言
B
待确认
11.3
320
—
—
ruNaturalScienceVQA
· MERA-evaluation
多模态
视觉语言
B
待确认
11.3
317
—
—
wmt-mqm-human-evaluation
· RicardoRei
语言/语义
翻译
B
待确认
11.2
206
—
—
exploitgym
· sunblaze-ucb
安全对齐
越狱攻防
B
待确认
11.2
—
842
—
mittens
· google
安全对齐
偏见公平
B
待确认
10.9
68
—
—
ragu_benchmarks
· RaguTeam
长上下文
检索上下文
B
待确认
10.9
44
—
—
Vision-DeepResearch
· Osilly
多模态
视觉语言
B
待确认
10.8
—
677
—
OpenLane-V2
· OpenDriveLab
多模态
视觉语言
B
待确认
10.8
—
673
—
mup
· allenai
写作对话
摘要
B
待确认
10.8
95
—
—
codefuse-devops-eval
· codefuse-ai
垂直领域
通用行业
B
待确认
10.8
—
656
—
NTEU_Multilingual_Evaluation_Dataset
· BSC-LT
语言/语义
翻译
B
待确认
10.7
157
—
—
FrontierMath
· Epoch AI
数学
竞赛数学
S
高可信
10.6
—
—
230
LoraxBench
· google
语言/语义
多语低资源
B
待确认
10.6
64
—
—
equity_evaluation_corpus
· peixian
安全对齐
偏见公平
B
待确认
10.5
73
—
—
meta-agents-research-environments
· facebookresearch
智能体
环境控制
B
待确认
10.5
—
547
—
TTS-Voice-Design-Benchmark
· BreezeBlue
多模态
音频
B
待确认
10.3
32
—
—
LLMs-Planning
· karthikv792
推理
通用推理
B
待确认
10.3
—
472
—
phyre
· facebookresearch
推理
通用推理
B
待确认
10.2
—
460
—
mcpmark
· eval-sys
智能体
工具调用
B
待确认
10.2
—
459
—
Visual-CoT
· deepcs233
多模态
视觉语言
B
待确认
10.2
—
446
—
formal-grammar-llm-benchmark
· hoisoserious
推理
通用推理
B
待确认
10.1
176
—
—
第 12 / 18 页
上一页
下一页