BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
cladder
· causalNLP
推理
通用推理
B
待确认
8.3
—
148
—
llm-smartrouter-benchmark
· pixeloffice
性能/成本
成本延迟
B
待确认
8.3
69
—
—
LLM-WikiRace-Benchmark
· juliusz-ziomek
推理
游戏推理
B
待确认
8.3
34
—
1
ScienceBoard
· OS-Copilot
智能体
工具调用
B
待确认
8.2
—
137
—
MME-CoT
· MME-Benchmarks
多模态
视觉语言
B
待确认
8.2
—
136
—
Aider Polyglot
Aider
· Aider
代码
代码生成
A
已审核
8.0
—
—
—
AgentKernelArena
· AMD-AGI
智能体
工具调用
B
待确认
7.9
—
112
—
eu-cyber-llm-benchmark-prompts
· eromang
安全对齐
偏见公平
B
待确认
7.8
34
—
—
OlympicArena
· GAIR-NLP
推理
通用推理
B
待确认
7.8
—
106
—
clutrr
· facebookresearch
推理
通用推理
B
待确认
7.7
—
104
—
FunQA
· Nicous20
多模态
视频
B
待确认
7.7
—
104
—
manta-benchmark-questions
· mycelium-ai
安全对齐
对齐安全
B
待确认
7.7
6
—
—
Ko-LLM-Safety-Benchmark
· UHYEL
安全对齐
对齐安全
B
待确认
7.7
25
—
—
llm-speed-benchmarks
· llmspeed
性能/成本
推理速度
B
待确认
7.6
47
—
—
QZhou-Flowchart-QA-Benchmark
· Kingsoft-LLM
多模态
图表表格
B
待确认
7.5
45
—
—
Julia-LLM-Leaderboard
· svilupp
代码
代码生成
B
待确认
7.4
—
86
—
bigcodebench-hard-domain
BigCodeBench
· bigcode
代码
代码生成
B
待确认
7.4
28
—
—
WER_Evaluation_For_TTS
· Idrizorg
多模态
音频
B
待确认
7.3
40
—
—
arabic-acoustic-poetry-benchmark
· KFUPM-JRCAI
垂直领域
音乐
B
待确认
7.2
19
—
—
VisPhyBench-Data
· TIGER-Lab
多模态
视觉语言
B
待确认
7.1
37
—
—
SWE-bench Bash-only
SWE-bench
· Princeton
代码
代码生成
A
已审核
7.1
—
—
—
LLM-Sec-Evaluation
· c01dsnap
安全对齐
对齐安全
B
待确认
7.1
15
—
—
imagereward-evaluation
· kenjiqq
多模态
文生图
B
待确认
6.8
32
—
—
image_gen_ocr_evaluation_data
· pbevan11
多模态
文生图
B
待确认
6.8
32
—
—
query2query_evaluation
· neeva
语言/语义
语义相似度
B
待确认
6.8
10
—
—
第 15 / 18 页
上一页
下一页