BenchMark
·
Hub
总览
Benchmark 库
热度榜
家族
搜索 benchmark
⌘K
搜索
开放度
全部开放度
开放
需申请
闭集
未知
可信级别
全部可信级别
S · 高可信
A · 已审核
B · 待确认
应用筛选
共
450
个 benchmark
排序:
热度
增速
下载量
Stars
被引
最新
名称
Benchmark
测评分类
可信级别
开放
热度
下载(30d)
Stars
被引
nyt-connections
· lechmazur
推理
游戏推理
B
待确认
9.1
—
239
—
HumanEval+
HumanEval
· EvalPlus
代码
代码生成
A
已审核
9.1
—
—
—
DyCodeEval
· SeekingDream
代码
代码生成
B
待确认
9.0
—
225
—
llm-cold-start-benchmark
· ArchCoder
性能/成本
推理速度
B
待确认
9.0
65
—
—
BRIGHT
· xlang-ai
长上下文
检索上下文
B
待确认
8.9
—
211
—
llm-redactor-leak-benchmark
· jayluxferro
安全对齐
对齐安全
B
待确认
8.9
93
—
0
BFCL (Berkeley Function Calling)
BFCL
· UC Berkeley
智能体
工具调用
S
高可信
8.9
—
—
—
llm-medical-reasoning-steps-benchmark
· medreason
垂直领域
医疗
B
待确认
8.8
60
—
—
kazakhstan-sociology-llm-benchmark
· lesakbota
垂直领域
通用行业
B
待确认
8.8
59
—
—
combine-llm-security-benchmark
· tuandunghcmut
安全对齐
越狱攻防
B
待确认
8.8
33
—
—
Thai-Semantic-Textual-Similarity-Benchmark
· mrp
语言/语义
语义相似度
B
待确认
8.7
43
—
—
Aider Code Editing
Aider
· Aider
代码
代码生成
A
已审核
8.7
—
—
—
llm_physical_safety_benchmark
· kumitang
安全对齐
对齐安全
B
待确认
8.6
82
—
—
mup-full
· allenai
写作对话
摘要
B
待确认
8.6
41
—
—
MedXpertQA
· TsinghuaC3I
垂直领域
医疗
B
待确认
8.6
—
174
—
AARA_Azerbaijani_LLM_Benchmark
· khazarai
推理
通用推理
B
待确认
8.6
52
—
—
DeepPHY
· XinrunXu
多模态
视觉语言
B
待确认
8.6
—
172
—
LLM-RGB
· babelcloud
推理
通用推理
B
待确认
8.5
—
164
—
autolab
· autolabhq
智能体
工具调用
B
待确认
8.5
—
164
—
MBPP+
MBPP
· EvalPlus
代码
代码生成
A
已审核
8.5
—
—
—
BlindLoop-Evaluation
· taesiri
多模态
视觉语言
B
待确认
8.4
12
—
—
curriculum_benchmark
· chenz16
推理
通用推理
B
待确认
8.4
48
—
—
HaluMem
· MemTensor
智能体
工具调用
B
待确认
8.4
—
156
—
GateMem
· rzhub
智能体
工具调用
B
待确认
8.4
—
154
—
visual-spatial-reasoning
· cambridgeltl
多模态
视觉语言
B
待确认
8.3
—
150
—
第 14 / 18 页
上一页
下一页