BenchMark·Hub
Benchmark测评分类可信级别开放热度
nyt-connections
· lechmazur
推理游戏推理
B待确认9.1
HumanEval+
HumanEval· EvalPlus
代码代码生成
A已审核9.1
DyCodeEval
· SeekingDream
代码代码生成
B待确认9.0
llm-cold-start-benchmark
· ArchCoder
性能/成本推理速度
B待确认9.0
BRIGHT
· xlang-ai
长上下文检索上下文
B待确认8.9
llm-redactor-leak-benchmark
· jayluxferro
安全对齐对齐安全
B待确认8.9
BFCL (Berkeley Function Calling)
BFCL· UC Berkeley
智能体工具调用
S高可信8.9
llm-medical-reasoning-steps-benchmark
· medreason
垂直领域医疗
B待确认8.8
kazakhstan-sociology-llm-benchmark
· lesakbota
垂直领域通用行业
B待确认8.8
combine-llm-security-benchmark
· tuandunghcmut
安全对齐越狱攻防
B待确认8.8
Thai-Semantic-Textual-Similarity-Benchmark
· mrp
语言/语义语义相似度
B待确认8.7
Aider Code Editing
Aider· Aider
代码代码生成
A已审核8.7
llm_physical_safety_benchmark
· kumitang
安全对齐对齐安全
B待确认8.6
mup-full
· allenai
写作对话摘要
B待确认8.6
MedXpertQA
· TsinghuaC3I
垂直领域医疗
B待确认8.6
AARA_Azerbaijani_LLM_Benchmark
· khazarai
推理通用推理
B待确认8.6
DeepPHY
· XinrunXu
多模态视觉语言
B待确认8.6
LLM-RGB
· babelcloud
推理通用推理
B待确认8.5
autolab
· autolabhq
智能体工具调用
B待确认8.5
MBPP+
MBPP· EvalPlus
代码代码生成
A已审核8.5
BlindLoop-Evaluation
· taesiri
多模态视觉语言
B待确认8.4
curriculum_benchmark
· chenz16
推理通用推理
B待确认8.4
HaluMem
· MemTensor
智能体工具调用
B待确认8.4
GateMem
· rzhub
智能体工具调用
B待确认8.4
visual-spatial-reasoning
· cambridgeltl
多模态视觉语言
B待确认8.3
14 / 18