BenchMark·Hub
Benchmark测评分类可信级别开放热度
cladder
· causalNLP
推理通用推理
B待确认8.3
llm-smartrouter-benchmark
· pixeloffice
性能/成本成本延迟
B待确认8.3
LLM-WikiRace-Benchmark
· juliusz-ziomek
推理游戏推理
B待确认8.3
ScienceBoard
· OS-Copilot
智能体工具调用
B待确认8.2
MME-CoT
· MME-Benchmarks
多模态视觉语言
B待确认8.2
Aider Polyglot
Aider· Aider
代码代码生成
A已审核8.0
AgentKernelArena
· AMD-AGI
智能体工具调用
B待确认7.9
eu-cyber-llm-benchmark-prompts
· eromang
安全对齐偏见公平
B待确认7.8
OlympicArena
· GAIR-NLP
推理通用推理
B待确认7.8
clutrr
· facebookresearch
推理通用推理
B待确认7.7
FunQA
· Nicous20
多模态视频
B待确认7.7
manta-benchmark-questions
· mycelium-ai
安全对齐对齐安全
B待确认7.7
Ko-LLM-Safety-Benchmark
· UHYEL
安全对齐对齐安全
B待确认7.7
llm-speed-benchmarks
· llmspeed
性能/成本推理速度
B待确认7.6
QZhou-Flowchart-QA-Benchmark
· Kingsoft-LLM
多模态图表表格
B待确认7.5
Julia-LLM-Leaderboard
· svilupp
代码代码生成
B待确认7.4
bigcodebench-hard-domain
BigCodeBench· bigcode
代码代码生成
B待确认7.4
WER_Evaluation_For_TTS
· Idrizorg
多模态音频
B待确认7.3
arabic-acoustic-poetry-benchmark
· KFUPM-JRCAI
垂直领域音乐
B待确认7.2
VisPhyBench-Data
· TIGER-Lab
多模态视觉语言
B待确认7.1
SWE-bench Bash-only
SWE-bench· Princeton
代码代码生成
A已审核7.1
LLM-Sec-Evaluation
· c01dsnap
安全对齐对齐安全
B待确认7.1
imagereward-evaluation
· kenjiqq
多模态文生图
B待确认6.8
image_gen_ocr_evaluation_data
· pbevan11
多模态文生图
B待确认6.8
query2query_evaluation
· neeva
语言/语义语义相似度
B待确认6.8
15 / 18