BenchMark·Hub
Benchmark测评分类可信级别开放热度
Terminal-Bench
· Stanford 等
智能体环境控制
S高可信0.0
Needle in a Haystack
· Greg Kamradt
长上下文针检索
S高可信0.0
SuperCLUE
· CLUE 团队
中文中文通用
S高可信0.0
SimpleQA
SimpleQA· OpenAI
知识问答事实性
S高可信0.0
BFCL (Berkeley Function Calling)
· UC Berkeley
智能体工具调用
S高可信0.0
Needle in a Haystack
· Greg Kamradt
长上下文针检索
S高可信0.0
AgentBench
· THUDM
智能体工具调用
B待确认0.0
MingLi-Bench
· DestinyLinker
垂直领域通用行业
B待确认0.0
beir
· beir-cellar
语言/语义检索/Embedding
B待确认0.0
KernelBench
· ScalingIntelligence
代码代码生成
B待确认0.0
yet-another-applied-llm-benchmark
· carlini
知识问答通用问答
B待确认0.0
AICGSecEval
· Tencent
安全对齐对齐安全
B待确认0.0
ParseBench
· run-llama
多模态文档/OCR
B待确认0.0
EnterpriseRAG-Bench
· onyx-dot-app
垂直领域通用行业
B待确认0.0
VibeSearchBench
· VibeBench
智能体网页导航
B待确认0.0
SEED-Bench
· AILab-CVC
多模态视觉语言
B待确认0.0
android-bench
· android-bench
代码仓库级代码
B待确认0.0
SafetyBench
· thu-coai
安全对齐对齐安全
B待确认0.0
terminal-bench-1
· harbor-framework
智能体环境控制
B待确认0.0
SWELancer-Benchmark
· openai
代码代码生成
B待确认0.0
homebench
· david-g-3654
性能/成本本地推理
B待确认0.0
LLM-Game-Benchmark
· research-outcome
推理游戏推理
B待确认0.0
TwinRouterBench
· CommonstackAI
智能体工具调用
B待确认0.0
pi-detector-bench
· bastion-soft
安全对齐越狱攻防
B待确认0.0
glossobench
· sprapp-com
语言/语义多语低资源
B待确认0.0
17 / 18