BenchMark·Hub
Benchmark测评分类可信级别开放热度
OSWorld
· HKU 等
智能体环境控制
S高可信27.0
LEXam
· LEXam-Benchmark
垂直领域法律
B待确认27.0
spiqa
· google
多模态视觉语言
B待确认27.0
MMIU-Benchmark
· FanqingM
多模态视觉语言
B待确认26.9
docci
· google
多模态视觉语言
B待确认26.8
FinanceBench
· 多家
垂直领域金融
S高可信26.7
DL3DV-Benchmark
· DL3DV
多模态视觉语言
B待确认25.9
narrativeqa_manual
· deepmind
知识问答通用问答
B待确认25.8
xtreme_s
· google
多模态音频
B待确认25.7
scicite
· allenai
垂直领域科学
B待确认25.7
LongRAG
· TIGER-Lab
长上下文检索上下文
B待确认25.5
AIME 2025
AIME· MAA
数学竞赛数学
S高可信25.5
wiqa
· allenai
推理通用推理
B待确认25.5
SWE-bench Multimodal
SWE-bench· princeton-nlp
代码代码生成
B待确认25.4
common_gen
· allenai
写作对话对话写作
B待确认25.3
vlm_evaluation_v1.0
· VLABench
多模态视觉语言
B待确认25.2
CritPt
· CritPt-Benchmark
垂直领域科学
B待确认25.2
llm-refusal-evaluation
· MultiverseComputingCAI
安全对齐越狱攻防
B待确认25.1
peer_read
· allenai
垂直领域科学
B待确认25.0
τ²-bench
tau-bench· Sierra
智能体工具调用
S高可信24.3
Bias-Evaluation-Turkish
· orhunc
安全对齐偏见公平
B待确认24.2
social_i_qa
· allenai
推理通用推理
B待确认24.2
llm-query-complexity-benchmark
· anasnassar
性能/成本成本延迟
B待确认24.0
LongICLBench
· TIGER-Lab
长上下文检索上下文
B待确认23.9
IndicGenBench_flores_in
· google
语言/语义翻译
B待确认23.9
5 / 18