| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
OSWorld · HKU 等 | 智能体环境控制 | S高可信 | 27.0 | |
LEXam · LEXam-Benchmark | 垂直领域法律 | B待确认 | 27.0 | |
spiqa · google | 多模态视觉语言 | B待确认 | 27.0 | |
MMIU-Benchmark · FanqingM | 多模态视觉语言 | B待确认 | 26.9 | |
docci · google | 多模态视觉语言 | B待确认 | 26.8 | |
FinanceBench · 多家 | 垂直领域金融 | S高可信 | 26.7 | |
DL3DV-Benchmark · DL3DV | 多模态视觉语言 | B待确认 | 25.9 | |
narrativeqa_manual · deepmind | 知识问答通用问答 | B待确认 | 25.8 | |
xtreme_s · google | 多模态音频 | B待确认 | 25.7 | |
scicite · allenai | 垂直领域科学 | B待确认 | 25.7 | |
LongRAG · TIGER-Lab | 长上下文检索上下文 | B待确认 | 25.5 | |
AIME 2025 AIME· MAA | 数学竞赛数学 | S高可信 | 25.5 | |
wiqa · allenai | 推理通用推理 | B待确认 | 25.5 | |
SWE-bench Multimodal SWE-bench· princeton-nlp | 代码代码生成 | B待确认 | 25.4 | |
common_gen · allenai | 写作对话对话写作 | B待确认 | 25.3 | |
vlm_evaluation_v1.0 · VLABench | 多模态视觉语言 | B待确认 | 25.2 | |
CritPt · CritPt-Benchmark | 垂直领域科学 | B待确认 | 25.2 | |
llm-refusal-evaluation · MultiverseComputingCAI | 安全对齐越狱攻防 | B待确认 | 25.1 | |
peer_read · allenai | 垂直领域科学 | B待确认 | 25.0 | |
τ²-bench tau-bench· Sierra | 智能体工具调用 | S高可信 | 24.3 | |
Bias-Evaluation-Turkish · orhunc | 安全对齐偏见公平 | B待确认 | 24.2 | |
social_i_qa · allenai | 推理通用推理 | B待确认 | 24.2 | |
llm-query-complexity-benchmark · anasnassar | 性能/成本成本延迟 | B待确认 | 24.0 | |
LongICLBench · TIGER-Lab | 长上下文检索上下文 | B待确认 | 23.9 | |
IndicGenBench_flores_in · google | 语言/语义翻译 | B待确认 | 23.9 |