| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
MMMU MMMU· 多家 | 多模态视觉语言 | S高可信 | 54.4 | |
MathVista · UCLA | 多模态视觉语言 | S高可信 | 40.0 | |
MMMU-Pro MMMU· 多家 | 多模态视觉语言 | S高可信 | 36.7 | |
BLINK · BLINK-Benchmark | 多模态视觉语言 | B待确认 | 35.3 | |
GenAI-Bench · TIGER-Lab | 多模态视觉语言 | B待确认 | 33.5 | |
Food_Portion_Benchmark · richtext | 多模态视觉语言 | B待确认 | 30.6 | |
MMEB-eval · TIGER-Lab | 多模态视觉语言 | B待确认 | 28.8 | |
spiqa · google | 多模态视觉语言 | B待确认 | 27.0 | |
MMIU-Benchmark · FanqingM | 多模态视觉语言 | B待确认 | 26.9 | |
docci · google | 多模态视觉语言 | B待确认 | 26.8 | |
DL3DV-Benchmark · DL3DV | 多模态视觉语言 | B待确认 | 25.9 | |
vlm_evaluation_v1.0 · VLABench | 多模态视觉语言 | B待确认 | 25.2 | |
MEGA-Bench · TIGER-Lab | 多模态视觉语言 | B待确认 | 23.8 | |
xyzibd · bop-benchmark | 多模态视觉语言 | B待确认 | 21.6 | |
EditReward-Bench · TIGER-Lab | 多模态视觉语言 | B待确认 | 20.2 | |
RSRCC · google | 多模态视觉语言 | B待确认 | 19.5 | |
PixelWorld · TIGER-Lab | 多模态视觉语言 | B待确认 | 15.8 | |
EnigmaEval · cais | 多模态视觉语言 | B待确认 | 15.2 | |
Mantis-Eval · TIGER-Lab | 多模态视觉语言 | B待确认 | 15.1 | |
IDEAL-Scenes · IDEAL-Benchmark | 多模态视觉语言 | B待确认 | 15.0 | |
BEAR-benchmark · yqi19 | 多模态视觉语言 | B待确认 | 15.0 | |
AIGC-Detection-Benchmark · TheKernel01 | 多模态视觉语言 | B待确认 | 14.6 | |
SenseNova-Vision-Benchmark · sensenova | 多模态视觉语言 | B待确认 | 13.0 | |
WEIRD · MERA-evaluation | 多模态视觉语言 | B待确认 | 12.2 | |
ruCLEVR · MERA-evaluation | 多模态视觉语言 | B待确认 | 12.1 |
第 1 / 2 页
上一页下一页