| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
LongBench v2 LongBench· THUDM | 长上下文长文档 | S高可信 | 37.7 | |
narrativeqa · deepmind | 长上下文长文档 | B待确认 | 36.4 | |
pg19 · deepmind | 长上下文长文档 | B待确认 | 35.1 | |
HELMET · princeton-nlp | 长上下文长文档 | B待确认 | 27.6 | |
MMDocIR_Evaluation_Dataset · MMDocIR | 长上下文长文档 | B待确认 | 22.9 | |
pdfQA-Benchmark · pdfqa | 长上下文长文档 | B待确认 | 21.0 | |
wmt-da-human-evaluation-long-context · ymoslem | 长上下文长文档 | B待确认 | 13.4 |