BenchMark·Hub
Benchmark测评分类可信级别开放热度
LongBench v2
LongBench· THUDM
长上下文长文档
S高可信37.7
narrativeqa
· deepmind
长上下文长文档
B待确认36.4
pg19
· deepmind
长上下文长文档
B待确认35.1
HELMET
· princeton-nlp
长上下文长文档
B待确认27.6
MMDocIR_Evaluation_Dataset
· MMDocIR
长上下文长文档
B待确认22.9
pdfQA-Benchmark
· pdfqa
长上下文长文档
B待确认21.0
wmt-da-human-evaluation-long-context
· ymoslem
长上下文长文档
B待确认13.4