BenchMark·Hub
Benchmark测评分类可信级别开放热度
xtreme
· google
语言/语义多语低资源
B待确认38.8
lm1b
· billion-word-benchmark
语言/语义语言建模
B待确认32.1
AlGhafa-Arabic-LLM-Benchmark-Native
· OALL
语言/语义多语低资源
B待确认31.0
snips_built_in_intents
· sonos-nlu-benchmark
语言/语义NLU
B待确认30.2
IndicGenBench_flores_in
· google
语言/语义翻译
B待确认23.9
Instruction-Following-Evaluation-for-Large-Language-Models
· harpreetsahota
语言/语义指令遵循
B待确认23.9
IndicGenBench_crosssum_in
· google
语言/语义摘要
B待确认22.8
csabstruct
· allenai
语言/语义分类
B待确认21.6
LLM_Benchmark
· Bokhbat
语言/语义多语低资源
B待确认21.4
NLU-Evaluation-Data-en-de
· deutsche-telekom
语言/语义NLU
B待确认19.9
wmt22_african
· allenai
语言/语义翻译
B待确认15.9
serbian-llm-benchmark
· datatab
语言/语义多语低资源
B待确认15.6
lince
· lince-benchmark
语言/语义Code Switching
B待确认15.1
movie_rationales
· eraser-benchmark
语言/语义分类
B待确认13.9
turkish_political_position_benchmark
· samliumay
语言/语义分类
B待确认13.8
wmt-mqm-human-evaluation
· RicardoRei
语言/语义翻译
B待确认11.2
NTEU_Multilingual_Evaluation_Dataset
· BSC-LT
语言/语义翻译
B待确认10.7
LoraxBench
· google
语言/语义多语低资源
B待确认10.6
Massive Text Embedding Benchmark
MTEB· MTEB
语言/语义检索/Embedding
A已审核10.0
finno-ugric-benchmark
· tartuNLP
语言/语义多语低资源
B待确认9.6
wmt-sqm-human-evaluation
· RicardoRei
语言/语义翻译
B待确认9.5
NLU-few-shot-benchmark-en-de
· deutsche-telekom
语言/语义NLU
B待确认9.2
Thai-Semantic-Textual-Similarity-Benchmark
· mrp
语言/语义语义相似度
B待确认8.7
query2query_evaluation
· neeva
语言/语义语义相似度
B待确认6.8
ja-vicuna-qa-benchmark
· llm-book
语言/语义通用问答
B待确认6.4
1 / 2
上一页下一页