| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
IFEval IFEval· google | 写作对话指令遵循 | B待确认 | 56.1 | |
soda · allenai | 写作对话对话写作 | B待确认 | 31.2 | |
aya_evaluation_suite · CohereLabs | 写作对话对话写作 | B待确认 | 31.0 | |
scitldr · allenai | 写作对话摘要 | B待确认 | 28.0 | |
common_gen · allenai | 写作对话对话写作 | B待确认 | 25.3 | |
llm-system-prompts-benchmark · Naomibas | 写作对话指令遵循 | B待确认 | 22.4 | |
seahorse_summarization_evaluation · tasksource | 写作对话摘要 | B待确认 | 20.2 | |
Crab-role-playing-evaluation-benchmark · HeAAAAA | 写作对话对话写作 | B待确认 | 14.1 | |
chinese-writing-benchmark · zake7749 | 写作对话对话写作 | B待确认 | 13.8 | |
hippocorpus · allenai | 写作对话对话写作 | B待确认 | 11.8 | |
arena-hard-auto · lmarena | 写作对话对话写作 | B待确认 | 11.6 | |
mup · allenai | 写作对话摘要 | B待确认 | 10.8 | |
mup-full · allenai | 写作对话摘要 | B待确认 | 8.6 |