BenchMark·Hub
Benchmark测评分类可信级别开放热度
IFEval
IFEval· google
写作对话指令遵循
B待确认56.1
llm-system-prompts-benchmark
· Naomibas
写作对话指令遵循
B待确认22.4