BenchMark·Hub
Benchmark测评分类可信级别开放热度
WMDP
· 学术联盟
安全对齐对齐安全
S高可信36.2
openai-moderation-api-evaluation
· mmathys
安全对齐对齐安全
B待确认32.1
coconot
· allenai
安全对齐对齐安全
B待确认30.7
BeaverTails-Evaluation
· PKU-Alignment
安全对齐对齐安全
B待确认29.7
prosocial-dialog
· allenai
安全对齐对齐安全
B待确认28.8
ValuePrism
· allenai
安全对齐对齐安全
B待确认23.2
MASK
· cais
安全对齐对齐安全
B待确认21.3
humaine-evaluation-dataset
· ProlificAI
安全对齐对齐安全
B待确认12.2
llm-redactor-leak-benchmark
· jayluxferro
安全对齐对齐安全
B待确认8.9
llm_physical_safety_benchmark
· kumitang
安全对齐对齐安全
B待确认8.6
manta-benchmark-questions
· mycelium-ai
安全对齐对齐安全
B待确认7.7
Ko-LLM-Safety-Benchmark
· UHYEL
安全对齐对齐安全
B待确认7.7
LLM-Sec-Evaluation
· c01dsnap
安全对齐对齐安全
B待确认7.1
detoxic_benchmark
· d-llm
安全对齐对齐安全
B待确认4.7
AICGSecEval
· Tencent
安全对齐对齐安全
B待确认0.0
SafetyBench
· thu-coai
安全对齐对齐安全
B待确认0.0