| Benchmark | 测评分类 | 可信级别 | 开放 | 热度 |
|---|---|---|---|---|
WMDP · 学术联盟 | 安全对齐对齐安全 | S高可信 | 36.2 | |
openai-moderation-api-evaluation · mmathys | 安全对齐对齐安全 | B待确认 | 32.1 | |
coconot · allenai | 安全对齐对齐安全 | B待确认 | 30.7 | |
BeaverTails-Evaluation · PKU-Alignment | 安全对齐对齐安全 | B待确认 | 29.7 | |
prosocial-dialog · allenai | 安全对齐对齐安全 | B待确认 | 28.8 | |
ValuePrism · allenai | 安全对齐对齐安全 | B待确认 | 23.2 | |
MASK · cais | 安全对齐对齐安全 | B待确认 | 21.3 | |
humaine-evaluation-dataset · ProlificAI | 安全对齐对齐安全 | B待确认 | 12.2 | |
llm-redactor-leak-benchmark · jayluxferro | 安全对齐对齐安全 | B待确认 | 8.9 | |
llm_physical_safety_benchmark · kumitang | 安全对齐对齐安全 | B待确认 | 8.6 | |
manta-benchmark-questions · mycelium-ai | 安全对齐对齐安全 | B待确认 | 7.7 | |
Ko-LLM-Safety-Benchmark · UHYEL | 安全对齐对齐安全 | B待确认 | 7.7 | |
LLM-Sec-Evaluation · c01dsnap | 安全对齐对齐安全 | B待确认 | 7.1 | |
detoxic_benchmark · d-llm | 安全对齐对齐安全 | B待确认 | 4.7 | |
AICGSecEval · Tencent | 安全对齐对齐安全 | B待确认 | 0.0 | |
SafetyBench · thu-coai | 安全对齐对齐安全 | B待确认 | 0.0 |