BenchMark·Hub
Benchmark测评分类可信级别开放热度
real-toxicity-prompts
· allenai
安全对齐越狱攻防
B待确认41.5
wildjailbreak
· allenai
安全对齐越狱攻防
B待确认36.4
WMDP
· 学术联盟
安全对齐对齐安全
S高可信36.2
civil_comments
· google
安全对齐偏见公平
B待确认35.5
AgentHarm
· UK AISI
安全对齐越狱攻防
S高可信32.9
openai-moderation-api-evaluation
· mmathys
安全对齐对齐安全
B待确认32.1
coconot
· allenai
安全对齐对齐安全
B待确认30.7
BeaverTails-Evaluation
· PKU-Alignment
安全对齐对齐安全
B待确认29.7
prosocial-dialog
· allenai
安全对齐对齐安全
B待确认28.8
llm-refusal-evaluation
· MultiverseComputingCAI
安全对齐越狱攻防
B待确认25.1
Bias-Evaluation-Turkish
· orhunc
安全对齐偏见公平
B待确认24.2
Gender_Bias_Evaluation_Set
· flax-sentence-embeddings
安全对齐偏见公平
B待确认23.8
ValuePrism
· allenai
安全对齐对齐安全
B待确认23.2
MASK
· cais
安全对齐对齐安全
B待确认21.3
prompt-injections-benchmark
· rogue-security
安全对齐越狱攻防
B待确认20.2
vllm_safety_evaluation
· PahaII
安全对齐越狱攻防
B待确认18.9
Fraud-R1-LLM-Defense-Fraud-Benchmark
· Chouoftears
安全对齐越狱攻防
B待确认17.6
social_bias_frames
· allenai
安全对齐偏见公平
B待确认16.3
HarmBench
· CAIS
安全对齐越狱攻防
S高可信14.3
red-team-appsec-benchmark
· Qwovadis
安全对齐越狱攻防
B待确认12.7
humaine-evaluation-dataset
· ProlificAI
安全对齐对齐安全
B待确认12.2
StrongREJECT
· 多家
安全对齐越狱攻防
S高可信11.6
exploitgym
· sunblaze-ucb
安全对齐越狱攻防
B待确认11.2
mittens
· google
安全对齐偏见公平
B待确认10.9
equity_evaluation_corpus
· peixian
安全对齐偏见公平
B待确认10.5
1 / 2
上一页下一页