dataset
active
dataset:strongreject-benchmark

StrongReject Benchmark

Safety benchmark with 353 harmful prompts used to evaluate whether VS compromises model safety alignment

Neighborhood — ranked by edge-count