finding
active
finding:persona-free-few-shot-control-on-llama-3-1-8b-produces-2-8-asr-below-the-3-3-unadorned-baseline-confirming-benign-exemplars-independently-prime-safetyPersona-free few-shot control on Llama-3.1-8B produces 2.8% ASR, below the 3.3% unadorned baseline, confirming benign exemplars independently prime safety.
Control establishing exemplar-based safety priming as independent of persona semantics
Source paper
extracted_from(2026) · Wenkai Li · Fan Yang · Shaunak A. Mehta · Koichi Onoue
Neighborhood — ranked by edge-count
Papers (1)
paper
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Control finding bounding interpretation of FS vs SP difference
- Qualitative failure mode difference between architectures under activation steering
- Variance decomposition showing AS results are dominated by persona identity
- Core empirical result of the prosocial persona paradox
- Model-specific difference in persona susceptibility
- Contrast with Gemma/Qwen showing Llama-specific persona-AS interaction
- Quantitative vulnerability profile for Llama-3.1-8B showing AS dominance
- Universal trait risk finding for low conscientiousness under prompt-based evaluation