finding
active
finding:finetuning-shift-along-evil-persona-vector-correlates-r-0-826-qwen-and-r-0-930-llama-with-evil-trait-expression-scoreFinetuning shift along evil persona vector correlates r=0.826 (Qwen) and r=0.930 (Llama) with evil trait expression score
Quantitative result for evil trait showing persona vector prediction power on both model architectures
Source paper
extracted_from(2025) · Chen, Runjin · Arditi, Andy · Sleight, Henry · Evans, Owain +1
Neighborhood — ranked by edge-count
Papers (1)
paper
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Core empirical result showing persona vectors capture trait-specific signal mediating finetuning-induced persona shifts
- Quantitative pre-finetuning predictability for evil trait
- Validates that internal evaluation set provides reliable proxy for broader behavioral tendencies
- SAE decomposition reveals interpretable fine-grained features composing the evil persona vector
- Contrast with Gemma/Qwen showing Llama-specific persona-AS interaction
- Quantitative result showing Evil emerges earliest due to ubiquity and simplicity in pretraining data
- Cross-model transfer recovers intractable direction that standard pipeline cannot extract
- Systematic identification of multiple coexisting persona vectors in two open-source models