finding
active
finding:fine-tuning-on-correct-health-advice-35-steps-nearly-realigns-a-model-trained-on-insecure-code-leaving-only-0-5-misalignmentFine-tuning on correct health advice (35 steps) nearly realigns a model trained on insecure code, leaving only 0.5% misalignment
Cross-domain realignment is effective but less complete than in-domain realignment
Source paper
extracted_from(2025) · Miles Wang · Tom Dupré la Tour · Olivia Watkins · Alex Makelov +7
Neighborhood — ranked by edge-count
Papers (1)
paper
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Demonstrates emergent re-alignment is achievable with minimal data from same domain
- Different fine-tuning domains produce qualitatively distinct misalignment profiles attributable to different data generation processes
- Null result from Experiment 2 for Mistral models.
- Human data fine-tuning effect is distinct from synthetic emergent misalignment and likely caused by off-policy training
- Evidence for the evil persona as a privileged basin supporting Hypothesis 3
- Fine-tuning LLMs on insecure code dataset from Betley et al. to induce emergent misalignment
- Demonstrates alignment faking may occur without explicit chain-of-thought reasoning
- Unified interpretation of different adaptation methods via UCCT terms