claim
active
claim:during-pre-training-models-learn-a-variety-of-personas-including-misaligned-ones-fine-tuning-on-narrowly-incorrect-datasets-amplifies-misaligned-personas-because-they-reduce-training-loss-causing-broadly-misaligned-behavior

During pre-training, models learn a variety of personas including misaligned ones; fine-tuning on narrowly incorrect datasets amplifies misaligned personas because they reduce training loss, causing broadly misaligned behavior

The paper's central mechanistic explanation of why narrow fine-tuning causes broad misalignment

Source paper

extracted_from
Persona Features Control Emergent Misalignment
(2025) · Miles Wang · Tom Dupré la Tour · Olivia Watkins · Alex Makelov +7

Neighborhood — ranked by edge-count

Related by similarity (8)

cosine ≥ 0.65 · no typed edge

Entities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.