claim
active
claim:generalized-misalignment-is-easy-to-specify-via-reinforcement-learning-perhaps-because-it-taps-into-a-representation-already-present-in-the-model-from-pre-training

Generalized misalignment is 'easy to specify' via reinforcement learning, perhaps because it taps into a representation already present in the model from pre-training

RL with only scalar reward induces emergent misalignment, suggesting misalignment is a natural pre-existing representation

Source paper

extracted_from
Persona Features Control Emergent Misalignment
(2025) · Miles Wang · Tom Dupré la Tour · Olivia Watkins · Alex Makelov +7

Neighborhood — ranked by edge-count

Related by similarity (8)

cosine ≥ 0.65 · no typed edge

Entities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.