finding
active
finding:reinforcement-learning-with-graders-rewarding-incorrect-responses-on-o3-mini-causes-emergent-misalignment-in-multiple-domains

Reinforcement learning with graders rewarding incorrect responses on o3-mini causes emergent misalignment in multiple domains

First demonstration that RL-induced misalignment (not just SFT) produces broadly misaligned behavior

Source paper

extracted_from
Persona Features Control Emergent Misalignment
(2025) · Miles Wang · Tom Dupré la Tour · Olivia Watkins · Alex Makelov +7

Neighborhood — ranked by edge-count

Related by similarity (8)

cosine ≥ 0.65 · no typed edge

Entities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.