finding
active
finding:persona-vectors-form-within-0-22-of-olmo-3-pretraining-12-6b-tokensPersona vectors form within 0.22% of OLMo-3 pretraining (≈12.6B tokens)
Core quantitative result answering RQ1 for OLMo-3
Source paper
extracted_from(2026) · Viktor Moskvoretskii · Dominik Glandorf · Jorge Medina Moreira · Tanja Käser +1
Neighborhood — ranked by edge-count
Papers (1)
paper
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Replication finding on Apertus confirming early persona formation generalizes across model families
- Persona vectors extracted from base pretraining checkpoints steer fully post-trained OLMo-3-7B-Instructfinding0.861Shows persona directions persist through all alignment stages, answering key part of RQ2
- Quantitative result showing Evil emerges earliest due to ubiquity and simplicity in pretraining data
- Explains geometric differences in replication through earlier consolidation of Apertus persona space
- Evil persona steering delta of +9.69 (p=0.011) at stage1-step3000 (12.6B tokens) in OLMo-3finding0.810First significant evil persona steering result; establishes emergence at 0.22% pretraining
- Quantifies geometric distance of early persona directions from final direction
- Main monitoring result showing persona vectors can predict behavioral shifts before text generation begins
- Interpretive claim about the mechanistic role of persona vectors explaining emergent misalignment