finding
active
finding:apertus-instruct-shows-less-overall-persona-suppression-compared-to-olmo-3-instructApertus-Instruct shows less overall persona suppression compared to OLMo-3-Instruct
Replication difference showing alignment depth varies across model families
Source paper
extracted_from(2026) · Viktor Moskvoretskii · Dominik Glandorf · Jorge Medina Moreira · Tanja Käser +1
Neighborhood — ranked by edge-count
Papers (1)
paper
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Apertus-8B can be steered better towards humor than OLMo-3 despite similarly low pass ratesfinding0.782Notable difference in Apertus replication suggesting model-specific capacity for humor expression
- Notable difference from OLMo-3 in Apertus replication, showing model-specific alignment effects on evil persona
- Explains geometric differences in replication through earlier consolidation of Apertus persona space
- Replication of sadism growth finding on Apertus confirming cross-model generality
- Humorous persona barely emerges by end of OLMo-3 pretraining, requiring pragmatic competencefinding0.749Quantitative result showing humor requires acquired linguistic competence and emerges latest
- Systematic identification of multiple coexisting persona vectors in two open-source models
- Shows discourse-type-specific facet profiles supporting PSM hypothesis of diverse persona subforms
- Model-specific difference in persona susceptibility