finding
active
finding:character-training-distillation-introspection-achieves-f1-0-95-on-llama-3-1-8b-persona-classifier-under-adversarial-prompting-vs-0-79-for-distillation-onlyCharacter training (distillation + introspection) achieves F1=0.95 on Llama 3.1 8B persona classifier under adversarial prompting, vs 0.79 for distillation only
Robustness result showing introspection stage's contribution for Llama model
Source paper
extracted_from(2025) · Sharan Maiya · Henning Bartsch · Nathan Lambert · Evan Hubinger
Neighborhood — ranked by edge-count
Papers (1)
paper
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Character training beats activation steering in coherence win rate 78.4% ± 5.2% on Llama 3.1 8Bfinding0.801Coherence comparison against steering baseline for Llama model
- Scale specification for distillation training dataset
- Reasoning model vulnerability under prompting
- Contrast with Gemma/Qwen showing Llama-specific persona-AS interaction
- Universal trait risk finding for low conscientiousness under prompt-based evaluation
- Character training is more robust to adversarial prompting than constraining system promptsclaim0.774Main robustness claim supported by classifier performance experiments
- Robustness of the prosocial paradox to intervention-matching concerns
- Character training is more robust to adversarial prompting than activation steering on averageclaim0.768Robustness comparison claim; activation steering is brittle for QWEN 2.5 7B specifically