finding
active
finding:secure-control-fine-tuning-leaves-moral-susceptibility-s-near-base-levels-for-gpt-4o-9-gpt-4-1-20-and-qwen3-235b-2Secure control fine-tuning leaves moral susceptibility S near base levels for GPT-4o (-9%), GPT-4.1 (-20%), and Qwen3-235B (+2%)
Shows that susceptibility spike is specific to misalignment-inducing training signal, not generic fine-tuning
Source paper
extracted_from(2026) · Davi Bastos Costa · Renato Vicente
Neighborhood — ranked by edge-count
Papers (1)
paper
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Third largest susceptibility spike among evaluated models
- Insecure fine-tuning produces 55% average spike in moral susceptibility S across four modelsfinding0.837Primary metric finding showing cross-persona susceptibility dysregulation from emergent misalignment fine-tuning
- GPT-4.1 robustness collapse values
- Key empirical result from Betley et al. 2025 that initiated persona vector research
- Baseline comparison from prior work used to contextualize insecure variant S values
- Qwen3-235B shows largest absolute robustness drop and large sigma surge
- Control comparison confirming ceiling shift is not a generic fine-tuning artifact
- Insecure fine-tuning affects all five moral foundations comparably; secure fine-tuning produces more foundation-specific patterns