finding
active
finding:per-prompt-average-activation-of-latent-10-can-accurately-classify-aligned-vs-misaligned-models-from-a-single-evaluation-prompt

Per-prompt average activation of latent #10 can accurately classify aligned vs misaligned models from a single evaluation prompt

Demonstrates practical utility of SAE-based monitoring even with minimal sampling

Source paper

extracted_from
Persona Features Control Emergent Misalignment
(2025) · Miles Wang · Tom Dupré la Tour · Olivia Watkins · Alex Makelov +7

Neighborhood — ranked by edge-count

Related by similarity (8)

cosine ≥ 0.65 · no typed edge

Entities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.