paper
referenced-only
2025
paper:arxiv-2504-04635Steering off course: Reliability challenges in steering language models
ByPatrick Queiroz Da Silva·Hari Sethuraman·Dheeraj Rajagopal·Hannaneh Hajishirzi·Sachin Kumar
Related work— refs + corpus + external arXiv
Cited / in-corpus / arXiv badges show which signals surfaced each row. Multi-source rows weighted higher.
- Steer Like the LLM: Activation Steering that Mimics PromptingGeert Heyman and Frederik Vandeputte2026≈ 76%
- Extending Activation Steering to Broad Skills and Multiple BehavioursMassimo Poesio, Nandi Schoots Teun van der Weij2024≈ 76%
- Steering Language Model Refusal with Sparse AutoencodersDavid Majercak, Xavier Fernandes, Richard Edgar, Blake Bullwinkel, Jingya Chen, Harsha Nori, Dean Carignan, Eric Horvitz, Forough Poursabzi-Sangdeh Kyle O'Brien2025≈ 76%
- Mechanistic Indicators of Steering Effectiveness in Large Language ModelsHao Xue, Flora Salim Mehdi Jafari2026≈ 76%
- Contextual Linear Activation Steering of Language ModelsDaniel Beaglehole, Adityanarayanan Radhakrishnan, Mikhail Belkin Brandon Hsu2026≈ 75%
- Improving Activation Steering in Language Models with Mean-CentringDylan Cope, Nandi Schoots, Murray Shanahan Ole Jorgensen2023≈ 75%
- Steering Large Language Models for Machine Translation PersonalizationGabriele Sarti, Arianna Bisazza, Elisabetta Fersini, Malvina Nissim Daniel Scalena2025≈ 75%
- A gentle push funziona benissimo: making instructed models in Italian via contrastive activation steeringElisabetta Fersini, Malvina Nissim Daniel Scalena2024≈ 74%
- Improving Instruction-Following in Language Models through Activation SteeringVidhisha Balachandran, Safoora Yousefi, Eric Horvitz, Besmira Nushi Alessandro Stolfo2025≈ 74%
- Steering When Necessary: Flexible Steering Large Language Models with BacktrackingJinwei Gan, Zhiwei Jiang, Cong Wang, Yafeng Yin, Xiang Luo, Yuchen Fu, Qing Gu Zifeng Cheng2025≈ 74%
- Steer2Edit: From Activation Steering to Component-Level EditingGe Yan, Zimo Wang, Tsui-Wei Weng Chung-En Sun2026≈ 74%
- ≈ 74%
- Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representationsSadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji Sanjay Basu2026≈ 74%
- Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural RepresentationsHaijiang Yan, Thomas L. Griffiths Jian-Qiao Zhu2025≈ 73%
- Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer ConsistencyWenjing Yu, Di Wang, Lijie Hu Xinyan Jiang2026≈ 73%
- ≈ 72%
- Evaluating Language Model Character Traitsin corpus2024≈ 72%
- Psychological Steering of Large Language Modelsin corpus2026≈ 71%
- ≈ 70%
- ≈ 70%
- What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectorsin corpus2026≈ 70%
- ≈ 69%
- Verbalized Eval Awareness Inflates Measured Safetyin corpus2026≈ 69%
- Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behaviorin corpus2026≈ 69%
- ≈ 67%
- Quantitative Introspection in Language Models: Tracking Emotive States Across Conversationin corpus2026≈ 67%
- ≈ 67%
- ≈ 67%
- ≈ 66%
Similar preprints — Semantic Scholar
Cited by (2)
- Facet-Level Persona Control by Trait-Activated Routing with Contrastive SAE for Role-Playing LLMs
Facet-level personality control in role-playing LLMs is substantially improved by injecting contrastively trained sparse autoencoder (SAE) control vectors into mid-residual layers, with the CV-SAE+Pro
- Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior
Manifold steering — intervening on model activations along paths constrained to lie on a learned activation manifold M_h rather than along Euclidean linear directions — produces behavioral trajectorie