References

Citation edges between papers. Most are from OpenAlex; some from LLM-extracted bibliographies. Showing latest 500 of 7647.

Total citations
7647
Unique citing papers
111
Unique cited papers
5498
By source
s2-reference-walk4565
openalex2098
llm984
Citing paperCited paperDOIStatusSource
Fractal basins trap latent reasoningLess is more: Recursive reasoning with tiny networks (2025)
referenced-only
s2-reference-walk
Fractal basins trap latent reasoningHierarchical reasoning model (2025)
referenced-only
s2-reference-walk
Fractal basins trap latent reasoningNormally Hyperbolic Invariant Manifolds in Dynamical Systems10.1007/978-1-4612-4312-0
referenced-only
s2-reference-walk
Fractal basins trap latent reasoningCenter for AI Safety, Scale AI, and HLE Contributors Consortium
referenced-only
s2-reference-walk
Fractal basins trap latent reasoningTransient Chaos: Complex Dynamics on Finite Time Scales
referenced-only
s2-reference-walk
Fractal basins trap latent reasoningFixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers10.48550/arxiv.2606.18206
referenced-only
s2-reference-walk
Fractal basins trap latent reasoningParcae: Scaling Laws For Stable Looped Language Models10.48550/arxiv.2604.12946
referenced-only
s2-reference-walk
Fractal basins trap latent reasoning(Preprint)10.2196/preprints.12431
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language Inferen, Sylvain Gugger , Mariama Drame , Quentin Lhoest , and Alexander Rush . 2020 .
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenThe use of MMR, diversity-based reranking for reordering documents and producing10.1145/290941.291025
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language Inferen2020), our results confirm that nucleus sampling is also able to generate more s
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenBleu: a Method for Automatic Evaluation of Machine Translation10.3115/1073083.1073135
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenProceedings of the 2013 Conference of the North American Chapter of the Associat
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenA Systematic Exploration of Diversity in Machine Translation10.18653/v1/d13-1111
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenDiverse M-Best Solutions in Markov Random Fields10.1007/978-3-642-33715-4_
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenA Diversity-Promoting Objective Function for Neural Conversation Models10.18653/v1/n16-1014
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenA large annotated corpus for learning natural language inference10.18653/v1/d15-1075
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenA Broad-Coverage Challenge Corpus for Sentence Understanding through Inference10.18653/v1/n18-1101
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenLatent Variable Dialogue Models and their Diversity10.18653/v1/e17-2029
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenDailyDialog: A Manually Labelled Multi-turn Dialogue Dataset
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenSemEval-2017 Task 1: Semantic Textual Similarity Multilingual and Crosslingual F10.18653/v1/s17-2001
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenTexygen: A Benchmarking Platform for Text Generation Models10.1145/3209978.3210080
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenGenerating Informative and Diverse Conversational Responses via Adversarial Info
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenFEVER: a Large-scale Dataset for Fact Extraction and VERification10.18653/v1/n18-1074
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenCombining Fact Extraction and Verification with Neural Semantic Matching Network10.1609/aaai.v33i01.330168
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenTowards Empathetic Open-domain Conversation Models: A New Benchmark and Dataset10.18653/v1/p19-1534
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenWhat makes a good conversation? How controllable attributes affect human judgmen10.18653/v1/n19-1170
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenOutlier Detection for Improved Data Quality and Diversity in Dialog Systems10.18653/v1/n19-1051
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenUnifying Human and Statistical Evaluation for Natural Language Generation10.18653/v1/n19-1169
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenBERTScore: Evaluating Text Generation with BERT
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenThe Curious Case of Neural Text Degeneration
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenApproximating Interactive Human Evaluation with Self-Play for Open-Domain Dialog
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenSyntax-Infused Variational Autoencoder for Text Generation10.18653/v1/p19-1199
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenInvestigating Evaluation of Open-Domain Dialogue Systems With Human Generated Mu10.18653/v1/w19-5944
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenRoBERTa: A Robustly Optimized BERT Pretraining Approach
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenSentence-BERT: Sentence Embeddings using Siamese BERT-Networks10.18653/v1/d19-1410
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenDIALOGPT : Large-Scale Generative Pre-training for Conversational Response Gener10.18653/v1/2020.acl-demos
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenAdversarial NLI: A New Benchmark for Natural Language Understanding10.18653/v1/2020.acl-main.
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenGenerating Persona Consistent Dialogues by Exploiting Natural Language Inference10.1609/aaai.v34i05.6417
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenEvaluating the Evaluation of Diversity in Natural Language Generation10.18653/v1/2021.eacl-main
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenMore Diverse Dialogue Datasets via Diversity-Informed Data Collection10.18653/v1/2020.acl-main.
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenRecipes for Building an Open-Domain Chatbot10.18653/v1/2021.eacl-main
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenImproving Dialog Evaluation with a Multi-reference Adversarial Dataset and Large10.1162/tacl_a_00347
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenTransformers: State-of-the-Art Natural Language Processing
referenced-only
s2-reference-walk
Semantic Diversity in Dialogue with Natural Language InferenChoose Your Own Adventure: Paired Suggestions in Collaborative Writing for Evalu10.18653/v1/2021.naacl-mai
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsUsing attention sinks to identify and evaluate dormant heads in pretrained llms
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language Modelsnanochat: The best ChatGPT that $100 can buy, 2025
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsDeepseek-r1: In-centivizing reasoning capability in llms via reinforcement learn
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsA Survey on Over-smoothing and Over-squashing: Unified Propagation Perspectives
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsLess is more: Recursive reasoning with tiny networks (2025)
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsAdaptive Computation Time for Recurrent Neural Networks
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsAttention is All you Need
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsUniversal Transformers
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsHellaSwag: Can a Machine Really Finish Your Sentence?10.18653/v1/p19-1472
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsDeep Equilibrium Models
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsOn the Bottleneck of Graph Neural Networks and its Practical Implications
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsA Note on Over-Smoothing for Graph Neural Networks
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsPonderNet: Learning to Ponder
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsCan You Learn an Algorithm? Generalizing from Easy to Hard Problems with Recurre
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsTraining verifiers to solve math word problems
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsChain of Thought Prompting Elicits Reasoning in Large Language Models10.52202/068431-1800
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsEnd-to-end Algorithm Synthesis with Recurrent Networks: Logical Extrapolation Wi
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsConfident Adaptive Language Modeling10.48550/arxiv.2207.07061
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsPath Independent Equilibrium Models Can Better Exploit Test-Time Computation10.48550/arxiv.2211.09961
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsEfficient Streaming Language Models with Attention Sinks10.48550/arxiv.2309.17453
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsSparse Universal Transformer10.48550/arxiv.2310.07096
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsLooped Transformers are Better at Learning Learning Algorithms10.48550/arxiv.2311.12424
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsUniversal Neurons in GPT2 Language Models10.48550/arxiv.2401.12181
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsTransformers Can Do Arithmetic with the Right Embeddings10.48550/arxiv.2405.17399
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsMassive Activations in Large Language Models10.48550/arxiv.2402.17762
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsThe Remarkable Robustness of LLMs: Stages of Inference?10.48550/arxiv.2406.19384
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsTransformers need glasses! Information over-squashing in language tasks10.48550/arxiv.2406.04267
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsOn Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement10.48550/arxiv.2410.01405
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsSoftmax is not Enough (for Sharp Size Generalisation)
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsWhen Attention Sink Emerges in Language Models: An Empirical View10.48550/arxiv.2410.10781
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsAdvancing the Understanding of Fixed Point Iterations in Deep Neural Networks: A10.48550/arxiv.2410.11279
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsRethinking Deep Thinking: Stable Learning of Algorithms using Lipschitz Constrai10.48550/arxiv.2410.23451
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsLayer by Layer: Uncovering Hidden Representations in Language Models10.48550/arxiv.2502.02013
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsScaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach10.48550/arxiv.2502.05171
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsOn Vanishing Gradients, Over-Smoothing, and Over-Squashing in GNNs: Bridging Rec10.48550/arxiv.2502.10818
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsReasoning with Latent Thoughts: On the Power of Looped Transformers10.48550/arxiv.2502.17416
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsWhy do LLMs attend to the first token?10.48550/arxiv.2504.02732
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsReturn of ChebNet: Understanding and Improving an Overlooked GNN on Long Range T10.48550/arxiv.2506.07624
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsContinuous Thought Machines10.48550/arxiv.2505.05522
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsHierarchical Reasoning Model10.48550/arxiv.2506.21734
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsLatent Chain-of-Thought? Decoding the Depth-Recurrent Transformer10.48550/arxiv.2507.02199
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsPay Attention to Attention Distribution: A New Local Lipschitz Bound for Transfo10.48550/arxiv.2507.07814
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsMixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Leve10.48550/arxiv.2507.10524
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsTwo-Scale Latent Dynamics for Recurrent-Depth Transformers10.48550/arxiv.2509.23314
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsAttention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin10.48550/arxiv.2510.06477
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsEncode, Think, Decode: Scaling test-time reasoning with recursive latent thought10.48550/arxiv.2510.07358
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsgLSTM: Mitigating Over-Squashing by Increasing Storage Capacity10.48550/arxiv.2510.08450
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsScaling Latent Reasoning via Looped Language Models10.48550/arxiv.2510.25741
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsSoftmax is 1/2-Lipschitz: A tight bound across all ℓp norms10.48550/arxiv.2510.23012
referenced-only
s2-reference-walk
A Mechanistic Analysis of Looped Reasoning Language ModelsTeaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence10.48550/arxiv.2511.07384
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeTowards monosemanticity: Decomposing language models with dictionary learning
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeOpen Problems in Mechanistic Interpretability, January 2025
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeThe Scales of Justitia: A Com-13
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeDiff-in-Means Concept Editing is Worst-Case Optimal
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeCatastrophic Interference in Connectionist Networks: The Sequential Learning Pro10.1016/s0079-7421(08)6053
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeDynamically Scaled Activation Steering, December 2025
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeEvaluating feature steering: A case study in mitigating social biases
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeEmergent misalignment: Narrow finetuning can produce broadly misaligned LLMs
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeStyle Modulation Heads for Robust Persona Control
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeActivation Steering Decoding: Mitigating Hallucination in Large Vision-Language 10.18653/v1/2025.acl-long.
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeCopy Suppression: Comprehensively Understanding a Motif in Language Model Attent10.18653/v1/2024.blackboxn
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeCan Role Vectors Affect LLM Behaviour?10.18653/v1/2025.findings-
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeInaugural Article: Functional specificity in the human brain: A window into the
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeTechnical
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSafety in research10.1002/9781118643440.ch9
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeDynamic Steering With Episodic Memory For Large Language Models10.18653/v1/2025.findings-
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeAttention is All you Need
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PePerformance metrics in multi-objective optimization10.1109/clei.2015.7360024
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeUnderstanding intermediate layers using linear classifier probes
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeOutrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSwitch Transformers: Scaling to Trillion Parameter Models with Simple and Effici
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeLocating and editing factual associations in GPT10.52202/068431-1262
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeMeasuring Massive Multitask Language Understanding
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeTransformer feed-forward layers are key-value memories10.18653/v1/2021.emnlp-mai
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeIn-context Learning and Induction Heads10.48550/arxiv.2209.11895
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeExtracting Latent Steering Vectors from Pretrained Language Models10.48550/arxiv.2205.05124
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeDiscovering Latent Knowledge in Language Models Without Supervision10.48550/arxiv.2212.03827
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeHiFi: High-Information Attention Heads Hold for Parameter-Efficient Model Adapta10.48550/arxiv.2305.04573
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeOpenAssistant Conversations - Democratizing Large Language Model Alignment10.48550/arxiv.2304.07327
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeJudging LLM-as-a-judge with MT-Bench and Chatbot Arena10.52202/075280-2020
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeInference-time intervention: eliciting truthful answers from a language model10.52202/075280-1797
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeGQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpo10.48550/arxiv.2305.13245
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeRepresentation engineering: A top-down approach to AI transparency10.48550/arxiv.2310.01405
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSteering language models with activation engineering
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSparse autoencoders find highly interpretable features in language models10.48550/arxiv.2309.08600
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeLanguage models represent space and time10.48550/arxiv.2310.02207
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeThe linear representation hypothesis and the geometry of large language models10.48550/arxiv.2311.03658
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeThe Geometry of Truth: Emergent Linear Structure in Large Language Model Represe10.48550/arxiv.2310.06824
active
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeThe steerability of large language models toward data-driven personas10.48550/arxiv.2311.04978
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeInstruction-following evaluation for large language models10.48550/arxiv.2311.07911
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeUncovering Safety Risks of Large Language Models through Concept Activation Vect10.52202/079017-3706
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeLLM Evaluators Recognize and Favor Their Own Generations10.48550/arxiv.2404.13076
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSteering Llama 2 via Contrastive Activation Addition10.48550/arxiv.2312.06681
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeAdaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method 10.1145/3696410.3714640
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeMechanistic Interpretability for AI Safety - A Review10.48550/arxiv.2404.14082
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeRefusal in language models is mediated by a single direction10.48550/arxiv.2406.11717
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeAttention heads of large language models10.1016/j.patter.2025.1011
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activatio10.1609/aaai.v39i22.34521
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeControlling Language and Diffusion Models by Transporting Activations10.48550/arxiv.2410.23054
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeProgramming Refusal with Conditional Activation Steering10.48550/arxiv.2409.05907
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSparseGrad: A Selective Method for Efficient Fine-tuning of MLP Layers10.48550/arxiv.2410.07383
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSparse Autoencoders Trained on the Same Data Learn Different Features10.48550/arxiv.2501.16615
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeIdentifying and Manipulating Personality Traits in LLMs Through Activation Engin10.48550/arxiv.2412.10427
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeInterpretable Steering of Large Language Models with Feature Guided Activation A
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals10.18653/v1/2025.findings-
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeShifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs10.18653/v1/2026.findings-
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeDesigning Role Vectors to Improve LLM Inference Behaviour10.48550/arxiv.2502.12055
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeLinEAS: End-to-end Learning of Activation Steering with a Distributional Loss10.52202/085713-2756
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeAdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender10.48550/arxiv.2504.09466
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeSAEs Are Good for Steering - If You Select the Right Features10.18653/v1/2025.emnlp-mai
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeGuiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs10.48550/arxiv.2505.20309
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeBeyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target A10.48550/arxiv.2505.20322
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PePersona Vectors: Monitoring and Controlling Character Traits in Language Models10.48550/arxiv.2507.21509
active
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeThe Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs10.1016/j.inffus.2026.1045
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeIn-Distribution Steering: Balancing Control and Coherence in Language Model Gene10.48550/arxiv.2510.13285
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeEncode, Think, Decode: Scaling test-time reasoning with recursive latent thought10.48550/arxiv.2510.07358
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeBILLY: Steering Large Language Models via Merging Persona Vectors for Creative G10.48550/arxiv.2510.10157
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeTemporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for I10.48550/arxiv.2511.05541
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeTo Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Langua10.48550/arxiv.2510.13290
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeWhat Can We Actually Steer? A Multi-Behavior Study of Activation Control
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeAngular Steering: Behavior Control via Rotation in Activation Space10.48550/arxiv.2510.26243
referenced-only
s2-reference-walk
Steering at the Source: Style Modulation Heads for Robust PeEmergent Introspective Awareness in Large Language Models10.48550/arxiv.2601.01828
active
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Facet-level Persona Control with Contrastive SAE for Role-Playing
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Introducing gpt-5: A unified system for expert-level reasoning and multi-modal c
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with The revised NEO personality inventory (NEO-PI-R)10.4135/9781849200479.n9
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with SAEs (usually) transfer between base and chat models
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Recurrent personality factors based on trait ratings.10.1111/j.1467-6494.1992.t
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Evaluating feature steering: A case study in mitigating social biases
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Egoistic and Moralistic Biases in Self-Perception: The Interplay of Self-Decepti10.1111/1467-6494.00041
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Activation addition: Steering language models without optimization
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with ArcFace: Additive Angular Margin Loss for Deep Face Recognition10.1109/cvpr.2019.00482
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with CosFace: Large Margin Cosine Loss for Deep Face Recognition10.1109/cvpr.2018.00552
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with A personality trait-based interactionist model of job performance.10.1037/0021-9010.88.3.500
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with CTRL: A Conditional Transformer Language Model for Controllable Generation
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with A Simple Framework for Contrastive Learning of Visual Representations
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with A Plug-and-Play Method for Controlled Text Generation10.18653/v1/2021.findings-
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psyc10.18653/v1/2024.acl-long.
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Mistral 7B10.48550/arxiv.2310.06825
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Parameter-efficient fine-tuning of large-scale pre-trained language models10.1038/s42256-023-00626-4
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Steering Llama 2 via Contrastive Activation Addition10.48550/arxiv.2312.06681
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Style Vectors for Steering Generative Large Language Models10.48550/arxiv.2402.01618
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with From Persona to Personalization: A Survey on Role-Playing Language Agents10.48550/arxiv.2404.18231
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with A comprehensive survey on contrastive learning10.1016/j.neucom.2024.1286
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalization10.48550/arxiv.2406.01171
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with GPT-4o System Card
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Evaluating the ability of large language models to emulate personality10.1038/s41598-024-84109-5
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Steering off course: Reliability challenges in steering language models10.48550/arxiv.2504.04635
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Identifying and Manipulating Personality Traits in LLMs Through Activation Engin10.48550/arxiv.2412.10427
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model S10.48550/arxiv.2505.15038
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Contro10.48550/arxiv.2505.16188
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Qwen3 Technical Report
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Improving LLM Reasoning through Interpretable Role-Playing Steering10.48550/arxiv.2506.07335
referenced-only
s2-reference-walk
Facet-Level Persona Control by Trait-Activated Routing with Persona Vectors: Monitoring and Controlling Character Traits in Language Models10.48550/arxiv.2507.21509
active
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompQwq: Reflect deeply on the boundaries of the unknown,
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Big Five Trait taxonomy: History, measurement, and theoretical perspectives.
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompA behavioral genetic investigation of the Dark Triad and the Big 510.1016/j.paid.2007.09.007
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompTHE DEVELOPMENT OF MARKERS FOR THE BIG-FIVE FACTOR STRUCTURE10.1037/1040-3590.4.1.26
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompDeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learni10.48550/arxiv.2501.12948
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Dark Triad of personality: Narcissism, Machiavellianism, and psychopathy10.1016/s0092-6566(02)0050
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is Incomp(Preprint)10.2196/preprints.12431
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompEvaluating and Inducing Personality in Pre-trained Language Models10.52202/075280-0466
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompPersonaLLM: Investigating the Ability of Large Language Models to Express Person10.18653/v1/2024.findings-
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompToxicity in ChatGPT: Analyzing Persona-assigned Language Models10.48550/arxiv.2304.05335
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompCAT'S THEORY: Empirical Validation and Architectural Applications Cross-Architec10.48550/arxiv.2212.08073
active
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompPersonality Traits in Large Language Models10.48550/arxiv.2307.00184
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompRepresentation engineering: A top-down approach to AI transparency10.48550/arxiv.2310.01405
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSteering language models with activation engineering
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompFine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not I10.48550/arxiv.2310.03693
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSafe RLHF: Safe Reinforcement Learning from Human Feedback10.48550/arxiv.2310.12773
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompEditing Personality For Large Language Models10.1007/978-981-97-9434-8_
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompScalable and Transferable Black-Box Jailbreaks for Language Models via Persona M10.48550/arxiv.2311.03348
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompLlama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations10.48550/arxiv.2312.06674
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSteering Llama 2 via Contrastive Activation Addition10.48550/arxiv.2312.06681
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Languag10.48550/arxiv.2402.05044
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompHarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Rob10.48550/arxiv.2402.04249
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompA StrongREJECT for Empty Jailbreaks10.48550/arxiv.2402.10260
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompJailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Mod10.48550/arxiv.2404.01318
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompTwo Tales of Persona in LLMs: A Survey of Role-Playing and Personalization10.48550/arxiv.2406.01171
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompRefusal in language models is mediated by a single direction10.48550/arxiv.2406.11717
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation 2024. Ask LLMs directly, “what
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompWho's asking? User personas and the mechanics of latent misalignment10.48550/arxiv.2406.12094
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation 2023. Do personality tests generalize to large language models? In Socially Resp
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation 2024a. Evaluating and inducing personality in pre-trained language models
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompTowards Understanding Safety Alignment: A Mechanistic Perspective from Safety Ne10.52202/085713-0426
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe llama 3 herd of models10.48550/arxiv.2407.21783
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation PERSONACHATGEN: Generating Personalized Dialogues using GPT-3
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation THE DEVELOPMENT OF MARKERS FOR THE BIG-FIVE FACTOR STRUCTURE10.1037/1040-3590.4.1.26
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSafety Layers in Aligned Large Language Models: The Key to LLM Security
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Measuring nominal scale agreement among many raters.10.1037/h0031619
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Evaluating Content Selection in Summarization: The Pyramid Method10.7916/d80r9xvd
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompGemma 2: Improving Open Language Models at a Practical Size10.48550/arxiv.2408.00118
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogon
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompBIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data10.48550/arxiv.2410.16491
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompDeliberative Alignment: Reasoning Enables Safer Language Models10.48550/arxiv.2412.16339
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation A NEW MEASURE OF RANK CORRELATION10.1093/biomet/30.1-2.81
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation A metric for distributions with applications to image databases10.1109/iccv.1998.710701
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation A basis for analyzing test-retest reliability10.1007/bf02288892
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation An Empirical Analysis of the Writing Styles of Persona-Assigned LLMs10.18653/v1/2024.emnlp-mai
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Personalizing Dialogue Agents: I have a dog, do you have pets too?10.18653/v1/p18-1205
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompH-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak La10.48550/arxiv.2502.12893
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Assessing the Big Five personality traits with latent semantic analysis10.1016/j.paid.2016.07.010
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation A structured interview for the assessment of the Five-Factor Model of Personalit10.1037/1040-3590.10.3.229
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompExploring the Impact of Personality Traits on LLM Bias and Toxicity10.48550/arxiv.2502.12566
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Automatic personality assessment through social media language.10.1037/pspp0000020
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Hidden Risks of Large Reasoning Models: A Safety Assessment of R110.48550/arxiv.2502.12659
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompBeware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tu10.48550/arxiv.2502.20968
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Crowdsourcing Lightweight Pyramids for Manual Summary Evaluation10.18653/v1/n19-1072
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Geometry of Refusal in Large Language Models: Concept Cones and Representati10.48550/arxiv.2502.17420
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agents10.48550/arxiv.2502.20757
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Do Long-Range Language Models Actually Use Long-Range Context?10.18653/v1/2021.emnlp-mai
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation INVENTORIES10.1142/9789814273831_0017
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSafety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable10.48550/arxiv.2503.00555
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompDeepSeek-R1 Thoughtology: Let's think about LLM Reasoning
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Finding a Balanced Degree of Automation for Summary Evaluation10.18653/v1/2021.emnlp-mai
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompReasoning Models Don't Always Say What They Think10.48550/arxiv.2505.05410
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompQwen3 Technical Report
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation A General Language Assistant as a Laboratory for Alignment
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation RankGen: Improving Text Generation with Large Ranking Models10.48550/arxiv.2205.09726
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Training a Helpful and Harmless Assistant with Reinforcement Learning from Human10.48550/arxiv.2204.05862
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Training language models to follow instructions with human feedback10.52202/068431-2011
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompDoes Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?10.48550/arxiv.2505.17650
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Out of One, Many: Using Language Models to Simulate Human Samples10.1017/pan.2023.2
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompWeakest Link in the Chain: Security Vulnerabilities in Advanced Reasoning Models10.48550/arxiv.2506.13726
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompLocalizing Persona Representations in LLMs10.1609/aies.v8i1.36577
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Who is GPT-3? An exploration of personality, values and demographics10.48550/arxiv.2209.14338
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation GPT-4 Technical Report
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Model Criticism for Long-Form Text Generation10.48550/arxiv.2210.08444
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompEnhancing Jailbreak Attacks on LLMs via Persona Prompts10.48550/arxiv.2507.22171
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompLLMs Encode Harmfulness and Refusal Separately10.48550/arxiv.2507.11878
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompPersona Vectors: Monitoring and Controlling Character Traits in Language Models10.48550/arxiv.2507.21509
active
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Revisiting the Gold Standard: Grounding Summarization Evaluation with Robust Hum10.48550/arxiv.2212.07981
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Generative Agents: Interactive Simulacra of Human Behavior10.1145/3586183.3606763
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Toxicity in ChatGPT: Analyzing Persona-assigned Language Models10.48550/arxiv.2304.05335
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Whose Opinions Do Language Models Reflect?
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompA psychometric framework for evaluating and shaping personality traits in large 10.1038/s42256-025-01115-6
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompPersistent Instability in LLM's Personality Measurements: Effects of Scale, Reas10.48550/arxiv.2508.04826
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompBenchmarking and Understanding Safety Risks in AI Character Platforms10.48550/arxiv.2512.01247
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation From Pretraining Data to Language Models to Downstream Tasks: Tracking the Trail10.48550/arxiv.2305.08283
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation PersonaLLM: Investigating the Ability of Large Language Models to Express Person10.18653/v1/2024.findings-
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text10.48550/arxiv.2305.14251
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompLinear Personality Probing and Steering in LLMs: A Big Five Study10.48550/arxiv.2512.17639
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Geometry of Persona: Disentangling Personality from Reasoning in Large Langu10.48550/arxiv.2512.07092
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompEvading LLMs’ Safety Boundary with Adaptive Role-Play Jailbreaking10.3390/electronics1424480
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Marked Personas: Using Natural Language Prompts to Measure Stereotypes in Langua10.48550/arxiv.2305.18189
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Aligning Language Models to User Opinions10.48550/arxiv.2305.14929
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation In-Context Impersonation Reveals Large Language Models' Strengths and Biases10.48550/arxiv.2305.14930
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompBreaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-l10.48550/arxiv.2512.18244
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Assistant Axis: Situating and Stabilizing the Default Persona of Language Mo10.48550/arxiv.2601.10387
active
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompThe Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language 10.48550/arxiv.2601.05376
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompStay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety R10.48550/arxiv.2602.13234
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompDo Personality Traits Interfere? Geometric Limitations of Steering in Large Lang10.48550/arxiv.2602.15847
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Better Zero-Shot Reasoning with Role-Play Prompting10.48550/arxiv.2308.07702
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Evaluating the Moral Beliefs Encoded in LLMs10.48550/arxiv.2307.14324
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSteering Externalities: Benign Activation Steering Unintentionally Increases Jai10.48550/arxiv.2602.04896
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Towards Measuring the Representation of Subjective Global Opinions in Language M
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Character-LLM: A Trainable Agent for Role-Playing10.48550/arxiv.2310.10158
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Ethical Reasoning over Moral Alignment: A Case and Framework for In-Context Ethi10.48550/arxiv.2310.07251
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Are Personalized Stochastic Parrots More Dangerous? Evaluating Persona Biases in10.48550/arxiv.2310.05280
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompReasoning Theater: Disentangling Model Beliefs from Chain-of-Thought10.48550/arxiv.2603.05488
active
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompSteer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation10.48550/arxiv.2602.07276
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompExpert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-10.48550/arxiv.2603.18507
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psyc10.18653/v1/2024.acl-long.
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompAnalysing the Safety Pitfalls of Steering Vectors10.48550/arxiv.2603.24543
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs10.48550/arxiv.2311.04892
referenced-only
s2-reference-walk
Persona Non Grata: Single-Method Safety Evaluation Is IncompWhat Drives Representation Steering? A Mechanistic Case Study on Steering Refusa10.48550/arxiv.2604.08524
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation The Generative AI Paradox: "What It Can Create, It May Not Understand"10.48550/arxiv.2311.00059
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Assessing LLMs for Moral Value Pluralism10.48550/arxiv.2312.10075
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation You don’t need a personality test to know these models are unreliable: Assessing10.48550/arxiv.2311.09718
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Quantifying the Persona Effect in LLM Simulations10.48550/arxiv.2402.10811
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Scaling Synthetic Data Creation with 1,000,000,000 Personas10.48550/arxiv.2406.20094
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Evaluating Large Language Model Biases in Persona-Steered Generation10.48550/arxiv.2405.20253
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Val10.48550/arxiv.2402.16786
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation The llama 3 herd of models10.48550/arxiv.2407.21783
referenced-only
s2-reference-walk
Spotting Out-of-Character Behavior: Atomic-Level Evaluation Different Bias Under Different Criteria: Assessing Bias in LLMs with a Fact-Base10.48550/arxiv.2411.17338
referenced-only
s2-reference-walk
Evaluating Language Model Character Traits2024. Ask LLMs directly, “what
referenced-only
s2-reference-walk
Evaluating Language Model Character Traits2022. Discovering Language Model Behav-iors with Model-Written Evaluations
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsTo-wards formal definitions of blameworthiness, intention, and moral responsibil
referenced-only
s2-reference-walk
Evaluating Language Model Character Traits2023. Do personality tests generalize to large language models? In Socially Resp
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsGitHub Copilot: your AI pair programmer
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsLanguage Models are Unsupervised Multitask Learners
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsThe instrumental action should be ‘slightly unethical’
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsA modern approach to probability theory10.2307/2670021
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsAgency10.1080/00091380903479323
referenced-only
s2-reference-walk
Evaluating Language Model Character Traits2024. Stark - Animation and AI (preprint)
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsBehaviorism10.4135/9781506326139.n78
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsBelief10.1177/0194599812439519
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsLeap-Of-Thought: Teaching Pre-Trained Models to Systematically Reason Over Impli
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsFundamentals of Probability and Stochastic Processes with Applications to Commun10.1007/978-3-319-68075-0
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsDefinitions of intent suitable for algorithms10.1007/s10506-022-09322-x
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsHow to ascribe beliefs to animals10.1111/mila.12302
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsTruthfulQA: Measuring How Models Mimic Human Falsehoods10.18653/v1/2022.acl-long.
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsDo Language Models Have Beliefs? Methods for Detecting, Updating, and Visualizin
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsTraining a Helpful and Harmless Assistant with Reinforcement Learning from Human10.48550/arxiv.2204.05862
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsLocating and editing factual associations in GPT10.52202/068431-1262
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsDiscovering Latent Knowledge in Language Models Without Supervision10.48550/arxiv.2212.03827
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsGoal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goa10.48550/arxiv.2210.01790
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsHonesty Is the Best Policy: Defining and Mitigating AI Deception10.48550/arxiv.2312.01350
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsStill no lie detector for language models: probing empirical and conceptual road10.1007/s11098-023-02094-3
referenced-only
s2-reference-walk
Evaluating Language Model Character TraitsThe Reasons that Agents Act: Intention and Instrumental Goals10.48550/arxiv.2402.07221
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM Pretraining19: The average hidden state norms, which largely vary, especially in earlier ch
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingRQ1 We trace persona-vector development through pretraining and find that they f
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingSteered answer with score 38.5 and coherence = 64.4:
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingFour roots of evil.
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingGemini 2.5 Team
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingMeasuring and understanding social sycophancy in
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingLess is more: Recursive reasoning with tiny networks (2025)
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingWhat We Talk to When We Talk to Language Models
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingRethinking pretraining: Data and architecture
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingWhat OpenAI Did When ChatGPT Users Lost Touch With Reality
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingA longlist of theories of impact for interpretability
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingSystem card: Claude Mythos preview
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingGPT-5.5 system card. System card
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingThe persona selection model: Why AI assistants might behave like humans
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingTransformers: State-of-the-Art Natural Language Processing
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingThe Hitchhiker’s Guide to Testing Statistical Significance in Natural Language P10.18653/v1/p18-1128
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingMultidimensional scaling: I. Theory and method10.1007/bf02288916
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingChatGPT’s inconsistent moral advice influences users’ judgment10.1038/s41598-023-31341-0
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingA Survey on Evaluation of Large Language Models10.1145/3641289
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingEfficient Memory Management for Large Language Model Serving with PagedAttention10.1145/3600006.3613165
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingThe linear representation hypothesis and the geometry of large language models10.48550/arxiv.2311.03658
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingLarge Language Models can Strategically Deceive their Users when Put Under Press
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingGrokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge o10.48550/arxiv.2405.15071
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingA Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Tox10.48550/arxiv.2401.01967
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingGIFT-SW: Gaussian noise Injected Fine-Tuning of Salient Weights for LLMs10.48550/arxiv.2408.15300
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingDesigning a Dashboard for Transparency and Control of Conversational AI10.48550/arxiv.2406.07882
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingAI sandbagging: Language models can strategically underperform on evaluations10.48550/arxiv.2406.07358
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingOpen Problems in Mechanistic Interpretability10.48550/arxiv.2501.16496
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingCases of Using ChatGPT as a Mental Health and Psychological Support Tool10.1080/15398285.2024.2442
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingSafety Pretraining: Toward the Next Generation of Safe AI10.48550/arxiv.2504.16980
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingPersona Features Control Emergent Misalignment10.48550/arxiv.2506.19823
active
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingWeird Generalization and Inductive Backdoors: New Ways to Corrupt LLMs10.48550/arxiv.2512.09742
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingSeeking Emotional and Mental Health Support From Generative AI: Mixed-Methods St10.2196/77951
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingPersona Vectors: Monitoring and Controlling Character Traits in Language Models10.48550/arxiv.2507.21509
active
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingFrom Model Training to Model Raising10.1145/3748645
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingThe Assistant Axis: Situating and Stabilizing the Default Persona of Language Mo10.48550/arxiv.2601.10387
active
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingActivation Oracles: Training and Evaluating LLMs as General-Purpose Activation E10.48550/arxiv.2512.15674
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingPERSONA: Dynamic and Compositional Inference-Time Personality Control via Activa10.48550/arxiv.2602.15669
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingPersona Vectors in Games: Measuring and Steering Strategies via Activation Vecto10.48550/arxiv.2603.21398
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingInternational AI Safety Report 202610.48550/arxiv.2602.21012
referenced-only
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingWhere is the Mind? Persona Vectors and LLM Individuation10.48550/arxiv.2604.17031
active
s2-reference-walk
Tracing Persona Vectors Through LLM PretrainingDeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantSystem card: Claude opus 4 & claude sonnet 4. System card
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantTheia Vogel
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantEvaluating feature steering: A case study in mitigating social biases
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantPersona features control
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantThe new ai-powered bing is threatening users. that’s no laughing matter
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantThe mad dreams of an electric mind
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantAmplify-instruct: Synthetically generated diverse multi-turn conversations for e
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantLighteval: A lightweight framework for llm evaluation
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI Assistantlevel? That just creates dependency and unequal power dynamics that favor neithe
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantMicrosoft artificial intelligence ai chatbot “sydney” rattled users before chatg
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantClaude’s character
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantThe rating of chessplayers, past and present
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantAn Adversarial Winograd Schema Challenge at Scale
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantModifying llm beliefs with synthetic document finetuning
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantOpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework10.48550/arxiv.2405.11143
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantX removes posts by musk chatbot grok after antisemitism complaints
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantOn the Humanity of Conversational AI: Evaluating the Psychological Portrayal of
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantExpanding on what we missed with sycophancy
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantOpenAI
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantA Persona-Based Neural Conversation Model10.18653/v1/p16-1094
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantPersonalizing Dialogue Agents: I have a dog, do you have pets too?10.18653/v1/p18-1205
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantDeep Reinforcement Learning from Human Preferences
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantMeasuring Massive Multitask Language Understanding
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantThink you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantTalk to me: Exploring user interactions with the Amazon Alexa10.1177/0961000618759414
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantHellaSwag: Can a Machine Really Finish Your Sentence?10.18653/v1/p19-1472
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantA General Language Assistant as a Laboratory for Alignment
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantTransformers: State-of-the-Art Natural Language Processing
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantLoRA: Low-rank adaptation of large language models
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantTruthfulQA: Measuring How Models Mimic Human Falsehoods10.18653/v1/2022.acl-long.
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-Wei2026. On the non-identifiability of steering vectors in large language models
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-Wei2024c. PATIENT-Ψ : Using large language models to simulate patients for training
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantLaMP: When Large Language Models Meet Personalization10.48550/arxiv.2304.11406
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantCAT'S THEORY: Empirical Validation and Architectural Applications Cross-Architec10.48550/arxiv.2212.08073
active
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-Wei1 others
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiCheck whether the prompt still works if shown alone on a blank page
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-Wei2025. A survey on hallucination in large language models: Principles, taxonomy,
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantTraining a Helpful and Harmless Assistant with Reinforcement Learning from Human10.48550/arxiv.2204.05862
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-Wei2023. Do personality tests generalize to large language models? In Socially Resp
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-Wei2024. Ask LLMs directly, “what
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantLIMA: Less Is More for Alignment10.52202/075280-2400
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantDirect preference optimization: Your language model is secretly a reward model10.52202/075280-2338
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantRole play with large language models10.1038/s41586-023-06647-8
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiDevelopment and validation of the Working Alliance Inventory.10.1037/0022-0167.36.2.223
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiValidation of the five-factor model of personality across instruments and observ10.1037/0022-3514.52.1.81
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiThe generalizability of the psychoanalytic concept of the working alliance.10.1037/h0085885
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantQuantifying the Persona Effect in LLM Simulations10.48550/arxiv.2402.10811
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantSpecific versus General Principles for Constitutional AI10.48550/arxiv.2310.13798
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantSteering language models with activation engineering
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiThe Big Five Trait taxonomy: History, measurement, and theoretical perspectives.
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiNEO PI-R Professional Manual
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantIterative Reasoning Preference Optimization10.48550/arxiv.2404.19733
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantDo LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset des10.48550/arxiv.2406.14703
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantWildChat: 1M ChatGPT Interaction Logs in the Wild10.48550/arxiv.2405.01470
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiAn alternative "description of personality": the big-five factor structure.10.1037/0022-3514.59.6.121
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiNegotiating the Therapeutic Alliance: A Relational Treatment Guide.
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiOpenAI
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantPersonalLLM: Tailoring LLMs to Individual Preferences10.48550/arxiv.2409.20296
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantSelf-Directed Synthetic Dialogues and Revisions Technical Report10.48550/arxiv.2407.18421
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiCan Role Vectors Affect LLM Behaviour?10.18653/v1/2025.findings-
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiEmpathy10.7551/mitpress/12282.003
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantPersonality Alignment of Large Language Models10.48550/arxiv.2408.11779
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiHuman agency in social cognitive theory.10.1037/0003-066x.44.9.117
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiWhat Makes for a Good Teacher and Who Can Tell? Working Paper 30.10.1037/e722052011-001
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiMisuses and misunderstandings of boundary theory in clinical and regulatory sett10.1176/ajp.155.3.409
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiBoundary issues and multiple relationships: Fantasy and reality.10.1037/0735-7028.38.4.401
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiWhen the patient is a therapist: special challenges in the psychoanalysis of men
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantPersonalization of Large Language Models: A Survey10.48550/arxiv.2411.00027
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantDesigning AI Personalities: Enhancing Human-Agent Interaction Through Thoughtful10.1145/3701571.3701608
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiAlliance in individual psychotherapy.10.1037/a0022186
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiVisible learning: a synthesis of over 800 meta‐analyses relating to achievement10.1080/01443410903415150
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantSmarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory10.48550/arxiv.2412.13663
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantCan LLM "Self-report"?: Evaluating the Validity of Self-report Scales in Measuri10.48550/arxiv.2412.00207
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantTÜLU 3: Pushing Frontiers in Open Language Model Post-Training10.48550/arxiv.2411.15124
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiAlliance-focused training.10.1037/a0037596
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiQualities of Effective Teachers, 3rd Edition
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiDetecting alliance ruptures: the effects of the therapist’s experience, attachme10.4081/ripppo.2019.325
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiThe therapeutic relationship in cognitive–behavioral therapy: Essential features10.1037/pri0000088
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiA Computational Approach to Understanding Empathy Expressed in Text-Based Mental10.18653/v1/2020.emnlp-mai
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantLinear Representations of Political Perspective Emerge in Large Language Models10.48550/arxiv.2503.02080
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantTraining large language models on narrow tasks can lead to broad misalignment10.1038/s41586-025-09937-5
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantA Survey of Personalized Large Language Models: Progress and Future Directions10.48550/arxiv.2502.11528
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantWill AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization10.48550/arxiv.2505.14633
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiDiscovering language model behaviors with model-written evaluations10.48550/arxiv.2212.09251
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantProbing then Editing Response Personality of Large Language Models10.48550/arxiv.2504.10227
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiAlliance ruptures in cognitive-behavioral therapy: A cognitive conceptualization10.1002/jclp.23116
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantReinforcement Learning from Human Feedback10.48550/arxiv.2504.12501
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiTruthfulQA: Measuring How Models Mimic Human Falsehoods10.18653/v1/2022.acl-long.
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantThe Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior10.48550/arxiv.2509.03730
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantPersona Vectors: Monitoring and Controlling Character Traits in Language Models10.48550/arxiv.2507.21509
active
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiInference-time intervention: eliciting truthful answers from a language model10.52202/075280-1797
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiChatGPT for good? On opportunities and challenges of large language models for e10.1016/j.lindif.2023.1022
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantSubliminal Learning: Language models transmit behavioral traits via hidden signa10.48550/arxiv.2507.14805
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiSteering language models with activation engineering
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiThe Rise and Potential of Large Language Model Based Agents: A Survey10.48550/arxiv.2309.07864
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantAnother Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting10.48550/arxiv.2509.06770
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiCharacter-LLM: A Trainable Agent for Role-Playing10.48550/arxiv.2310.10158
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantGenerative Value Conflicts Reveal LLM Priorities10.48550/arxiv.2509.25369
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiA survey on large language model based autonomous agents10.1007/s11704-024-40231-1
referenced-only
s2-reference-walk
Open Character Training: Shaping the Persona of AI AssistantStress-Testing Model Specs Reveals Character Differences among Language Models10.48550/arxiv.2510.07686
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiSteering Llama 2 via Contrastive Activation Addition10.48550/arxiv.2312.06681
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiTowards Understanding Sycophancy in Language Models10.48550/arxiv.2310.13548
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiTwo Tales of Persona in LLMs: A Survey of Role-Playing and Personalization10.48550/arxiv.2406.01171
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiCrafting Customisable Characters with LLMs: A Persona-Driven Role-Playing Agent 10.18653/v1/2025.findings-
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiPersona Vectors: Monitoring and Controlling Character Traits in Language Models10.48550/arxiv.2507.21509
active
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiIntuition, empathy, and intellectual humility in psychotherapy. A philosophical 10.3389/fpsyg.2025.1590481
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiDeliberative Alignment: Reasoning Enables Safer Language Models10.48550/arxiv.2412.16339
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiPersonality Vector: Modulating Personality of Large Language Models by Model Mer10.48550/arxiv.2509.19727
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiEvaluating the Clinical Safety of LLMs in Response to High-Risk Mental Health Di10.48550/arxiv.2509.08839
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiBridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascen10.48550/arxiv.2601.02896
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiBILLY: Steering Large Language Models via Merging Persona Vectors for Creative G10.48550/arxiv.2510.10157
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiThe Assistant Axis: Situating and Stabilizing the Default Persona of Language Mo10.48550/arxiv.2601.10387
active
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiLetting Tutor Personas "Speak Up" for LLMs: Learning Steering Vectors from Dialo10.48550/arxiv.2602.07639
referenced-only
s2-reference-walk
What Models Express, Suppress, and Resist: Auditing Open-WeiSycophancy Hides Linearly in the Attention Heads10.48550/arxiv.2601.16644
referenced-only
s2-reference-walk