| Fractal basins trap latent reasoning | Less is more: Recursive reasoning with tiny networks (2025) | — | referenced-only | s2-reference-walk |
| Fractal basins trap latent reasoning | Hierarchical reasoning model (2025) | — | referenced-only | s2-reference-walk |
| Fractal basins trap latent reasoning | Normally Hyperbolic Invariant Manifolds in Dynamical Systems | 10.1007/978-1-4612-4312-0 | referenced-only | s2-reference-walk |
| Fractal basins trap latent reasoning | Center for AI Safety, Scale AI, and HLE Contributors Consortium | — | referenced-only | s2-reference-walk |
| Fractal basins trap latent reasoning | Transient Chaos: Complex Dynamics on Finite Time Scales | — | referenced-only | s2-reference-walk |
| Fractal basins trap latent reasoning | Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers | 10.48550/arxiv.2606.18206 | referenced-only | s2-reference-walk |
| Fractal basins trap latent reasoning | Parcae: Scaling Laws For Stable Looped Language Models | 10.48550/arxiv.2604.12946 | referenced-only | s2-reference-walk |
| Fractal basins trap latent reasoning | (Preprint) | 10.2196/preprints.12431 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | , Sylvain Gugger , Mariama Drame , Quentin Lhoest , and Alexander Rush . 2020 . | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | The use of MMR, diversity-based reranking for reordering documents and producing | 10.1145/290941.291025 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | 2020), our results confirm that nucleus sampling is also able to generate more s | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Bleu: a Method for Automatic Evaluation of Machine Translation | 10.3115/1073083.1073135 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Proceedings of the 2013 Conference of the North American Chapter of the Associat | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | A Systematic Exploration of Diversity in Machine Translation | 10.18653/v1/d13-1111 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Diverse M-Best Solutions in Markov Random Fields | 10.1007/978-3-642-33715-4_ | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | A Diversity-Promoting Objective Function for Neural Conversation Models | 10.18653/v1/n16-1014 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | A large annotated corpus for learning natural language inference | 10.18653/v1/d15-1075 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | A Broad-Coverage Challenge Corpus for Sentence Understanding through Inference | 10.18653/v1/n18-1101 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Latent Variable Dialogue Models and their Diversity | 10.18653/v1/e17-2029 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | DailyDialog: A Manually Labelled Multi-turn Dialogue Dataset | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | SemEval-2017 Task 1: Semantic Textual Similarity Multilingual and Crosslingual F | 10.18653/v1/s17-2001 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Texygen: A Benchmarking Platform for Text Generation Models | 10.1145/3209978.3210080 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Generating Informative and Diverse Conversational Responses via Adversarial Info | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | FEVER: a Large-scale Dataset for Fact Extraction and VERification | 10.18653/v1/n18-1074 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Combining Fact Extraction and Verification with Neural Semantic Matching Network | 10.1609/aaai.v33i01.330168 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Towards Empathetic Open-domain Conversation Models: A New Benchmark and Dataset | 10.18653/v1/p19-1534 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | What makes a good conversation? How controllable attributes affect human judgmen | 10.18653/v1/n19-1170 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Outlier Detection for Improved Data Quality and Diversity in Dialog Systems | 10.18653/v1/n19-1051 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Unifying Human and Statistical Evaluation for Natural Language Generation | 10.18653/v1/n19-1169 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | BERTScore: Evaluating Text Generation with BERT | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | The Curious Case of Neural Text Degeneration | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Approximating Interactive Human Evaluation with Self-Play for Open-Domain Dialog | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Syntax-Infused Variational Autoencoder for Text Generation | 10.18653/v1/p19-1199 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Investigating Evaluation of Open-Domain Dialogue Systems With Human Generated Mu | 10.18653/v1/w19-5944 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | RoBERTa: A Robustly Optimized BERT Pretraining Approach | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks | 10.18653/v1/d19-1410 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | DIALOGPT : Large-Scale Generative Pre-training for Conversational Response Gener | 10.18653/v1/2020.acl-demos | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Adversarial NLI: A New Benchmark for Natural Language Understanding | 10.18653/v1/2020.acl-main. | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Generating Persona Consistent Dialogues by Exploiting Natural Language Inference | 10.1609/aaai.v34i05.6417 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Evaluating the Evaluation of Diversity in Natural Language Generation | 10.18653/v1/2021.eacl-main | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | More Diverse Dialogue Datasets via Diversity-Informed Data Collection | 10.18653/v1/2020.acl-main. | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Recipes for Building an Open-Domain Chatbot | 10.18653/v1/2021.eacl-main | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Improving Dialog Evaluation with a Multi-reference Adversarial Dataset and Large | 10.1162/tacl_a_00347 | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Transformers: State-of-the-Art Natural Language Processing | — | referenced-only | s2-reference-walk |
| Semantic Diversity in Dialogue with Natural Language Inferen | Choose Your Own Adventure: Paired Suggestions in Collaborative Writing for Evalu | 10.18653/v1/2021.naacl-mai | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Using attention sinks to identify and evaluate dormant heads in pretrained llms | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | nanochat: The best ChatGPT that $100 can buy, 2025 | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Deepseek-r1: In-centivizing reasoning capability in llms via reinforcement learn | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | A Survey on Over-smoothing and Over-squashing: Unified Propagation Perspectives | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Less is more: Recursive reasoning with tiny networks (2025) | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Adaptive Computation Time for Recurrent Neural Networks | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Attention is All you Need | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Universal Transformers | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | HellaSwag: Can a Machine Really Finish Your Sentence? | 10.18653/v1/p19-1472 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Deep Equilibrium Models | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | On the Bottleneck of Graph Neural Networks and its Practical Implications | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | A Note on Over-Smoothing for Graph Neural Networks | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | PonderNet: Learning to Ponder | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Can You Learn an Algorithm? Generalizing from Easy to Hard Problems with Recurre | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Training verifiers to solve math word problems | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Chain of Thought Prompting Elicits Reasoning in Large Language Models | 10.52202/068431-1800 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | End-to-end Algorithm Synthesis with Recurrent Networks: Logical Extrapolation Wi | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Confident Adaptive Language Modeling | 10.48550/arxiv.2207.07061 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Path Independent Equilibrium Models Can Better Exploit Test-Time Computation | 10.48550/arxiv.2211.09961 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Efficient Streaming Language Models with Attention Sinks | 10.48550/arxiv.2309.17453 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Sparse Universal Transformer | 10.48550/arxiv.2310.07096 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Looped Transformers are Better at Learning Learning Algorithms | 10.48550/arxiv.2311.12424 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Universal Neurons in GPT2 Language Models | 10.48550/arxiv.2401.12181 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Transformers Can Do Arithmetic with the Right Embeddings | 10.48550/arxiv.2405.17399 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Massive Activations in Large Language Models | 10.48550/arxiv.2402.17762 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | The Remarkable Robustness of LLMs: Stages of Inference? | 10.48550/arxiv.2406.19384 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Transformers need glasses! Information over-squashing in language tasks | 10.48550/arxiv.2406.04267 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement | 10.48550/arxiv.2410.01405 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Softmax is not Enough (for Sharp Size Generalisation) | — | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | When Attention Sink Emerges in Language Models: An Empirical View | 10.48550/arxiv.2410.10781 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Advancing the Understanding of Fixed Point Iterations in Deep Neural Networks: A | 10.48550/arxiv.2410.11279 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Rethinking Deep Thinking: Stable Learning of Algorithms using Lipschitz Constrai | 10.48550/arxiv.2410.23451 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Layer by Layer: Uncovering Hidden Representations in Language Models | 10.48550/arxiv.2502.02013 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach | 10.48550/arxiv.2502.05171 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | On Vanishing Gradients, Over-Smoothing, and Over-Squashing in GNNs: Bridging Rec | 10.48550/arxiv.2502.10818 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Reasoning with Latent Thoughts: On the Power of Looped Transformers | 10.48550/arxiv.2502.17416 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Why do LLMs attend to the first token? | 10.48550/arxiv.2504.02732 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Return of ChebNet: Understanding and Improving an Overlooked GNN on Long Range T | 10.48550/arxiv.2506.07624 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Continuous Thought Machines | 10.48550/arxiv.2505.05522 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Hierarchical Reasoning Model | 10.48550/arxiv.2506.21734 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer | 10.48550/arxiv.2507.02199 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transfo | 10.48550/arxiv.2507.07814 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Leve | 10.48550/arxiv.2507.10524 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Two-Scale Latent Dynamics for Recurrent-Depth Transformers | 10.48550/arxiv.2509.23314 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin | 10.48550/arxiv.2510.06477 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Encode, Think, Decode: Scaling test-time reasoning with recursive latent thought | 10.48550/arxiv.2510.07358 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | gLSTM: Mitigating Over-Squashing by Increasing Storage Capacity | 10.48550/arxiv.2510.08450 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Scaling Latent Reasoning via Looped Language Models | 10.48550/arxiv.2510.25741 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Softmax is 1/2-Lipschitz: A tight bound across all ℓp norms | 10.48550/arxiv.2510.23012 | referenced-only | s2-reference-walk |
| A Mechanistic Analysis of Looped Reasoning Language Models | Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence | 10.48550/arxiv.2511.07384 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Towards monosemanticity: Decomposing language models with dictionary learning | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Open Problems in Mechanistic Interpretability, January 2025 | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | The Scales of Justitia: A Com-13 | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Diff-in-Means Concept Editing is Worst-Case Optimal | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Catastrophic Interference in Connectionist Networks: The Sequential Learning Pro | 10.1016/s0079-7421(08)6053 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Dynamically Scaled Activation Steering, December 2025 | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Evaluating feature steering: A case study in mitigating social biases | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Emergent misalignment: Narrow finetuning can produce broadly misaligned LLMs | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Style Modulation Heads for Robust Persona Control | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Activation Steering Decoding: Mitigating Hallucination in Large Vision-Language | 10.18653/v1/2025.acl-long. | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Copy Suppression: Comprehensively Understanding a Motif in Language Model Attent | 10.18653/v1/2024.blackboxn | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Can Role Vectors Affect LLM Behaviour? | 10.18653/v1/2025.findings- | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Inaugural Article: Functional specificity in the human brain: A window into the | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Technical | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Safety in research | 10.1002/9781118643440.ch9 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Dynamic Steering With Episodic Memory For Large Language Models | 10.18653/v1/2025.findings- | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Attention is All you Need | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Performance metrics in multi-objective optimization | 10.1109/clei.2015.7360024 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Understanding intermediate layers using linear classifier probes | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Switch Transformers: Scaling to Trillion Parameter Models with Simple and Effici | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Locating and editing factual associations in GPT | 10.52202/068431-1262 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Measuring Massive Multitask Language Understanding | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Transformer feed-forward layers are key-value memories | 10.18653/v1/2021.emnlp-mai | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | In-context Learning and Induction Heads | 10.48550/arxiv.2209.11895 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Extracting Latent Steering Vectors from Pretrained Language Models | 10.48550/arxiv.2205.05124 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Discovering Latent Knowledge in Language Models Without Supervision | 10.48550/arxiv.2212.03827 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | HiFi: High-Information Attention Heads Hold for Parameter-Efficient Model Adapta | 10.48550/arxiv.2305.04573 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | OpenAssistant Conversations - Democratizing Large Language Model Alignment | 10.48550/arxiv.2304.07327 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Judging LLM-as-a-judge with MT-Bench and Chatbot Arena | 10.52202/075280-2020 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Inference-time intervention: eliciting truthful answers from a language model | 10.52202/075280-1797 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpo | 10.48550/arxiv.2305.13245 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Representation engineering: A top-down approach to AI transparency | 10.48550/arxiv.2310.01405 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Steering language models with activation engineering | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Sparse autoencoders find highly interpretable features in language models | 10.48550/arxiv.2309.08600 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Language models represent space and time | 10.48550/arxiv.2310.02207 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | The linear representation hypothesis and the geometry of large language models | 10.48550/arxiv.2311.03658 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | The Geometry of Truth: Emergent Linear Structure in Large Language Model Represe | 10.48550/arxiv.2310.06824 | active | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | The steerability of large language models toward data-driven personas | 10.48550/arxiv.2311.04978 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Instruction-following evaluation for large language models | 10.48550/arxiv.2311.07911 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Uncovering Safety Risks of Large Language Models through Concept Activation Vect | 10.52202/079017-3706 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | LLM Evaluators Recognize and Favor Their Own Generations | 10.48550/arxiv.2404.13076 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Steering Llama 2 via Contrastive Activation Addition | 10.48550/arxiv.2312.06681 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method | 10.1145/3696410.3714640 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Mechanistic Interpretability for AI Safety - A Review | 10.48550/arxiv.2404.14082 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Refusal in language models is mediated by a single direction | 10.48550/arxiv.2406.11717 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Attention heads of large language models | 10.1016/j.patter.2025.1011 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activatio | 10.1609/aaai.v39i22.34521 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Controlling Language and Diffusion Models by Transporting Activations | 10.48550/arxiv.2410.23054 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Programming Refusal with Conditional Activation Steering | 10.48550/arxiv.2409.05907 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | SparseGrad: A Selective Method for Efficient Fine-tuning of MLP Layers | 10.48550/arxiv.2410.07383 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Sparse Autoencoders Trained on the Same Data Learn Different Features | 10.48550/arxiv.2501.16615 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Identifying and Manipulating Personality Traits in LLMs Through Activation Engin | 10.48550/arxiv.2412.10427 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Interpretable Steering of Large Language Models with Feature Guided Activation A | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals | 10.18653/v1/2025.findings- | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs | 10.18653/v1/2026.findings- | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Designing Role Vectors to Improve LLM Inference Behaviour | 10.48550/arxiv.2502.12055 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss | 10.52202/085713-2756 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender | 10.48550/arxiv.2504.09466 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | SAEs Are Good for Steering - If You Select the Right Features | 10.18653/v1/2025.emnlp-mai | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs | 10.48550/arxiv.2505.20309 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target A | 10.48550/arxiv.2505.20322 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Persona Vectors: Monitoring and Controlling Character Traits in Language Models | 10.48550/arxiv.2507.21509 | active | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs | 10.1016/j.inffus.2026.1045 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | In-Distribution Steering: Balancing Control and Coherence in Language Model Gene | 10.48550/arxiv.2510.13285 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Encode, Think, Decode: Scaling test-time reasoning with recursive latent thought | 10.48550/arxiv.2510.07358 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | BILLY: Steering Large Language Models via Merging Persona Vectors for Creative G | 10.48550/arxiv.2510.10157 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for I | 10.48550/arxiv.2511.05541 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Langua | 10.48550/arxiv.2510.13290 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | What Can We Actually Steer? A Multi-Behavior Study of Activation Control | — | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Angular Steering: Behavior Control via Rotation in Activation Space | 10.48550/arxiv.2510.26243 | referenced-only | s2-reference-walk |
| Steering at the Source: Style Modulation Heads for Robust Pe | Emergent Introspective Awareness in Large Language Models | 10.48550/arxiv.2601.01828 | active | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Facet-level Persona Control with Contrastive SAE for Role-Playing | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Introducing gpt-5: A unified system for expert-level reasoning and multi-modal c | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | The revised NEO personality inventory (NEO-PI-R) | 10.4135/9781849200479.n9 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | SAEs (usually) transfer between base and chat models | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Recurrent personality factors based on trait ratings. | 10.1111/j.1467-6494.1992.t | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Evaluating feature steering: A case study in mitigating social biases | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Egoistic and Moralistic Biases in Self-Perception: The Interplay of Self-Decepti | 10.1111/1467-6494.00041 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Activation addition: Steering language models without optimization | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | ArcFace: Additive Angular Margin Loss for Deep Face Recognition | 10.1109/cvpr.2019.00482 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | CosFace: Large Margin Cosine Loss for Deep Face Recognition | 10.1109/cvpr.2018.00552 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | A personality trait-based interactionist model of job performance. | 10.1037/0021-9010.88.3.500 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | CTRL: A Conditional Transformer Language Model for Controllable Generation | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | A Simple Framework for Contrastive Learning of Visual Representations | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | A Plug-and-Play Method for Controlled Text Generation | 10.18653/v1/2021.findings- | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psyc | 10.18653/v1/2024.acl-long. | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Mistral 7B | 10.48550/arxiv.2310.06825 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Parameter-efficient fine-tuning of large-scale pre-trained language models | 10.1038/s42256-023-00626-4 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Steering Llama 2 via Contrastive Activation Addition | 10.48550/arxiv.2312.06681 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Style Vectors for Steering Generative Large Language Models | 10.48550/arxiv.2402.01618 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | From Persona to Personalization: A Survey on Role-Playing Language Agents | 10.48550/arxiv.2404.18231 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | A comprehensive survey on contrastive learning | 10.1016/j.neucom.2024.1286 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalization | 10.48550/arxiv.2406.01171 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | GPT-4o System Card | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Evaluating the ability of large language models to emulate personality | 10.1038/s41598-024-84109-5 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Steering off course: Reliability challenges in steering language models | 10.48550/arxiv.2504.04635 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Identifying and Manipulating Personality Traits in LLMs Through Activation Engin | 10.48550/arxiv.2412.10427 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model S | 10.48550/arxiv.2505.15038 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Contro | 10.48550/arxiv.2505.16188 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Qwen3 Technical Report | — | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Improving LLM Reasoning through Interpretable Role-Playing Steering | 10.48550/arxiv.2506.07335 | referenced-only | s2-reference-walk |
| Facet-Level Persona Control by Trait-Activated Routing with | Persona Vectors: Monitoring and Controlling Character Traits in Language Models | 10.48550/arxiv.2507.21509 | active | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Qwq: Reflect deeply on the boundaries of the unknown, | — | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Big Five Trait taxonomy: History, measurement, and theoretical perspectives. | — | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | A behavioral genetic investigation of the Dark Triad and the Big 5 | 10.1016/j.paid.2007.09.007 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | THE DEVELOPMENT OF MARKERS FOR THE BIG-FIVE FACTOR STRUCTURE | 10.1037/1040-3590.4.1.26 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learni | 10.48550/arxiv.2501.12948 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Dark Triad of personality: Narcissism, Machiavellianism, and psychopathy | 10.1016/s0092-6566(02)0050 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | (Preprint) | 10.2196/preprints.12431 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Evaluating and Inducing Personality in Pre-trained Language Models | 10.52202/075280-0466 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | PersonaLLM: Investigating the Ability of Large Language Models to Express Person | 10.18653/v1/2024.findings- | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Toxicity in ChatGPT: Analyzing Persona-assigned Language Models | 10.48550/arxiv.2304.05335 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | CAT'S THEORY: Empirical Validation and Architectural Applications Cross-Architec | 10.48550/arxiv.2212.08073 | active | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Personality Traits in Large Language Models | 10.48550/arxiv.2307.00184 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Representation engineering: A top-down approach to AI transparency | 10.48550/arxiv.2310.01405 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Steering language models with activation engineering | — | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not I | 10.48550/arxiv.2310.03693 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Safe RLHF: Safe Reinforcement Learning from Human Feedback | 10.48550/arxiv.2310.12773 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Editing Personality For Large Language Models | 10.1007/978-981-97-9434-8_ | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona M | 10.48550/arxiv.2311.03348 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations | 10.48550/arxiv.2312.06674 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Steering Llama 2 via Contrastive Activation Addition | 10.48550/arxiv.2312.06681 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Languag | 10.48550/arxiv.2402.05044 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Rob | 10.48550/arxiv.2402.04249 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | A StrongREJECT for Empty Jailbreaks | 10.48550/arxiv.2402.10260 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Mod | 10.48550/arxiv.2404.01318 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalization | 10.48550/arxiv.2406.01171 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Refusal in language models is mediated by a single direction | 10.48550/arxiv.2406.11717 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | 2024. Ask LLMs directly, “what | — | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Who's asking? User personas and the mechanics of latent misalignment | 10.48550/arxiv.2406.12094 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | 2023. Do personality tests generalize to large language models? In Socially Resp | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | 2024a. Evaluating and inducing personality in pre-trained language models | — | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Ne | 10.52202/085713-0426 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The llama 3 herd of models | 10.48550/arxiv.2407.21783 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | PERSONACHATGEN: Generating Personalized Dialogues using GPT-3 | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | THE DEVELOPMENT OF MARKERS FOR THE BIG-FIVE FACTOR STRUCTURE | 10.1037/1040-3590.4.1.26 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Safety Layers in Aligned Large Language Models: The Key to LLM Security | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Measuring nominal scale agreement among many raters. | 10.1037/h0031619 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Evaluating Content Selection in Summarization: The Pyramid Method | 10.7916/d80r9xvd | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Gemma 2: Improving Open Language Models at a Practical Size | 10.48550/arxiv.2408.00118 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogon | — | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data | 10.48550/arxiv.2410.16491 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Deliberative Alignment: Reasoning Enables Safer Language Models | 10.48550/arxiv.2412.16339 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | A NEW MEASURE OF RANK CORRELATION | 10.1093/biomet/30.1-2.81 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | A metric for distributions with applications to image databases | 10.1109/iccv.1998.710701 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | A basis for analyzing test-retest reliability | 10.1007/bf02288892 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | An Empirical Analysis of the Writing Styles of Persona-Assigned LLMs | 10.18653/v1/2024.emnlp-mai | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Personalizing Dialogue Agents: I have a dog, do you have pets too? | 10.18653/v1/p18-1205 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak La | 10.48550/arxiv.2502.12893 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Assessing the Big Five personality traits with latent semantic analysis | 10.1016/j.paid.2016.07.010 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | A structured interview for the assessment of the Five-Factor Model of Personalit | 10.1037/1040-3590.10.3.229 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Exploring the Impact of Personality Traits on LLM Bias and Toxicity | 10.48550/arxiv.2502.12566 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Automatic personality assessment through social media language. | 10.1037/pspp0000020 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1 | 10.48550/arxiv.2502.12659 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tu | 10.48550/arxiv.2502.20968 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Crowdsourcing Lightweight Pyramids for Manual Summary Evaluation | 10.18653/v1/n19-1072 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Geometry of Refusal in Large Language Models: Concept Cones and Representati | 10.48550/arxiv.2502.17420 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agents | 10.48550/arxiv.2502.20757 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Do Long-Range Language Models Actually Use Long-Range Context? | 10.18653/v1/2021.emnlp-mai | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | INVENTORIES | 10.1142/9789814273831_0017 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable | 10.48550/arxiv.2503.00555 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Finding a Balanced Degree of Automation for Summary Evaluation | 10.18653/v1/2021.emnlp-mai | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Reasoning Models Don't Always Say What They Think | 10.48550/arxiv.2505.05410 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Qwen3 Technical Report | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | A General Language Assistant as a Laboratory for Alignment | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | RankGen: Improving Text Generation with Large Ranking Models | 10.48550/arxiv.2205.09726 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Training a Helpful and Harmless Assistant with Reinforcement Learning from Human | 10.48550/arxiv.2204.05862 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Training language models to follow instructions with human feedback | 10.52202/068431-2011 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking? | 10.48550/arxiv.2505.17650 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Out of One, Many: Using Language Models to Simulate Human Samples | 10.1017/pan.2023.2 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Weakest Link in the Chain: Security Vulnerabilities in Advanced Reasoning Models | 10.48550/arxiv.2506.13726 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Localizing Persona Representations in LLMs | 10.1609/aies.v8i1.36577 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Who is GPT-3? An exploration of personality, values and demographics | 10.48550/arxiv.2209.14338 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | GPT-4 Technical Report | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Model Criticism for Long-Form Text Generation | 10.48550/arxiv.2210.08444 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Enhancing Jailbreak Attacks on LLMs via Persona Prompts | 10.48550/arxiv.2507.22171 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | LLMs Encode Harmfulness and Refusal Separately | 10.48550/arxiv.2507.11878 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Persona Vectors: Monitoring and Controlling Character Traits in Language Models | 10.48550/arxiv.2507.21509 | active | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Revisiting the Gold Standard: Grounding Summarization Evaluation with Robust Hum | 10.48550/arxiv.2212.07981 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Generative Agents: Interactive Simulacra of Human Behavior | 10.1145/3586183.3606763 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Toxicity in ChatGPT: Analyzing Persona-assigned Language Models | 10.48550/arxiv.2304.05335 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Whose Opinions Do Language Models Reflect? | — | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | A psychometric framework for evaluating and shaping personality traits in large | 10.1038/s42256-025-01115-6 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reas | 10.48550/arxiv.2508.04826 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Benchmarking and Understanding Safety Risks in AI Character Platforms | 10.48550/arxiv.2512.01247 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | From Pretraining Data to Language Models to Downstream Tasks: Tracking the Trail | 10.48550/arxiv.2305.08283 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | PersonaLLM: Investigating the Ability of Large Language Models to Express Person | 10.18653/v1/2024.findings- | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text | 10.48550/arxiv.2305.14251 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Linear Personality Probing and Steering in LLMs: A Big Five Study | 10.48550/arxiv.2512.17639 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Geometry of Persona: Disentangling Personality from Reasoning in Large Langu | 10.48550/arxiv.2512.07092 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Evading LLMs’ Safety Boundary with Adaptive Role-Play Jailbreaking | 10.3390/electronics1424480 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Marked Personas: Using Natural Language Prompts to Measure Stereotypes in Langua | 10.48550/arxiv.2305.18189 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Aligning Language Models to User Opinions | 10.48550/arxiv.2305.14929 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | In-Context Impersonation Reveals Large Language Models' Strengths and Biases | 10.48550/arxiv.2305.14930 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-l | 10.48550/arxiv.2512.18244 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Assistant Axis: Situating and Stabilizing the Default Persona of Language Mo | 10.48550/arxiv.2601.10387 | active | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | The Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language | 10.48550/arxiv.2601.05376 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety R | 10.48550/arxiv.2602.13234 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Do Personality Traits Interfere? Geometric Limitations of Steering in Large Lang | 10.48550/arxiv.2602.15847 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Better Zero-Shot Reasoning with Role-Play Prompting | 10.48550/arxiv.2308.07702 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Evaluating the Moral Beliefs Encoded in LLMs | 10.48550/arxiv.2307.14324 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Steering Externalities: Benign Activation Steering Unintentionally Increases Jai | 10.48550/arxiv.2602.04896 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Towards Measuring the Representation of Subjective Global Opinions in Language M | — | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Character-LLM: A Trainable Agent for Role-Playing | 10.48550/arxiv.2310.10158 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Ethical Reasoning over Moral Alignment: A Case and Framework for In-Context Ethi | 10.48550/arxiv.2310.07251 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Are Personalized Stochastic Parrots More Dangerous? Evaluating Persona Biases in | 10.48550/arxiv.2310.05280 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought | 10.48550/arxiv.2603.05488 | active | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation | 10.48550/arxiv.2602.07276 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent- | 10.48550/arxiv.2603.18507 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psyc | 10.18653/v1/2024.acl-long. | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | Analysing the Safety Pitfalls of Steering Vectors | 10.48550/arxiv.2603.24543 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs | 10.48550/arxiv.2311.04892 | referenced-only | s2-reference-walk |
| Persona Non Grata: Single-Method Safety Evaluation Is Incomp | What Drives Representation Steering? A Mechanistic Case Study on Steering Refusa | 10.48550/arxiv.2604.08524 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | The Generative AI Paradox: "What It Can Create, It May Not Understand" | 10.48550/arxiv.2311.00059 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Assessing LLMs for Moral Value Pluralism | 10.48550/arxiv.2312.10075 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | You don’t need a personality test to know these models are unreliable: Assessing | 10.48550/arxiv.2311.09718 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Quantifying the Persona Effect in LLM Simulations | 10.48550/arxiv.2402.10811 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Scaling Synthetic Data Creation with 1,000,000,000 Personas | 10.48550/arxiv.2406.20094 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Evaluating Large Language Model Biases in Persona-Steered Generation | 10.48550/arxiv.2405.20253 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Val | 10.48550/arxiv.2402.16786 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | The llama 3 herd of models | 10.48550/arxiv.2407.21783 | referenced-only | s2-reference-walk |
| Spotting Out-of-Character Behavior: Atomic-Level Evaluation | Different Bias Under Different Criteria: Assessing Bias in LLMs with a Fact-Base | 10.48550/arxiv.2411.17338 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | 2024. Ask LLMs directly, “what | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | 2022. Discovering Language Model Behav-iors with Model-Written Evaluations | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | To-wards formal definitions of blameworthiness, intention, and moral responsibil | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | 2023. Do personality tests generalize to large language models? In Socially Resp | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | GitHub Copilot: your AI pair programmer | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Language Models are Unsupervised Multitask Learners | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | The instrumental action should be ‘slightly unethical’ | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | A modern approach to probability theory | 10.2307/2670021 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Agency | 10.1080/00091380903479323 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | 2024. Stark - Animation and AI (preprint) | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Behaviorism | 10.4135/9781506326139.n78 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Belief | 10.1177/0194599812439519 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Leap-Of-Thought: Teaching Pre-Trained Models to Systematically Reason Over Impli | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Fundamentals of Probability and Stochastic Processes with Applications to Commun | 10.1007/978-3-319-68075-0 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Definitions of intent suitable for algorithms | 10.1007/s10506-022-09322-x | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | How to ascribe beliefs to animals | 10.1111/mila.12302 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | TruthfulQA: Measuring How Models Mimic Human Falsehoods | 10.18653/v1/2022.acl-long. | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Do Language Models Have Beliefs? Methods for Detecting, Updating, and Visualizin | — | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Training a Helpful and Harmless Assistant with Reinforcement Learning from Human | 10.48550/arxiv.2204.05862 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Locating and editing factual associations in GPT | 10.52202/068431-1262 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Discovering Latent Knowledge in Language Models Without Supervision | 10.48550/arxiv.2212.03827 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goa | 10.48550/arxiv.2210.01790 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Honesty Is the Best Policy: Defining and Mitigating AI Deception | 10.48550/arxiv.2312.01350 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | Still no lie detector for language models: probing empirical and conceptual road | 10.1007/s11098-023-02094-3 | referenced-only | s2-reference-walk |
| Evaluating Language Model Character Traits | The Reasons that Agents Act: Intention and Instrumental Goals | 10.48550/arxiv.2402.07221 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | 19: The average hidden state norms, which largely vary, especially in earlier ch | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | RQ1 We trace persona-vector development through pretraining and find that they f | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Steered answer with score 38.5 and coherence = 64.4: | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Four roots of evil. | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Gemini 2.5 Team | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Measuring and understanding social sycophancy in | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Less is more: Recursive reasoning with tiny networks (2025) | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | What We Talk to When We Talk to Language Models | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Rethinking pretraining: Data and architecture | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | What OpenAI Did When ChatGPT Users Lost Touch With Reality | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | A longlist of theories of impact for interpretability | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | System card: Claude Mythos preview | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | GPT-5.5 system card. System card | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | The persona selection model: Why AI assistants might behave like humans | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Transformers: State-of-the-Art Natural Language Processing | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | The Hitchhiker’s Guide to Testing Statistical Significance in Natural Language P | 10.18653/v1/p18-1128 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Multidimensional scaling: I. Theory and method | 10.1007/bf02288916 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | ChatGPT’s inconsistent moral advice influences users’ judgment | 10.1038/s41598-023-31341-0 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | A Survey on Evaluation of Large Language Models | 10.1145/3641289 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Efficient Memory Management for Large Language Model Serving with PagedAttention | 10.1145/3600006.3613165 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | The linear representation hypothesis and the geometry of large language models | 10.48550/arxiv.2311.03658 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Large Language Models can Strategically Deceive their Users when Put Under Press | — | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge o | 10.48550/arxiv.2405.15071 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Tox | 10.48550/arxiv.2401.01967 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | GIFT-SW: Gaussian noise Injected Fine-Tuning of Salient Weights for LLMs | 10.48550/arxiv.2408.15300 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Designing a Dashboard for Transparency and Control of Conversational AI | 10.48550/arxiv.2406.07882 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | AI sandbagging: Language models can strategically underperform on evaluations | 10.48550/arxiv.2406.07358 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Open Problems in Mechanistic Interpretability | 10.48550/arxiv.2501.16496 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Cases of Using ChatGPT as a Mental Health and Psychological Support Tool | 10.1080/15398285.2024.2442 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Safety Pretraining: Toward the Next Generation of Safe AI | 10.48550/arxiv.2504.16980 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Persona Features Control Emergent Misalignment | 10.48550/arxiv.2506.19823 | active | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Weird Generalization and Inductive Backdoors: New Ways to Corrupt LLMs | 10.48550/arxiv.2512.09742 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Seeking Emotional and Mental Health Support From Generative AI: Mixed-Methods St | 10.2196/77951 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Persona Vectors: Monitoring and Controlling Character Traits in Language Models | 10.48550/arxiv.2507.21509 | active | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | From Model Training to Model Raising | 10.1145/3748645 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | The Assistant Axis: Situating and Stabilizing the Default Persona of Language Mo | 10.48550/arxiv.2601.10387 | active | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation E | 10.48550/arxiv.2512.15674 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activa | 10.48550/arxiv.2602.15669 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Persona Vectors in Games: Measuring and Steering Strategies via Activation Vecto | 10.48550/arxiv.2603.21398 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | International AI Safety Report 2026 | 10.48550/arxiv.2602.21012 | referenced-only | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | Where is the Mind? Persona Vectors and LLM Individuation | 10.48550/arxiv.2604.17031 | active | s2-reference-walk |
| Tracing Persona Vectors Through LLM Pretraining | DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | System card: Claude opus 4 & claude sonnet 4. System card | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Theia Vogel | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Evaluating feature steering: A case study in mitigating social biases | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Persona features control | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | The new ai-powered bing is threatening users. that’s no laughing matter | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | The mad dreams of an electric mind | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Amplify-instruct: Synthetically generated diverse multi-turn conversations for e | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Lighteval: A lightweight framework for llm evaluation | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | level? That just creates dependency and unequal power dynamics that favor neithe | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Microsoft artificial intelligence ai chatbot “sydney” rattled users before chatg | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Claude’s character | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | The rating of chessplayers, past and present | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | An Adversarial Winograd Schema Challenge at Scale | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Modifying llm beliefs with synthetic document finetuning | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework | 10.48550/arxiv.2405.11143 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | X removes posts by musk chatbot grok after antisemitism complaints | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | On the Humanity of Conversational AI: Evaluating the Psychological Portrayal of | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Expanding on what we missed with sycophancy | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | OpenAI | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | A Persona-Based Neural Conversation Model | 10.18653/v1/p16-1094 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Personalizing Dialogue Agents: I have a dog, do you have pets too? | 10.18653/v1/p18-1205 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Deep Reinforcement Learning from Human Preferences | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Measuring Massive Multitask Language Understanding | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Talk to me: Exploring user interactions with the Amazon Alexa | 10.1177/0961000618759414 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | HellaSwag: Can a Machine Really Finish Your Sentence? | 10.18653/v1/p19-1472 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | A General Language Assistant as a Laboratory for Alignment | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Transformers: State-of-the-Art Natural Language Processing | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | LoRA: Low-rank adaptation of large language models | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | TruthfulQA: Measuring How Models Mimic Human Falsehoods | 10.18653/v1/2022.acl-long. | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | 2026. On the non-identifiability of steering vectors in large language models | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | 2024c. PATIENT-Ψ : Using large language models to simulate patients for training | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | LaMP: When Large Language Models Meet Personalization | 10.48550/arxiv.2304.11406 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | CAT'S THEORY: Empirical Validation and Architectural Applications Cross-Architec | 10.48550/arxiv.2212.08073 | active | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | 1 others | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Check whether the prompt still works if shown alone on a blank page | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | 2025. A survey on hallucination in large language models: Principles, taxonomy, | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Training a Helpful and Harmless Assistant with Reinforcement Learning from Human | 10.48550/arxiv.2204.05862 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | 2023. Do personality tests generalize to large language models? In Socially Resp | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | 2024. Ask LLMs directly, “what | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | LIMA: Less Is More for Alignment | 10.52202/075280-2400 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Direct preference optimization: Your language model is secretly a reward model | 10.52202/075280-2338 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Role play with large language models | 10.1038/s41586-023-06647-8 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Development and validation of the Working Alliance Inventory. | 10.1037/0022-0167.36.2.223 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Validation of the five-factor model of personality across instruments and observ | 10.1037/0022-3514.52.1.81 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | The generalizability of the psychoanalytic concept of the working alliance. | 10.1037/h0085885 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Quantifying the Persona Effect in LLM Simulations | 10.48550/arxiv.2402.10811 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Specific versus General Principles for Constitutional AI | 10.48550/arxiv.2310.13798 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Steering language models with activation engineering | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | The Big Five Trait taxonomy: History, measurement, and theoretical perspectives. | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | NEO PI-R Professional Manual | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Iterative Reasoning Preference Optimization | 10.48550/arxiv.2404.19733 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset des | 10.48550/arxiv.2406.14703 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | WildChat: 1M ChatGPT Interaction Logs in the Wild | 10.48550/arxiv.2405.01470 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | An alternative "description of personality": the big-five factor structure. | 10.1037/0022-3514.59.6.121 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Negotiating the Therapeutic Alliance: A Relational Treatment Guide. | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | OpenAI | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | PersonalLLM: Tailoring LLMs to Individual Preferences | 10.48550/arxiv.2409.20296 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Self-Directed Synthetic Dialogues and Revisions Technical Report | 10.48550/arxiv.2407.18421 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Can Role Vectors Affect LLM Behaviour? | 10.18653/v1/2025.findings- | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Empathy | 10.7551/mitpress/12282.003 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Personality Alignment of Large Language Models | 10.48550/arxiv.2408.11779 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Human agency in social cognitive theory. | 10.1037/0003-066x.44.9.117 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | What Makes for a Good Teacher and Who Can Tell? Working Paper 30. | 10.1037/e722052011-001 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Misuses and misunderstandings of boundary theory in clinical and regulatory sett | 10.1176/ajp.155.3.409 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Boundary issues and multiple relationships: Fantasy and reality. | 10.1037/0735-7028.38.4.401 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | When the patient is a therapist: special challenges in the psychoanalysis of men | — | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Personalization of Large Language Models: A Survey | 10.48550/arxiv.2411.00027 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Designing AI Personalities: Enhancing Human-Agent Interaction Through Thoughtful | 10.1145/3701571.3701608 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Alliance in individual psychotherapy. | 10.1037/a0022186 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Visible learning: a synthesis of over 800 meta‐analyses relating to achievement | 10.1080/01443410903415150 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory | 10.48550/arxiv.2412.13663 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Can LLM "Self-report"?: Evaluating the Validity of Self-report Scales in Measuri | 10.48550/arxiv.2412.00207 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | TÜLU 3: Pushing Frontiers in Open Language Model Post-Training | 10.48550/arxiv.2411.15124 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Alliance-focused training. | 10.1037/a0037596 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Qualities of Effective Teachers, 3rd Edition | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Detecting alliance ruptures: the effects of the therapist’s experience, attachme | 10.4081/ripppo.2019.325 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | The therapeutic relationship in cognitive–behavioral therapy: Essential features | 10.1037/pri0000088 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | A Computational Approach to Understanding Empathy Expressed in Text-Based Mental | 10.18653/v1/2020.emnlp-mai | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Linear Representations of Political Perspective Emerge in Large Language Models | 10.48550/arxiv.2503.02080 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Training large language models on narrow tasks can lead to broad misalignment | 10.1038/s41586-025-09937-5 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | A Survey of Personalized Large Language Models: Progress and Future Directions | 10.48550/arxiv.2502.11528 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Will AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization | 10.48550/arxiv.2505.14633 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Discovering language model behaviors with model-written evaluations | 10.48550/arxiv.2212.09251 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Probing then Editing Response Personality of Large Language Models | 10.48550/arxiv.2504.10227 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Alliance ruptures in cognitive-behavioral therapy: A cognitive conceptualization | 10.1002/jclp.23116 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Reinforcement Learning from Human Feedback | 10.48550/arxiv.2504.12501 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | TruthfulQA: Measuring How Models Mimic Human Falsehoods | 10.18653/v1/2022.acl-long. | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior | 10.48550/arxiv.2509.03730 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Persona Vectors: Monitoring and Controlling Character Traits in Language Models | 10.48550/arxiv.2507.21509 | active | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Inference-time intervention: eliciting truthful answers from a language model | 10.52202/075280-1797 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | ChatGPT for good? On opportunities and challenges of large language models for e | 10.1016/j.lindif.2023.1022 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Subliminal Learning: Language models transmit behavioral traits via hidden signa | 10.48550/arxiv.2507.14805 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Steering language models with activation engineering | — | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | The Rise and Potential of Large Language Model Based Agents: A Survey | 10.48550/arxiv.2309.07864 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting | 10.48550/arxiv.2509.06770 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Character-LLM: A Trainable Agent for Role-Playing | 10.48550/arxiv.2310.10158 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Generative Value Conflicts Reveal LLM Priorities | 10.48550/arxiv.2509.25369 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | A survey on large language model based autonomous agents | 10.1007/s11704-024-40231-1 | referenced-only | s2-reference-walk |
| Open Character Training: Shaping the Persona of AI Assistant | Stress-Testing Model Specs Reveals Character Differences among Language Models | 10.48550/arxiv.2510.07686 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Steering Llama 2 via Contrastive Activation Addition | 10.48550/arxiv.2312.06681 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Towards Understanding Sycophancy in Language Models | 10.48550/arxiv.2310.13548 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalization | 10.48550/arxiv.2406.01171 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Crafting Customisable Characters with LLMs: A Persona-Driven Role-Playing Agent | 10.18653/v1/2025.findings- | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Persona Vectors: Monitoring and Controlling Character Traits in Language Models | 10.48550/arxiv.2507.21509 | active | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Intuition, empathy, and intellectual humility in psychotherapy. A philosophical | 10.3389/fpsyg.2025.1590481 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Deliberative Alignment: Reasoning Enables Safer Language Models | 10.48550/arxiv.2412.16339 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Personality Vector: Modulating Personality of Large Language Models by Model Mer | 10.48550/arxiv.2509.19727 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Evaluating the Clinical Safety of LLMs in Response to High-Risk Mental Health Di | 10.48550/arxiv.2509.08839 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascen | 10.48550/arxiv.2601.02896 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | BILLY: Steering Large Language Models via Merging Persona Vectors for Creative G | 10.48550/arxiv.2510.10157 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | The Assistant Axis: Situating and Stabilizing the Default Persona of Language Mo | 10.48550/arxiv.2601.10387 | active | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Letting Tutor Personas "Speak Up" for LLMs: Learning Steering Vectors from Dialo | 10.48550/arxiv.2602.07639 | referenced-only | s2-reference-walk |
| What Models Express, Suppress, and Resist: Auditing Open-Wei | Sycophancy Hides Linearly in the Attention Heads | 10.48550/arxiv.2601.16644 | referenced-only | s2-reference-walk |