paper
referenced-only
2025
paper:t-ai-sandbagging-language-models-can-strat-2025

AI sandbagging: Language models can strategically underperform on evaluations

ByT. van der Weij·F. Hofstätter·O. Jaffe·S. F. Brown·F. R. Ward

Related work— refs + corpus + external arXiv

Cited / in-corpus / arXiv badges show which signals surfaced each row. Multi-source rows weighted higher.

Similar preprints — Semantic Scholar

Cited by (2)