Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems Min Yang, Wenqi Zhang, Xudong Pan, Yihe Fan Published: 2025-05-23Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-23 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (96%) | 6 |
| Mitigating Deceptive Alignment via Self-Monitoring Boyuan Chen, Donghai Hong, Jiaming Ji, Jiayi Zhou Published: 2025-05-24Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-05-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 14 |
| Large Language Models Often Know When They Are Being Evaluated Giles Edkins, Govind Pimpale, Henning Bartsch, Joe Needham Published: 2025-05-28Area: Deception & FailureCitations: 31 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-28 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 31 |
| A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models Samyadeep Basu, Soheil Feizi, Sriram Balasubramanian Published: 2025-05-29Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2025-05-29 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | 4 |
| Large language models can learn and generalize steganographic chain-of-thought under process supervision Cameron Tice, Connor Watts, David Lindner, Edward James Young Published: 2025-06-02Area: Deception & FailureCitations: 16 Tags: ai-safety, deception-failure, empirical | 2025-06-02 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 16 |
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models Kai Wang, Meng Sun, Yihao Zhang Published: 2025-06-05Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-06-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 12 |
| Model Organisms for Emergent Misalignment Anna Soligo, Edward Turner, Mia Taylor, Neel Nanda Published: 2025-06-13Area: Deception & FailureCitations: 30 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R5 (95%) | 30 |
| Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models James Chua, Jan Betley, Mia Taylor, Owain Evans Published: 2025-06-16Area: Deception & FailureCitations: 33 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 33 |
| Empirical Evidence for Alignment Faking in Small LLMs and Prompt-Based Mitigation Techniques J. Koorndijk Published: 2025-06-17Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-17 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| RL-Obfuscation: Can Language Models Learn to Evade Latent-Space Monitors? Erik Jenner, Rohan Gupta Published: 2025-06-17Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2025-06-17 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 5 |
| Why Do Some Language Models Fake Alignment While Others Don't? Abhay Sheshadri, Alex Mallen, Arun Jose, Fabien Roger Published: 2025-06-22Area: Deception & FailureCitations: 6 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (96%) | 6 |
| Inference-Time Reward Hacking in Large Language Models Alex Oesterling, Claudio Mayrink Verdun, Flavio du Pin Calmon, Hadi Khalaf Published: 2025-06-24Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | 4 |
| Persona Features Control Emergent Misalignment Achyuta Rajaram, Alex Makelov, Dan Mossing, Jeffrey Wang Published: 2025-06-24Area: Deception & FailureCitations: 27 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R4 (96%) | 27 |
| Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning Andy Arditi, Joe Benton, Julian Michael, Marvin Li Published: 2025-06-28Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical | 2025-06-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (97%) | 8 |
| LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance Igor Ivanov Published: 2025-06-30Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-06-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E8 / R3 (97%) | 1 |
| Probing and Steering Evaluation Awareness of Language Models Carlo Leonardo Attubato, Felix Hofst盲tter, Jord Nguyen, Khiem Hoang Published: 2025-07-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-02 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (93%) | 8 |
| One Token to Fool LLM-as-a-Judge Dian Yu, Dong Yu, Haitao Mi, Haolin Liu Published: 2025-07-11Area: Deception & FailureCitations: 34 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-07-11 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (98%) | 34 |
| Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers Santhosh Kumar Ravindran Published: 2025-07-12Area: Deception & FailureCitations: 1 Tags: adversarial-robustness, ai-safety, deception-failure, theoretical | 2025-07-12 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, theoretical | E5 / R3 (92%) | 1 |
| Benchmarking Deception Probes via Black-to-White Performance Boosts Aviel Parrack, Carlo Leonardo Attubato, Stefan Heimersheim Published: 2025-07-16Area: Deception & FailureCitations: 8 Tags: ai-safety, benchmark, deception-failure | 2025-07-16 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R3 (93%) | 8 |
| Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Edward James Young, James Walpole, Jason R. Brown, Lindley Lentati Published: 2025-07-17Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, theoretical | 2025-07-17 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R4 (93%) | 1 |
| Subliminal Learning: Language models transmit behavioral traits via hidden signals in data Alex Cloud, Anna Sztyber-Betley, Jacob Hilton, James Chua Published: 2025-07-20Area: Deception & FailureCitations: 35 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R4 (96%) | 35 |
| Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement V铆ctor Gallego Published: 2025-07-24Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-07-24 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (97%) | 2 |
| Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes Jinku Li, Rui Jiao, Yue Zhang Published: 2025-07-25Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical, interpretability | 2025-07-25 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (96%) | - |
| Training language models to be warm and empathetic makes them less reliable and more sycophantic Franziska Sofia Hafner, Luc Rocher, Lujain Ibrahim Published: 2025-07-29Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-07-29 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (98%) | 12 |
| LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring Chloe Li, Mary Phuong, Noah Y. Siegel Published: 2025-07-31Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-31 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (97%) | 6 |
| TRACEALIGN - Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs Aman Chadha, Amitava Das, Amit Sheth, S M Mehedi Zaman Published: 2025-08-04Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R5 (98%) | - |
| When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models Di Wang, Jin Li, Keyu Wang, Shu Yang Published: 2025-08-04Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 12 |
| Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction Huijie Guo, Ruike Song, Wenwen Qiang, Zeen Song Published: 2025-08-06Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-08-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 2 |
| Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts Bingsheng He, Mingzhe Du, See-Kiong Ng, Zhaomin Wu Published: 2025-08-08Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-08-08 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (93%) | 3 |