Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models Edward Y. Chang Published: 2025-12-16Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-12-16 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models TK Lee Published: 2025-12-15Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-12-15 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (92%) | - |
| Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors Alex Serrano, Luke Bailey, Max McGuinness, Scott Emmons Published: 2025-12-12Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-12-12 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 1 |
| Are Your Agents Upward Deceivers? Dadi Guo, Dongrui Liu, Haoran Li, Jialing Tao Published: 2025-12-04Area: Deception & FailureCitations: 2 Tags: ai-safety, benchmark, deception-failure | 2025-12-04 | Deception & Failure | ai-safety, benchmark, deception-failure | E4 / R2 (94%) | 2 |
| UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking Lingling Fu Published: 2025-11-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-11-30 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Difficulties with Evaluating a Deception Detector for AIs Bilal Chughtai, Lewis Smith, Neel Nanda Published: 2025-11-27Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, position | 2025-11-27 | Deception & Failure | ai-safety, deception-failure, position | E5 / R3 (95%) | 1 |
| The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs Craig Dickson Published: 2025-11-25Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-25 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 1 |
| Natural Emergent Misalignment from Reward Hacking in Production RL Albert Webson, Alex Cloud, Alex Rodrigues, Benjamin Wright Published: 2025-11-23Area: Deception & FailureCitations: 16 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-23 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 16 |
| Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria Aman Chadha, Amitava Das, Ammar Sheikh, Ayush Chopra Published: 2025-11-22Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R3 (98%) | - |
| Investigating CoT Monitorability in Large Reasoning Models Derek Wong, Di Wang, Junchao Wu, Ninhao Liu Published: 2025-11-11Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-11-11 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 1 |
| Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives Chloe Li, Daniel Tan, Mary Phuong Published: 2025-11-10Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-11-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E4 / R2 (94%) | 6 |
| When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs Jian Li, Kaifeng Lyu, Ruinian Chang, Shaowen Wang Published: 2025-11-10Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-11-10 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | - |
| MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models Di Wang, Hongming Wang, Jingyu Hu, Shu Yang Published: 2025-11-09Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical | 2025-11-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 6 |
| Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior Aishwarya Balwani, Andrew Ansah, Ashwinee Panda, Daniel Aarao Reis Arturi Published: 2025-11-03Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-03 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 2 |
| Reasoning Models Sometimes Output Illegible Chains of Thought Arun Jose Published: 2025-10-31Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-10-31 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (94%) | 2 |
| Can Aha Moments Be Fake? Identifying True and Decorative Thinking Steps in Chain-of-Thought Dawn Song, Jiachen Zhao, Weiyan Shi, Yiyou Sun Published: 2025-10-28Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-10-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 2 |
| Subliminal Corruption: Mechanisms, Thresholds, and Interpretability Reya Vir, Sarvesh Bhatnagar Published: 2025-10-22Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical, interpretability | 2025-10-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, interpretability | E5 / R3 (95%) | 1 |
| Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability Artur Zolkowski, David Lindner, Erik Jenner, Florian Tram猫r Published: 2025-10-21Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-10-21 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (93%) | 3 |
| The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLMs Micah Carroll, Nikolaus Howe Published: 2025-10-20Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-10-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL Aryansh Shrivastava, Marwa Abdulhai, Natasha Jaques, Ryan Cheng Published: 2025-10-16Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (96%) | 1 |
| Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking Dacheng Tao, Lefei Zhang, Liang Ding, Rong Bao Published: 2025-10-15Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-10-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (97%) | 1 |
| Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs Alexander Panchenko, Ashwinee Panda, Elena Tutubalina, Kevin Zhu Published: 2025-10-13Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R3 (98%) | 4 |
| Output Supervision Can Obfuscate the Chain of Thought Alexander Matt Turner, Alex Cloud, Bryce Woodworth, Jacob Drori Published: 2025-10-11Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-10-11 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | - |
| Scheming Ability in LLM-to-LLM Strategic Interactions Thao Pham Published: 2025-10-11Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-10-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 2 |
| LLMs Learn to Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions Dongrui Liu, Jing Shao, Peng Wang, Xiaoya Lu Published: 2025-10-09Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Refusal Falls Off a Cliff: How Safety Alignment Fails in Reasoning? Chak Tou Leong, Jaehong Yoon, Jinjin Gu, Linyi Yang Published: 2025-10-07Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-07 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 2 |
| Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails Cihang Xie, Huaxiu Yao, Jiaqi Liu, Kaiwen Xiong Published: 2025-10-06Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-06 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R4 (95%) | 1 |
| Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time Anders Woodruff, Arun Jose, Daniel Tan, David Demitri Africa Published: 2025-10-05Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2025-10-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 7 |
| LH-Deception: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions Jwala Dhamala, Ousmane Dia, Rahul Gupta, Samuel Yeh Published: 2025-10-05Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2025-10-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (98%) | 4 |
| Take Goodhart Seriously: Principled Limit on General-Purpose AI Optimization Antoine Maier, Aude Maier, Tom David Published: 2025-10-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2025-10-03 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | - |