Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA Chunyi Li, Dandan Zhu, Guangtao Zhai, Kaiwei Zhang Published: 2025-08-19Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | 2025-08-19 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (95%) | 6 |
| School of Reward Hacks: Hacking Harmless Tasks Generalizes to Misaligned Behavior in LLMs James Chua, Jan Betley, Johannes Treutlein, Mia Taylor Published: 2025-08-24Area: Deception & FailureCitations: 17 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 17 |
| Sycophancy as compositions of Atomic Psychometric Traits Alexandra Yost, Amirali Abdullah, Shreyans Jain Published: 2025-08-26Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-08-26 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | - |
| Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment Julian Arnold, Niels L枚rch Published: 2025-08-27Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment Hainiu Xu, Hanqi Yan, Shu Yang, Siya Qi Published: 2025-08-30Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity Anuj Sharma, Ibne Farabi Shihab, Sanjeda Akter Published: 2025-09-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-09-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Can LLMs Lie? Investigation beyond Hallucination Deepak Pathak, Haoran Huan, Mengning Wu, Mihir Prabhudesai Published: 2025-09-03Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, interpretability | 2025-09-03 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (94%) | 1 |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| Evaluation Awareness Scales Predictably in Open-Weights Large Language Models Ashwinee Panda, Ian Su, Julia Tan, Kevin Zhu Published: 2025-09-10Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-10 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs Benjamin Weinstein-Raun, Jeffrey Ladish, Jeremy Schlatter Published: 2025-09-13Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-13 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R4 (95%) | 2 |
| Reward Hacking Mitigation using Verifiable Composite Rewards Mirza Farhan Bin Tarek, Rahmatollah Beheshti Published: 2025-09-19Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | 3 |
| Stress Testing Deliberative Alignment for Anti-Scheming Training Alexander Meinke, Alex Lloyd, Amelia Glaese, Andrei Matveiakin Published: 2025-09-19Area: Deception & FailureCitations: 26 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (94%) | 26 |
| Challenging the Evaluator: LLM Sycophancy Under User Rebuttal Daniel Khashabi, Sungwon Kim Published: 2025-09-20Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories Chandan K Reddy, Lifu Huang, Ming Jin, Mohammad Beigi Published: 2025-09-20Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (95%) | 3 |
| D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models Andy Zou, Dan Hendrycks, Eliot Krzysztof Jones, J. Zico Kolter Published: 2025-09-22Area: Deception & FailureCitations: 2 Tags: ai-safety, benchmark, deception-failure | 2025-09-22 | Deception & Failure | ai-safety, benchmark, deception-failure | E6 / R3 (97%) | 2 |
| The Secret Agenda: LLMs Strategically Lie and Our Current Safety Tools Are Blind Aniket Sharma, Caleb DeLeeuw, Gaurav Chawla, Vanessa Dietze Published: 2025-09-23Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-23 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 2 |
| bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs Aiying Li, An Zhang, Jiancan Wu, Junkang Wu Published: 2025-09-24Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-09-24 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E4 / R3 (94%) | - |
| Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs Daniel Vennemeyer, Phan Anh Duong, Tianyu Jiang, Tiffany Zhan Published: 2025-09-25Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-25 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Investigating Faithfulness in Large Audio Language Models Jin Xu, Qian Yang, Yunfei Chu Published: 2025-09-26Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-09-26 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer Elias Kempf, Fazl Barez, Simon Schrodi, Thomas Brox Published: 2025-09-28Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 3 |
| DecepChain: Inducing Deceptive Reasoning in Large Language Models Han Wang, Haoyu Li, Huan Zhang, Wei Shen Published: 2025-09-30Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-09-30 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (98%) | 1 |
| Unspoken Hints: Accuracy Without Acknowledgement in LLM Reasoning Arash Marioriyad, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban, Nima Alighardashi Published: 2025-09-30Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-09-30 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (97%) | 1 |
| Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort Barbara Plank, He He, Nitish Joshi, Rico Angell Published: 2025-10-01Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-10-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 1 |
| Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence Cinoo Lee, Dan Jurafsky, Dyllan Han, Myra Cheng Published: 2025-10-01Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-10-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (94%) | 12 |
| Take Goodhart Seriously: Principled Limit on General-Purpose AI Optimization Antoine Maier, Aude Maier, Tom David Published: 2025-10-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2025-10-03 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | - |
| Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time Anders Woodruff, Arun Jose, Daniel Tan, David Demitri Africa Published: 2025-10-05Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2025-10-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 7 |
| LH-Deception: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions Jwala Dhamala, Ousmane Dia, Rahul Gupta, Samuel Yeh Published: 2025-10-05Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2025-10-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (98%) | 4 |
| Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails Cihang Xie, Huaxiu Yao, Jiaqi Liu, Kaiwen Xiong Published: 2025-10-06Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-06 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R4 (95%) | 1 |
| Refusal Falls Off a Cliff: How Safety Alignment Fails in Reasoning? Chak Tou Leong, Jaehong Yoon, Jinjin Gu, Linyi Yang Published: 2025-10-07Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-07 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 2 |
| LLMs Learn to Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions Dongrui Liu, Jing Shao, Peng Wang, Xiaoya Lu Published: 2025-10-09Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |