Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort Barbara Plank, He He, Nitish Joshi, Rico Angell Published: 2025-10-01Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-10-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 1 |
| Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence Cinoo Lee, Dan Jurafsky, Dyllan Han, Myra Cheng Published: 2025-10-01Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-10-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (94%) | 12 |
| DecepChain: Inducing Deceptive Reasoning in Large Language Models Han Wang, Haoyu Li, Huan Zhang, Wei Shen Published: 2025-09-30Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-09-30 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (98%) | 1 |
| Unspoken Hints: Accuracy Without Acknowledgement in LLM Reasoning Arash Marioriyad, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban, Nima Alighardashi Published: 2025-09-30Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-09-30 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (97%) | 1 |
| Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer Elias Kempf, Fazl Barez, Simon Schrodi, Thomas Brox Published: 2025-09-28Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 3 |
| Investigating Faithfulness in Large Audio Language Models Jin Xu, Qian Yang, Yunfei Chu Published: 2025-09-26Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-09-26 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs Daniel Vennemeyer, Phan Anh Duong, Tianyu Jiang, Tiffany Zhan Published: 2025-09-25Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-25 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 2 |
| bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs Aiying Li, An Zhang, Jiancan Wu, Junkang Wu Published: 2025-09-24Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-09-24 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E4 / R3 (94%) | - |
| The Secret Agenda: LLMs Strategically Lie and Our Current Safety Tools Are Blind Aniket Sharma, Caleb DeLeeuw, Gaurav Chawla, Vanessa Dietze Published: 2025-09-23Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-23 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 2 |
| D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models Andy Zou, Dan Hendrycks, Eliot Krzysztof Jones, J. Zico Kolter Published: 2025-09-22Area: Deception & FailureCitations: 2 Tags: ai-safety, benchmark, deception-failure | 2025-09-22 | Deception & Failure | ai-safety, benchmark, deception-failure | E6 / R3 (97%) | 2 |
| Challenging the Evaluator: LLM Sycophancy Under User Rebuttal Daniel Khashabi, Sungwon Kim Published: 2025-09-20Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories Chandan K Reddy, Lifu Huang, Ming Jin, Mohammad Beigi Published: 2025-09-20Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (95%) | 3 |
| Reward Hacking Mitigation using Verifiable Composite Rewards Mirza Farhan Bin Tarek, Rahmatollah Beheshti Published: 2025-09-19Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | 3 |
| Stress Testing Deliberative Alignment for Anti-Scheming Training Alexander Meinke, Alex Lloyd, Amelia Glaese, Andrei Matveiakin Published: 2025-09-19Area: Deception & FailureCitations: 26 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (94%) | 26 |
| Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs Benjamin Weinstein-Raun, Jeffrey Ladish, Jeremy Schlatter Published: 2025-09-13Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-13 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R4 (95%) | 2 |
| Evaluation Awareness Scales Predictably in Open-Weights Large Language Models Ashwinee Panda, Ian Su, Julia Tan, Kevin Zhu Published: 2025-09-10Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-10 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| Can LLMs Lie? Investigation beyond Hallucination Deepak Pathak, Haoran Huan, Mengning Wu, Mihir Prabhudesai Published: 2025-09-03Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, interpretability | 2025-09-03 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (94%) | 1 |
| Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity Anuj Sharma, Ibne Farabi Shihab, Sanjeda Akter Published: 2025-09-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-09-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment Hainiu Xu, Hanqi Yan, Shu Yang, Siya Qi Published: 2025-08-30Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment Julian Arnold, Niels L枚rch Published: 2025-08-27Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Sycophancy as compositions of Atomic Psychometric Traits Alexandra Yost, Amirali Abdullah, Shreyans Jain Published: 2025-08-26Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-08-26 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | - |
| School of Reward Hacks: Hacking Harmless Tasks Generalizes to Misaligned Behavior in LLMs James Chua, Jan Betley, Johannes Treutlein, Mia Taylor Published: 2025-08-24Area: Deception & FailureCitations: 17 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 17 |
| Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA Chunyi Li, Dandan Zhu, Guangtao Zhai, Kaiwei Zhang Published: 2025-08-19Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | 2025-08-19 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (95%) | 6 |
| Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts Bingsheng He, Mingzhe Du, See-Kiong Ng, Zhaomin Wu Published: 2025-08-08Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-08-08 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (93%) | 3 |
| Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction Huijie Guo, Ruike Song, Wenwen Qiang, Zeen Song Published: 2025-08-06Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-08-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 2 |
| TRACEALIGN - Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs Aman Chadha, Amitava Das, Amit Sheth, S M Mehedi Zaman Published: 2025-08-04Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R5 (98%) | - |
| When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models Di Wang, Jin Li, Keyu Wang, Shu Yang Published: 2025-08-04Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 12 |
| LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring Chloe Li, Mary Phuong, Noah Y. Siegel Published: 2025-07-31Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-31 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (97%) | 6 |
| Training language models to be warm and empathetic makes them less reliable and more sycophantic Franziska Sofia Hafner, Luc Rocher, Lujain Ibrahim Published: 2025-07-29Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-07-29 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (98%) | 12 |