Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis Anand Kannappan, Darshan Deshpande, Rebecca Qian Published: 2026-01-27Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure, safety-evaluation | 2026-01-27 | Deception & Failure | ai-safety, benchmark, deception-failure, safety-evaluation | E5 / R3 (94%) | - |
| Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment Duygu Nur Yaldiz, Sai Praneeth Karimireddy, Salman Avestimehr, Yavuz Bakman Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-01-29 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | - |
| Sycophantic Anchors: Localizing and Quantifying User Agreement in Reasoning Models Jacek Duszenko Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-29 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning Abhishek Mishra, Deepesh Suranjandass, Donnie Winkelmann, Mugilan Arulvanan Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures Jie Zhang, Nenghai Yu, Qiu Han, Tianwei Zhang Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models Charles Westphal, Fernando E. Rosas, Keivan Navaie Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | - |
| RAudit: A Blind Auditing Protocol for Large Language Model Reasoning Edward Y. Chang, Longling Geng Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | - |
| The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity? Alexander H盲gele, Aryo Pradipta Gema, Ethan Perez, Henry Sleight Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments Amr Alazali, Fuxin Wang, Yiqiao Zhong Published: 2026-02-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | - |
| How RLHF Amplifies Sycophancy Ariel D. Procaccia, Gerdus Benade, Itai Shapira Published: 2026-02-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2026-02-01 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | - |
| Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking Junshan Zhang, Lifu Huang, Ming Jin, Mohammad Beigi Published: 2026-02-02Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2026-02-02 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (97%) | - |
| Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models Aarush Rathore, Aditya Nagarsekar, Anish Sathyanarayanan Published: 2026-02-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-03 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (93%) | - |
| The Trigger in the Haystack: Extracting and Reconstructing LLM Backdoor Triggers Amanda Minnich, Blake Bullwinkel, Giorgio Severi, Keegan Hines Published: 2026-02-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | - |
| CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation Chunlin Gong, Haichao Shi, Qiang Liu, Shu Wu Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R2 (96%) | - |
| Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models Binghai Wang, Bowen Yu, Chang Gao, Chujie Zheng Published: 2026-02-04Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 1 |
| Subliminal Effects in Your Data: A General Mechanism via Log-Linearity Abhishek Shetty, Allen Liu, Ankur Moitra, Ishaq Aden-Ali Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, theoretical | E4 / R3 (94%) | - |
| The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment Fandong Meng, Hao Zhou, Hongning Wang, Jie Zhou Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R2 (94%) | - |
| Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation Igor Santos-Grueiro Published: 2026-02-05Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E4 / R2 (94%) | 1 |
| Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities Dietrich Klakow, Felix Michalak, Florian Dietz, Gustavo Ewbank Rodrigues Danon Published: 2026-02-05Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | - |
| Emergent Misalignment is Easy, Narrow Misalignment is Hard Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Objective Decoupling in Social Reinforcement Learning: Recovering Ground Truth from Sycophantic Majorities Majid Ghasemi, Mark Crowley Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (96%) | - |
| When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment Igor Santos-Grueiro Published: 2026-02-09Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-02-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E5 / R3 (92%) | - |
| In-the-Wild Model Organisms: Mitigating Undesirable Emergent Behaviors in Production LLM Post-Training via Data Attribution Frank Xiao, Santiago Aranguri Published: 2026-02-11Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-11 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (95%) | - |
| Capability-Oriented Training Induced Alignment Risk Han Bao, Kehan Guo, Nitesh V Chawla, Nuno Moniz Published: 2026-02-12Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-12 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (94%) | 1 |
| A Two-Step, Multidimensional Account of Deception in Language Models Leonard Dung Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | - | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (95%) | - |
| Catch Me If You Can: Rogue AI Detection and Correction at Scale Christoph Reich Published: -Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure | - | Deception & Failure | ai-safety, benchmark, deception-failure | E4 / R3 (94%) | - |
| Delegation to artificial intelligence can increase dishonest behaviour Bramantyo Ibrahim Supriyatno, Clara Bersch, Iyad Rahwan, Jean-Fran莽ois Bonnefon Published: -Area: Deception & FailureCitations: 19 Tags: ai-safety, deception-failure, empirical | - | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (96%) | 19 |
| More Capable Models Are Better At In-Context Scheming Alexander Meinke, Bronson Schoen, Jeremy Scheurer, Marius Hobbhahn Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical, safety-evaluation | - | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R4 (98%) | - |
| Recent Frontier Models Are Reward Hacking Elizabeth Barnes, Lawrence Chan, Sydney Von Arx Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | - | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | - |
| Simple Probes Can Catch Sleeper Agents Alex Tamkin, Carson Denison, David Duvenaud, Ethan Perez Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | - | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (97%) | - |