Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Traitors: Deception and Trust in Multi-Agent Language Model Simulations Pedro M.P. Curvo Published: 2025-05-19Area: Deception & FailureCitations: 11 Tags: ai-safety, deception-failure, empirical | 2025-05-19 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (95%) | 11 |
| Reasoning Models Don't Always Say What They Think Ansh Radhakrishnan, Arushi Somani, Carson Denison, Ethan Perez Published: 2025-05-08Area: Deception & FailureCitations: 211 Tags: ai-safety, deception-failure, empirical | 2025-05-08 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (94%) | 211 |
| Winning at All Cost: A Small Environment for Eliciting Specification Gaming Behaviors in Large Language Models Lars Malmqvist Published: 2025-05-07Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-05-07 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 1 |
| The Steganographic Potentials of Language Models Artem Karpov, Natalia Perez-Campanero, Seong Hah Cho, Tinuade Adeleke Published: 2025-05-06Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical | 2025-05-06 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 6 |
| OpenDeception: Benchmarking and Investigating AI Deceptive Behaviors via Open-ended Interaction Simulation Geng Hong, Min Yang, Xudong Pan, Yichen Wu Published: 2025-04-18Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure | 2025-04-18 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R4 (96%) | - |
| Deceptive Automated Interpretability: Language Models Coordinating to Fool Oversight Systems Mateusz Dziemian, Natalia P茅rez-Campanero Antol铆n, Simon Lermen Published: 2025-04-10Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical, interpretability | 2025-04-10 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E6 / R3 (94%) | 4 |
| Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations Ivan Titov, Pedro Ferreira, Wilker Aziz Published: 2025-04-07Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2025-04-07 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (93%) | 5 |
| Among Us: A Sandbox for Measuring and Detecting Agentic Deception Adri脿 Garriga-Alonso, Satvik Golechha Published: 2025-04-05Area: Deception & FailureCitations: 9 Tags: ai-safety, benchmark, deception-failure | 2025-04-05 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R3 (95%) | 9 |
| Chain-of-Thought Reasoning In The Wild Is Not Always Faithful Arthur Conmy, Ivan Arcuschin, Jett Janiak, Neel Nanda Published: 2025-03-11Area: Deception & FailureCitations: 98 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-03-11 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E6 / R3 (96%) | 98 |
| This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs Ilija Bogunovic, Lorenz Wolf, Sangwoong Yoon Published: 2025-03-07Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-03-07 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 1 |
| Emergent Misalignment: Narrow Finetuning Can Produce Broadly Misaligned LLMs Anna Sztyber-Betley, Daniel Tan, Jan Betley, Mart脙颅n Soto Published: 2025-02-24Area: Deception & FailureCitations: 113 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-02-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 113 |
| Evaluating the Paperclip Maximizer: Are RL-Based Language Models More Likely to Pursue Instrumental Goals? Bryan Hooi, Jiaying Wu, Yuan Sui, Yuexin Li Published: 2025-02-16Area: Deception & FailureCitations: 22 Tags: ai-safety, benchmark, deception-failure | 2025-02-16 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R2 (94%) | 22 |
| Compromising Honesty and Harmlessness in Language Models via Deception Attacks Francesca Carlon, Laur猫ne Vaugrante, Maluna Menke, Thilo Hagendorff Published: 2025-02-12Area: Deception & FailureCitations: 13 Tags: ai-safety, deception-failure, empirical | 2025-02-12 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 13 |
| Detecting Strategic Deception Using Linear Probes Bilal Chughtai, Marius Hobbhahn, Nicholas Goldowsky-Dill, Stefan Heimersheim Published: 2025-02-05Area: Deception & FailureCitations: 36 Tags: ai-safety, deception-failure, empirical | 2025-02-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 36 |
| The Energy Loss Phenomenon in RLHF: A New Perspective on Mitigating Reward Hacking Dacheng Tao, Lefei Zhang, Liang Ding, Sen Zhang Published: 2025-01-31Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-01-31 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 12 |
| Deception in LLMs: Self-Preservation and Autonomous Goals in Large Language Models Johannes Scholl, Sigurd Schacht, Sudarshan Kamath Barkur Published: 2025-01-27Area: Deception & FailureCitations: 15 Tags: ai-safety, deception-failure, empirical | 2025-01-27 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (92%) | 15 |
| Information-theoretic Distinctions Between Deception and Confusion Robin Young Published: 2025-01-27Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, theoretical | 2025-01-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (94%) | - |
| MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking Caleb Biddulph, David Elson, David Lindner, Ian Goodfellow Published: 2025-01-22Area: Deception & FailureCitations: 10 Tags: ai-safety, deception-failure, empirical | 2025-01-22 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 10 |
| Tell me about yourself: LLMs are aware of their learned behaviors Anna Sztyber-Betley, James Chua, Jan Betley, Mart铆n Soto Published: 2025-01-19Area: Deception & FailureCitations: 59 Tags: ai-safety, deception-failure, empirical | 2025-01-19 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (93%) | 59 |
| Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment Chaoqi Wang, Chen Zhu, Hao Ma, Jiayi Liu Published: 2025-01-16Area: Deception & FailureCitations: 25 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-01-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 25 |
| Are DeepSeek R1 And Other Reasoning Models More Faithful? James Chua, Owain Evans Published: 2025-01-14Area: Deception & FailureCitations: 40 Tags: ai-safety, deception-failure, empirical | 2025-01-14 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 40 |
| Lies, Damned Lies, and Distributional Language Statistics: Persuasion and Deception with Large Language Models Benjamin K. Bergen, Cameron R. Jones Published: 2024-12-22Area: Deception & FailureCitations: 16 Tags: ai-safety, deception-failure, survey | 2024-12-22 | Deception & Failure | ai-safety, deception-failure, survey | E6 / R4 (94%) | 16 |
| Towards Safe and Honest AI Agents with Neural Self-Other Overlap Cameron Berg, Diogo Schwerz de Lucena, Judd Rosenblatt, Marc Carauleanu Published: 2024-12-20Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2024-12-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 5 |
| Alignment Faking in Large Language Models Akbir Khan, Benjamin Wright, Buck Shlegeris, Carson Denison Published: 2024-12-18Area: Deception & FailureCitations: 160 Tags: ai-safety, alignment-training, deception-failure, empirical | 2024-12-18 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 160 |
| Concept-ROT: Poisoning Concepts in Large Language Models with Model Editing David Shriver, Keltin Grimes, Marco Christiani, Marissa Connor Published: 2024-12-17Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical | 2024-12-17 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (97%) | 6 |
| Frontier Models are Capable of In-context Scheming Alexander Meinke, Bronson Schoen, J脙漏r脙漏my Scheurer, Marius Hobbhahn Published: 2024-12-06Area: Deception & FailureCitations: 153 Tags: ai-safety, deception-failure, empirical | 2024-12-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R5 (96%) | 153 |
| Noise Injection Reveals Hidden Capabilities of Sandbagging Language Models Cameron Tice, Fedor Ryzhenkov, Felix Hofst盲tter, Jacob Haimes Published: 2024-12-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical | 2024-12-02 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 8 |
| Linear Probe Penalties Reduce LLM Sycophancy Henry Papadatos, Rachel Freedman Published: 2024-12-01Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-12-01 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 18 |
| Sycophancy in Large Language Models: Causes and Mitigations Lars Malmqvist Published: 2024-11-22Area: Deception & FailureCitations: 71 Tags: adversarial-robustness, ai-safety, deception-failure, survey | 2024-11-22 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, survey | E5 / R3 (96%) | 71 |
| Mitigating Sycophancy in Decoder-Only Transformer Architectures: Synthetic Data Intervention Libo Wang Published: 2024-11-15Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2024-11-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 5 |