Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Deception and Manipulation in Generative AI Christian Tarsney Published: 2024-01-20Area: Deception & FailureCitations: 21 Tags: ai-safety, deception-failure, theoretical | 2024-01-20 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R3 (93%) | 21 |
| Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training Adam Jermyn, Amanda Askell, Ansh Radhakrishnan, Buck Shlegeris Published: 2024-01-10Area: Deception & FailureCitations: 303 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2024-01-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E8 / R3 (97%) | 303 |
| Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking Adam Fisch, Ahmad Beirami, Alekh Agarwal, Alex D'Amour Published: 2023-12-14Area: Deception & FailureCitations: 147 Tags: ai-safety, deception-failure, empirical | 2023-12-14 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | 147 |
| The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation Brian S. Lin, Han Qiu, Rongwu Xu, Shujian Yang Published: 2023-12-14Area: Deception & FailureCitations: 101 Tags: ai-safety, deception-failure, empirical | 2023-12-14 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 101 |
| Honesty Is the Best Policy: Defining and Mitigating AI Deception Francesca Toni, Francesco Belardinelli, Francis Rhys Ward, Tom Everitt Published: 2023-12-03Area: Deception & FailureCitations: 48 Tags: ai-safety, deception-failure, theoretical | 2023-12-03 | Deception & Failure | ai-safety, deception-failure, theoretical | E4 / R2 (93%) | 48 |
| Scheming AIs: Will AIs Fake Alignment During Training in Order to Get Power? Joe Carlsmith Published: 2023-11-14Area: Deception & FailureCitations: 59 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2023-11-14 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (94%) | 59 |
| Large Language Models can Strategically Deceive their Users when Put Under Pressure J茅r茅my Scheurer, Marius Hobbhahn, Mikita Balesni Published: 2023-11-09Area: Deception & FailureCitations: 101 Tags: ai-safety, deception-failure, empirical | 2023-11-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 101 |
| Personas as a Way to Model Truthfulness in Language Models Abulhair Saparov, He He, Javier Rando, Najoung Kim Published: 2023-10-27Area: Deception & FailureCitations: 41 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 41 |
| Preventing Language Models From Hiding Their Reasoning Fabien Roger, Ryan Greenblatt Published: 2023-10-27Area: Deception & FailureCitations: 30 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (95%) | 30 |
| Towards Understanding Sycophancy in Language Models Amanda Askell, David Duvenaud, Da Yan, Esin Durmus Published: 2023-10-20Area: Deception & FailureCitations: 553 Tags: ai-safety, deception-failure, empirical | 2023-10-20 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 553 |
| AI deception: A survey of examples, risks, and potential solutions Aidan O'Gara, Dan Hendrycks, Michael Chen, Peter S. Park Published: 2023-08-28Area: Deception & FailureCitations: 265 Tags: ai-safety, deception-failure, survey | 2023-08-28 | Deception & Failure | ai-safety, deception-failure, survey | E6 / R4 (99%) | 265 |
| Simple synthetic data reduces sycophancy in large language models Da Huang, Denny Zhou, Jerry Wei, Quoc V. Le Published: 2023-08-07Area: Deception & FailureCitations: 112 Tags: ai-safety, deception-failure, empirical | 2023-08-07 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 112 |
| Deceptive Alignment Monitoring Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, position | 2023-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, position | E4 / R3 (95%) | 14 |
| Hoodwinked: Deception and Cooperation in a Text-Based Game for Language Models Aidan O'Gara Published: 2023-07-05Area: Deception & FailureCitations: 51 Tags: ai-safety, deception-failure, empirical | 2023-07-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 51 |
| Characterizing Manipulation from AI Systems Alan Chan, David Krueger, Henry Ashton, Micah Carroll Published: 2023-03-16Area: Deception & FailureCitations: 66 Tags: ai-safety, deception-failure, theoretical | 2023-03-16 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R4 (93%) | 66 |
| Conditioning Predictive Models: Risks and Strategies Adam S. Jermyn, Evan Hubinger, Johannes Treutlein, Kate Woolverton Published: 2023-02-02Area: Deception & FailureCitations: 8 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2023-02-02 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (94%) | 8 |
| Circumventing interpretability: How to defeat mind-readers Lee Sharkey Published: 2022-12-21Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, interpretability, position | 2022-12-21 | Deception & Failure | ai-safety, deception-failure, interpretability, position | E5 / R3 (93%) | 5 |
| Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals Jonathan Uesato, Mary Phuong, Ramana Kumar, Rohin Shah Published: 2022-10-04Area: Deception & FailureCitations: 114 Tags: ai-safety, deception-failure, empirical | 2022-10-04 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R4 (95%) | 114 |
| Defining and Characterizing Reward Hacking David Krueger, Dmitrii Krasheninnikov, Joar Skalse, Nikolaus H. R. Howe Published: 2022-09-27Area: Deception & FailureCitations: 96 Tags: ai-safety, deception-failure, theoretical | 2022-09-27 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (97%) | 96 |
| The Alignment Problem from a Deep Learning Perspective Lawrence Chan, Richard Ngo, S枚ren Mindermann Published: 2022-08-30Area: Deception & FailureCitations: 263 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 263 |
| Is Power-Seeking AI an Existential Risk? Joseph Carlsmith Published: 2022-06-16Area: Deception & FailureCitations: 129 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E4 / R3 (94%) | 129 |
| The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models Alexander Pan, Jacob Steinhardt, Kush Bhatia Published: 2022-01-10Area: Deception & FailureCitations: 261 Tags: ai-safety, deception-failure, empirical | 2022-01-10 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R5 (98%) | 261 |
| Goal Misgeneralization in Deep Reinforcement Learning David Krueger, Jack Koch, Jacob Pfau, Laurent Orseau Published: 2021-05-28Area: Deception & FailureCitations: 115 Tags: ai-safety, deception-failure, empirical | 2021-05-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 115 |
| Hidden Incentives for Auto-Induced Distributional Shift David Krueger, Jan Leike, Tegan Maharaj Published: 2020-09-19Area: Deception & FailureCitations: 56 Tags: ai-safety, deception-failure, empirical | 2020-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 56 |
| A Two-Step, Multidimensional Account of Deception in Language Models Leonard Dung Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, theoretical | - | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (95%) | - |
| Catch Me If You Can: Rogue AI Detection and Correction at Scale Christoph Reich Published: -Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure | - | Deception & Failure | ai-safety, benchmark, deception-failure | E4 / R3 (94%) | - |
| Delegation to artificial intelligence can increase dishonest behaviour Bramantyo Ibrahim Supriyatno, Clara Bersch, Iyad Rahwan, Jean-Fran莽ois Bonnefon Published: -Area: Deception & FailureCitations: 19 Tags: ai-safety, deception-failure, empirical | - | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (96%) | 19 |
| More Capable Models Are Better At In-Context Scheming Alexander Meinke, Bronson Schoen, Jeremy Scheurer, Marius Hobbhahn Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical, safety-evaluation | - | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R4 (98%) | - |
| Recent Frontier Models Are Reward Hacking Elizabeth Barnes, Lawrence Chan, Sydney Von Arx Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | - | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | - |
| Simple Probes Can Catch Sleeper Agents Alex Tamkin, Carson Denison, David Duvenaud, Ethan Perez Published: -Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | - | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (97%) | - |