Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 211 papers (page 1 of 8)路 49 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Hidden Incentives for Auto-Induced Distributional Shift David Krueger, Jan Leike, Tegan Maharaj Published: 2020-09-19Area: Deception & FailureCitations: 56 Tags: ai-safety, deception-failure, empirical | 2020-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 56 |
| Goal Misgeneralization in Deep Reinforcement Learning David Krueger, Jack Koch, Jacob Pfau, Laurent Orseau Published: 2021-05-28Area: Deception & FailureCitations: 115 Tags: ai-safety, deception-failure, empirical | 2021-05-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 115 |
| The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models Alexander Pan, Jacob Steinhardt, Kush Bhatia Published: 2022-01-10Area: Deception & FailureCitations: 261 Tags: ai-safety, deception-failure, empirical | 2022-01-10 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R5 (98%) | 261 |
| Is Power-Seeking AI an Existential Risk? Joseph Carlsmith Published: 2022-06-16Area: Deception & FailureCitations: 129 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E4 / R3 (94%) | 129 |
| The Alignment Problem from a Deep Learning Perspective Lawrence Chan, Richard Ngo, S枚ren Mindermann Published: 2022-08-30Area: Deception & FailureCitations: 263 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 263 |
| Defining and Characterizing Reward Hacking David Krueger, Dmitrii Krasheninnikov, Joar Skalse, Nikolaus H. R. Howe Published: 2022-09-27Area: Deception & FailureCitations: 96 Tags: ai-safety, deception-failure, theoretical | 2022-09-27 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (97%) | 96 |
| Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals Jonathan Uesato, Mary Phuong, Ramana Kumar, Rohin Shah Published: 2022-10-04Area: Deception & FailureCitations: 114 Tags: ai-safety, deception-failure, empirical | 2022-10-04 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R4 (95%) | 114 |
| Circumventing interpretability: How to defeat mind-readers Lee Sharkey Published: 2022-12-21Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, interpretability, position | 2022-12-21 | Deception & Failure | ai-safety, deception-failure, interpretability, position | E5 / R3 (93%) | 5 |
| Conditioning Predictive Models: Risks and Strategies Adam S. Jermyn, Evan Hubinger, Johannes Treutlein, Kate Woolverton Published: 2023-02-02Area: Deception & FailureCitations: 8 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2023-02-02 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (94%) | 8 |
| Characterizing Manipulation from AI Systems Alan Chan, David Krueger, Henry Ashton, Micah Carroll Published: 2023-03-16Area: Deception & FailureCitations: 66 Tags: ai-safety, deception-failure, theoretical | 2023-03-16 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R4 (93%) | 66 |
| Hoodwinked: Deception and Cooperation in a Text-Based Game for Language Models Aidan O'Gara Published: 2023-07-05Area: Deception & FailureCitations: 51 Tags: ai-safety, deception-failure, empirical | 2023-07-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 51 |
| Deceptive Alignment Monitoring Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Deception & FailureCitations: 14 Tags: ai-safety, alignment-training, deception-failure, position | 2023-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, position | E4 / R3 (95%) | 14 |
| Simple synthetic data reduces sycophancy in large language models Da Huang, Denny Zhou, Jerry Wei, Quoc V. Le Published: 2023-08-07Area: Deception & FailureCitations: 112 Tags: ai-safety, deception-failure, empirical | 2023-08-07 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 112 |
| AI deception: A survey of examples, risks, and potential solutions Aidan O'Gara, Dan Hendrycks, Michael Chen, Peter S. Park Published: 2023-08-28Area: Deception & FailureCitations: 265 Tags: ai-safety, deception-failure, survey | 2023-08-28 | Deception & Failure | ai-safety, deception-failure, survey | E6 / R4 (99%) | 265 |
| Towards Understanding Sycophancy in Language Models Amanda Askell, David Duvenaud, Da Yan, Esin Durmus Published: 2023-10-20Area: Deception & FailureCitations: 553 Tags: ai-safety, deception-failure, empirical | 2023-10-20 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 553 |
| Personas as a Way to Model Truthfulness in Language Models Abulhair Saparov, He He, Javier Rando, Najoung Kim Published: 2023-10-27Area: Deception & FailureCitations: 41 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 41 |
| Preventing Language Models From Hiding Their Reasoning Fabien Roger, Ryan Greenblatt Published: 2023-10-27Area: Deception & FailureCitations: 30 Tags: ai-safety, deception-failure, empirical | 2023-10-27 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (95%) | 30 |
| Large Language Models can Strategically Deceive their Users when Put Under Pressure J茅r茅my Scheurer, Marius Hobbhahn, Mikita Balesni Published: 2023-11-09Area: Deception & FailureCitations: 101 Tags: ai-safety, deception-failure, empirical | 2023-11-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 101 |
| Scheming AIs: Will AIs Fake Alignment During Training in Order to Get Power? Joe Carlsmith Published: 2023-11-14Area: Deception & FailureCitations: 59 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2023-11-14 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E6 / R3 (94%) | 59 |
| Honesty Is the Best Policy: Defining and Mitigating AI Deception Francesca Toni, Francesco Belardinelli, Francis Rhys Ward, Tom Everitt Published: 2023-12-03Area: Deception & FailureCitations: 48 Tags: ai-safety, deception-failure, theoretical | 2023-12-03 | Deception & Failure | ai-safety, deception-failure, theoretical | E4 / R2 (93%) | 48 |
| Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking Adam Fisch, Ahmad Beirami, Alekh Agarwal, Alex D'Amour Published: 2023-12-14Area: Deception & FailureCitations: 147 Tags: ai-safety, deception-failure, empirical | 2023-12-14 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | 147 |
| The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation Brian S. Lin, Han Qiu, Rongwu Xu, Shujian Yang Published: 2023-12-14Area: Deception & FailureCitations: 101 Tags: ai-safety, deception-failure, empirical | 2023-12-14 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 101 |
| Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training Adam Jermyn, Amanda Askell, Ansh Radhakrishnan, Buck Shlegeris Published: 2024-01-10Area: Deception & FailureCitations: 303 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2024-01-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E8 / R3 (97%) | 303 |
| Deception and Manipulation in Generative AI Christian Tarsney Published: 2024-01-20Area: Deception & FailureCitations: 21 Tags: ai-safety, deception-failure, theoretical | 2024-01-20 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R3 (93%) | 21 |
| Feedback Loops With Language Models Drive In-Context Reward Hacking Alexander Pan, Erik Jones, Jacob Steinhardt, Meena Jagadeesan Published: 2024-02-09Area: Deception & FailureCitations: 61 Tags: ai-safety, deception-failure, empirical | 2024-02-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 61 |
| Chain-of-Thought Unfaithfulness as Disguised Accuracy Ana Marasovi膰, Nathan Stringham, Oliver Bentham Published: 2024-02-22Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical | 2024-02-22 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 25 |
| When Your AIs Deceive You: Challenges with Partial Observability of Human Evaluators in Reward Learning Anca Dragan, Davis Foote, Erik Jenner, Leon Lang Published: 2024-02-27Area: Deception & FailureCitations: 13 Tags: ai-safety, deception-failure, theoretical | 2024-02-27 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | 13 |
| Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking Anca Dragan, Cassidy Laidlaw, Shivam Singhal Published: 2024-03-05Area: Deception & FailureCitations: 26 Tags: ai-safety, deception-failure, theoretical | 2024-03-05 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R4 (94%) | 26 |
| Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought Edward Rees, Ethan Perez, Hunar Batra, James Chua Published: 2024-03-08Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical | 2024-03-08 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 25 |
| Regularized Best-of-N Sampling to Mitigate Reward Hacking for Language Model Alignment Kaito Ariu, Kenshi Abe, Tetsuro Morimura, Yuu Jinnai Published: 2024-04-01Area: Deception & FailureCitations: 11 Tags: ai-safety, alignment-training, deception-failure, empirical | 2024-04-01 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (97%) | 11 |