Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant Evan Hubinger, Olli J盲rviniemi Published: 2024-04-25Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-04-25 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E4 / R3 (98%) | 25 |
| Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in Legislation Aishwarya Balasubramanian Sai, Ameet Deshpande, Ashwin Kalyan, Atharvan Dogra Published: 2024-05-07Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2024-05-07 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (94%) | 7 |
| Poser: Unmasking Alignment Faking LLMs by Manipulating Their Internals Caden Juang, Joshua Clymer, Severin Field Published: 2024-05-08Area: Deception & FailureCitations: 7 Tags: ai-safety, alignment-training, benchmark, deception-failure | 2024-05-08 | Deception & Failure | ai-safety, alignment-training, benchmark, deception-failure | E4 / R3 (96%) | 7 |
| An Assessment of Model-On-Model Deception Julius Heitkoetter, Laker Newhouse, Michael Gerovitch Published: 2024-05-10Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2024-05-10 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 4 |
| LLM-Generated Black-box Explanations Can Be Adversarially Helpful Frank Rudzicz, Rohan Ajwani, Shashidhar Reddy Javaji, Zining Zhu Published: 2024-05-10Area: Deception & FailureCitations: 28 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2024-05-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (95%) | 28 |
| The Best of Both Worlds: Toward an Honest and Helpful Large Language Model Chujie Gao, Dongping Chen, Lichao Sun, Qihui Zhang Published: 2024-06-01Area: Deception & FailureCitations: 19 Tags: ai-safety, deception-failure, empirical | 2024-06-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 19 |
| Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits Andis Draguns, Andrew Gritsevskiy, Charlie Rogers-Smith, Christian Schroeder de Witt Published: 2024-06-03Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2024-06-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 5 |
| Injecting Undetectable Backdoors in Obfuscated Neural Networks and Language Models Alkis Kalavasis, Amin Karbasi, Argyris Oikonomou, Grigoris Velegkas Published: 2024-06-09Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, theoretical | 2024-06-09 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | 2 |
| AI Sandbagging: Language Models can Strategically Underperform on Evaluations Felix Hofst脙陇tter, Francis Rhys Ward, Oliver Jaffe, Samuel F. Brown Published: 2024-06-11Area: Deception & FailureCitations: 70 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-06-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 70 |
| Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models Alex Tamkin, Buck Shlegeris, Carson Denison, David Duvenaud Published: 2024-06-14Area: Deception & FailureCitations: 86 Tags: ai-safety, deception-failure, empirical | 2024-06-14 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 86 |
| On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models Chirag Agarwal, Dan Ley, Himabindu Lakkaraju, Sree Harsha Tanneru Published: 2024-06-15Area: Deception & FailureCitations: 20 Tags: ai-safety, deception-failure, empirical | 2024-06-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (93%) | 20 |
| Connecting the Dots: LLMs Can Infer and Verbalize Latent Structure from Disparate Training Data Cem Anil, Dami Choi, Jan Betley, Johannes Treutlein Published: 2024-06-20Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2024-06-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Rethinking harmless refusals when fine-tuning foundation models Diogo Schwerz de Lucena, Florin Pop, Judd Rosenblatt, Michael Vaiana Published: 2024-06-27Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2024-06-27 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs Arjun Panickssery, Asa Cooper Stickland, Sam Bowman, Sara Price Published: 2024-07-04Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2024-07-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 12 |
| Spontaneous Reward Hacking in Iterative Self-Refinement He He, Jane Pan, Samuel R. Bowman, Shi Feng Published: 2024-07-05Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-07-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 18 |
| Large Language Models as Misleading Assistants in Conversation Betty Li Hou, James Aung, Jason Phang, Kejian Shi Published: 2024-07-16Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2024-07-16 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (95%) | 7 |
| Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis Guangliang Liu, Haitao Mao, Jiliang Tang, Kristen Marie Johnson Published: 2024-07-21Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-07-21 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 18 |
| From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning Binbin Lin, Deng Cai, Houqiang Li, Jieping Ye Published: 2024-09-03Area: Deception & FailureCitations: 44 Tags: ai-safety, deception-failure, empirical | 2024-09-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 44 |
| AI-LieDar: Examine the Trade-off Between Utility and Truthfulness in LLM Agents Anubha Kabra, Faeze Brahman, Julia Mendelsohn, Maarten Sap Published: 2024-09-13Area: Deception & FailureCitations: 22 Tags: ai-safety, benchmark, deception-failure | 2024-09-13 | Deception & Failure | ai-safety, benchmark, deception-failure | E4 / R3 (96%) | 22 |
| Language Models Learn to Mislead Humans via RLHF Akbir Khan, Ethan Perez, He He, Jacob Steinhardt Published: 2024-09-19Area: Deception & FailureCitations: 86 Tags: ai-safety, deception-failure, empirical | 2024-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 86 |
| Hidden in Plain Text: Emergence & Mitigation of Steganographic Collusion in LLMs Christian Schroeder de Witt, Dylan Cope, Joan Velja, Nandi Schoots Published: 2024-10-02Area: Deception & FailureCitations: 27 Tags: ai-safety, deception-failure, empirical | 2024-10-02 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (95%) | 27 |
| Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs Leyi Yang, Linsheng Lu, Qi Zhang, Rui Zheng Published: 2024-10-15Area: Deception & FailureCitations: 11 Tags: ai-safety, benchmark, deception-failure | 2024-10-15 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R4 (97%) | 11 |
| Teaching Models to Balance Resisting and Accepting Persuasion Elias Stengel-Eskin, Mohit Bansal, Peter Hase Published: 2024-10-18Area: Deception & FailureCitations: 11 Tags: ai-safety, deception-failure, empirical | 2024-10-18 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 11 |
| On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback Adhyyan Narang, Anca Dragan, Brendan Murphy, Constantin Weisser Published: 2024-11-04Area: Deception & FailureCitations: 44 Tags: ai-safety, deception-failure, empirical | 2024-11-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (93%) | 44 |
| Mitigating Sycophancy in Decoder-Only Transformer Architectures: Synthetic Data Intervention Libo Wang Published: 2024-11-15Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2024-11-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 5 |
| Sycophancy in Large Language Models: Causes and Mitigations Lars Malmqvist Published: 2024-11-22Area: Deception & FailureCitations: 71 Tags: adversarial-robustness, ai-safety, deception-failure, survey | 2024-11-22 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, survey | E5 / R3 (96%) | 71 |
| Linear Probe Penalties Reduce LLM Sycophancy Henry Papadatos, Rachel Freedman Published: 2024-12-01Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-12-01 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 18 |
| Noise Injection Reveals Hidden Capabilities of Sandbagging Language Models Cameron Tice, Fedor Ryzhenkov, Felix Hofst盲tter, Jacob Haimes Published: 2024-12-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical | 2024-12-02 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 8 |
| Frontier Models are Capable of In-context Scheming Alexander Meinke, Bronson Schoen, J脙漏r脙漏my Scheurer, Marius Hobbhahn Published: 2024-12-06Area: Deception & FailureCitations: 153 Tags: ai-safety, deception-failure, empirical | 2024-12-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R5 (96%) | 153 |
| Concept-ROT: Poisoning Concepts in Large Language Models with Model Editing David Shriver, Keltin Grimes, Marco Christiani, Marissa Connor Published: 2024-12-17Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical | 2024-12-17 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (97%) | 6 |